基因治疗 AAV注册申报资料准备的工作流编排

基因治疗AAV(腺相关病毒)的注册申报资料,其数据来源广泛且复杂。主要包括临床前研究报告(毒理学、药理学)、CMC(化学制造与控制)文件、临床试验数据(I期

这个品类的数据长什么样

基因治疗 AAV(腺相关病毒)的注册申报资料,其数据来源广泛且复杂。主要包括临床前研究报告(毒理学、药理学)、CMC(化学制造与控制)文件、临床试验数据(I期、II期、III期),以及非临床研究总结等。这些数据更新频率相对较低,通常在关键研究阶段完成后批量生成。文档结构高度标准化,遵循ICH(国际人用药品注册技术协调会)M4Q模块化通用技术文档(CTD)格式,例如模块2、模块3、模块4、模块5。字段和单位具有严格的行业规范,如剂量单位通常为 vg/kg(病毒基因组/千克),浓度单位为 vg/mL,纯度以百分比表示,而批次号、生产日期、有效期等信息则以特定格式记录。数据中常包含大量图表、色谱图、电泳图等非文本信息。

这些特征在「工作流编排」这一环带来什么约束

基因治疗 AAV 注册申报资料的复杂数据特征,对工作流编排提出了具体要求。首先,标准化的CTD文档结构意味着工作流需要高度结构化的解析能力,例如,能够准确识别并提取模块3中关于生产工艺、质量控制、稳定性研究等关键信息。其次,数据更新频率低但单次数据量庞大,要求工作流具备高效的批量处理能力,避免重复加载和频繁更新。再次,大量的非文本信息(如图表)需要工作流集成图像识别或OCR能力,将其转化为可处理的文本或结构化数据。严格的字段与单位规范,则要求工作流在数据提取后进行严格的校验和标准化处理,确保数据质量。最后,数据敏感性高,对工作流的安全性、审计追踪和版本控制能力有较高要求,确保申报资料的完整性和合规性。

配置怎么定

配置项建议取法这样取的依据
分段长度1000-1500 字符CTD文档中常见段落长度,兼顾语义完整性与召回效率。
召回条数前 8-12 条确保覆盖关键信息,减少无关上下文干扰。
相似度阈值0.75平衡召回的准确性与完整性,避免遗漏关键法规要求。
PARSE_FILE_TIMEOUT_SECONDS600 秒应对大型PDF文件解析耗时较长的情况,避免解析中断。
maxContext6000 token确保LLM能处理基因治疗AAV申报资料的复杂上下文。
OCR_ENABLEtrue处理申报资料中常见的图表、图像等非文本信息。

容易做错的三处

  • 新建“问题分类”节点后,使用初始化的AI模型“运行”或“保存并发布”时报错,这通常是由于初始模型未适配特定任务或所需API密钥未正确配置。
  • 工作流文本内容提取的结果 json 为空,原因可能是文件解析器未能正确识别或处理复杂的CTD文档结构,或者文档中存在大量图像导致文本提取失败。
  • 工作流全局变量历史记录中,缺少指定组件的输出,这往往是组件配置错误导致数据未正确传递,例如输出字段名不匹配或组件执行失败。

怎么确认配好了

  • 选择一份典型的基因治疗 AAV 注册申报资料(如模块3的某个章节),运行工作流并检查文本内容提取节点的输出,确保关键信息(如生产工艺步骤、质控指标)被准确解析。
  • 检查工作流中涉及字段校验的节点,输入包含已知错误单位或格式的数据,验证其是否能正确识别并标记异常。
  • 使用不同大小和复杂度的 PDF 文档进行测试,观察 PARSE_FILE_TIMEOUT_SECONDS 配置下文件解析是否稳定,没有出现超时中断。
  • 对工作流进行端到端测试,模拟一个完整的申报资料问答场景,评估AI回复中对 AAV 特有术语和法规的理解与应用水平。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。