这个品类的数据长什么样
基因治疗 AAV(腺相关病毒)的注册申报资料,其数据来源广泛且复杂。主要包括临床前研究报告(毒理学、药理学)、CMC(化学制造与控制)文件、临床试验数据(I期、II期、III期),以及非临床研究总结等。这些数据更新频率相对较低,通常在关键研究阶段完成后批量生成。文档结构高度标准化,遵循ICH(国际人用药品注册技术协调会)M4Q模块化通用技术文档(CTD)格式,例如模块2、模块3、模块4、模块5。字段和单位具有严格的行业规范,如剂量单位通常为 vg/kg(病毒基因组/千克),浓度单位为 vg/mL,纯度以百分比表示,而批次号、生产日期、有效期等信息则以特定格式记录。数据中常包含大量图表、色谱图、电泳图等非文本信息。
这些特征在「工作流编排」这一环带来什么约束
基因治疗 AAV 注册申报资料的复杂数据特征,对工作流编排提出了具体要求。首先,标准化的CTD文档结构意味着工作流需要高度结构化的解析能力,例如,能够准确识别并提取模块3中关于生产工艺、质量控制、稳定性研究等关键信息。其次,数据更新频率低但单次数据量庞大,要求工作流具备高效的批量处理能力,避免重复加载和频繁更新。再次,大量的非文本信息(如图表)需要工作流集成图像识别或OCR能力,将其转化为可处理的文本或结构化数据。严格的字段与单位规范,则要求工作流在数据提取后进行严格的校验和标准化处理,确保数据质量。最后,数据敏感性高,对工作流的安全性、审计追踪和版本控制能力有较高要求,确保申报资料的完整性和合规性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 1000-1500 字符 | CTD文档中常见段落长度,兼顾语义完整性与召回效率。 |
召回条数 | 前 8-12 条 | 确保覆盖关键信息,减少无关上下文干扰。 |
相似度阈值 | 0.75 | 平衡召回的准确性与完整性,避免遗漏关键法规要求。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型PDF文件解析耗时较长的情况,避免解析中断。 |
maxContext | 6000 token | 确保LLM能处理基因治疗AAV申报资料的复杂上下文。 |
OCR_ENABLE | true | 处理申报资料中常见的图表、图像等非文本信息。 |
容易做错的三处
- 新建“问题分类”节点后,使用初始化的AI模型“运行”或“保存并发布”时报错,这通常是由于初始模型未适配特定任务或所需API密钥未正确配置。
- 工作流文本内容提取的结果
json为空,原因可能是文件解析器未能正确识别或处理复杂的CTD文档结构,或者文档中存在大量图像导致文本提取失败。 - 工作流全局变量历史记录中,缺少指定组件的输出,这往往是组件配置错误导致数据未正确传递,例如输出字段名不匹配或组件执行失败。
怎么确认配好了
- 选择一份典型的基因治疗 AAV 注册申报资料(如模块3的某个章节),运行工作流并检查文本内容提取节点的输出,确保关键信息(如生产工艺步骤、质控指标)被准确解析。
- 检查工作流中涉及字段校验的节点,输入包含已知错误单位或格式的数据,验证其是否能正确识别并标记异常。
- 使用不同大小和复杂度的 PDF 文档进行测试,观察
PARSE_FILE_TIMEOUT_SECONDS配置下文件解析是否稳定,没有出现超时中断。 - 对工作流进行端到端测试,模拟一个完整的申报资料问答场景,评估AI回复中对 AAV 特有术语和法规的理解与应用水平。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。