这个品类的数据长什么样
抗体偶联药物(ADC)注册申报资料的数据来源广泛且结构复杂。核心数据包括临床前研究报告(药理毒理、药代动力学)、临床试验数据(I、II、III期临床报告、安全性数据、有效性数据)、生产工艺与质量控制文件(CMC,如抗体生产、连接子偶联、药物活性成分合成、制剂生产等)、以及药物稳定性研究报告。这些文档通常以 PDF、Word、Excel 等多种格式存在,其中包含大量图表、结构式和实验数据。数据的更新频率在研发的不同阶段差异显著,早期研发阶段可能数月更新一次,临床试验阶段则可能每周甚至每天有新数据产生。字段与单位具有高度专业性,例如药代动力学报告中的 Cmax (ng/mL)、AUC (ng·h/mL),CMC 文件中的 偶联比 (DAR)、纯度 (%),以及毒理报告中的 剂量 (mg/kg)。
这些特征在「工作流编排」这一环带来什么约束
ADC 资料的复杂性对工作流编排提出了多重约束。首先,多源异构的数据要求工作流具备强大的文件解析和信息抽取能力,需要针对不同文档格式和内容结构配置相应的解析器。其次,高更新频率的数据需要工作流能支持增量更新和版本管理,确保始终处理最新版本的申报资料。第三,专业化的字段与单位要求工作流中的信息抽取节点能够准确识别并标准化这些数据,例如将 ng/mL 统一识别为纳克每毫升。第四,由于申报资料涉及多个部门协作,工作流需要支持多用户权限管理和协同编辑。最后,注册申报资料的严谨性要求工作流具备严格的校验机制,例如对关键数据进行交叉验证,确保数据一致性和准确性,避免因数据错误导致申报失败。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | ADC 资料中常含大型 PDF 文档,解析耗时较长,需要更长的超时设置。 |
分段长度 | 800–1200 字符 | 确保能够捕获完整的实验结果描述或生产工艺步骤,同时避免过长导致语义分散。 |
召回条数 | 前 10 条 | 注册申报资料的关联性要求较高,增加召回条数可以提升关键信息命中率。 |
相似度阈值 | 0.75 | 保证召回结果与查询内容高度相关,过滤掉申报资料中大量非核心信息。 |
重排返回条数 | 前 5 条 | 在提高召回率的同时,通过重排精选出最相关的少量核心信息,提升响应质量。 |
MAX_TEXT_LENGTH_PER_CHUNK | 4000 | 应对 ADC 报告中可能出现的长段落描述,避免截断关键技术细节。 |
容易做错的三处
- 工作流中的代码运行组件报错,显示缺少依赖或环境配置错误。这通常是由于本地部署时,容器环境或虚拟环境未正确安装所有必要的第三方库,或者路径配置不正确。
- 通过 API 调用获取工作流执行过程中工具的输出时,返回的数据结构不符合预期或为空。这往往是由于工具节点的
输出变量名未正确配置,或者 API 请求参数与工作流定义不匹配。 - 在调试工作流时,发现工具调用节点输出了两个思考过程。这可能是因为在配置工具节点时,意外地启用了多路径执行或重复触发了同一工具。
怎么确认配好了
- 上传一份包含复杂图表和表格的 ADC 临床试验报告,检查文件解析器是否能完整提取所有文本内容,并正确识别图表标题和表格数据。
- 针对一份包含关键药代动力学参数(如
Cmax、AUC)的报告,通过工作流抽取这些参数,核对抽取结果的字段名和单位是否与原始文档一致。 - 模拟一个关于“特定 ADC 药物毒性研究”的查询,检查召回结果是否包含所有相关的临床前毒理报告,并评估召回内容的准确性与完整性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。