这个品类的数据长什么样
小分子化药注册申报资料涉及的数据类型多样,主要来源于临床试验报告、药学研究报告、毒理学研究报告、生产工艺文件等。这些资料通常以 PDF、Word、Excel 等多种非结构化和半结构化文档形式存在,数据更新频率相对较低,主要集中在研发阶段的关键里程碑节点,如临床前研究结束、临床试验各期完成及申报前。文档结构通常遵循国际人用药品注册技术协调会(ICH)的通用技术文件(CTD)格式,具有严格的章节划分和内容要求。字段与单位方面,涉及大量的化学结构式、理化性质参数(如熔点、溶解度)、药代动力学参数(如Cmax、Tmax、AUC)、毒性指标(如LD50)、临床疗效数据(如PFS、OS)等,单位精确且标准化,例如 mg/kg、μg/mL、h、℃。
这些特征在「工作流编排」这一环带来什么约束
小分子化药申报资料的数据特征对工作流编排提出了特定约束。首先,多源异构文档要求工作流具备强大的文档解析和信息抽取能力,以处理不同格式和结构的文本。其次,CTD格式的强结构性意味着需要精确识别文档中的特定章节和子节,并将提取的信息准确关联到相应的申报模块。例如,将临床试验结果与“临床研究总结”模块关联。由于数据更新频率较低,工作流需侧重于历史数据的管理与版本控制,确保引用资料的准确性和一致性。对化学结构式、理化参数等专业字段的识别和提取,则要求工作流能够集成专业解析工具或具备高度定制化的正则表达式匹配能力。单位的标准化则需要工作流在信息抽取后进行单位校验或转换,避免潜在的数据不一致问题,影响后续的合规性审查。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8000 | 确保能够容纳单个CTD章节或关键研究报告的完整上下文,避免信息截断。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型PDF文档(如临床试验报告)的复杂解析,防止因超时导致处理中断。 |
分段长度 | 500–800 字符 | 适应CTD文档中常见的研究报告段落长度,兼顾语义完整性和搜索效率。 |
召回条数 | 前 5 条 | 针对特定查询,在大量申报资料中召回足够的相关段落进行后续分析或生成。 |
相似度阈值 | 0.75 | 平衡召回的准确性和召回率,减少不相关信息的干扰,提高匹配精度。 |
重排返回条数 | 前 3 条 | 在初次召回的基础上,进一步优化排序,确保最相关的核心信息优先呈现。 |
容易做错的三处
- AI对话节点未能接收到文本拼接节点输出的完整信息,这通常是由于文本拼接节点输出的变量名与AI对话节点期望的输入参数名不匹配。
- 将知识库ID作为参数传递到工作流后,知识库搜索节点无法正确使用该ID进行检索,原因在于知识库搜索节点可能只接受预设的知识库配置,或者参数传递的格式与预期不符,导致节点无法识别有效的知识库标识。
- 工作流中的代码运行模块在调用外部模型后,未能实现流式输出,这通常是由于代码模块的输出机制未能与工作流的流式处理能力对接,或者外部模型的API调用方式不支持流式响应。
怎么确认配好了
- 通过模拟提交一份包含关键信息的小分子化药申报资料,观察工作流能否正确解析文档结构,并成功提取出预设的关键字段,如药物名称、CAS号、适应症等。
- 针对特定问题,如“请总结[药物名称]的临床III期疗效数据”,检查工作流中的知识库搜索节点是否能准确召回相关的临床试验报告段落,并验证AI问答节点能否基于召回内容生成准确的答案。
- 测试工作流在处理包含大量图表或复杂表格的文档时的表现,确认信息抽取环节是否能有效识别并处理这些非文本元素,确保关键数据不会遗漏。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。