这个品类的数据长什么样
CMC (Chemistry, Manufacturing, and Controls) 研究的质量文档涉及药物从研发到生产全生命周期的数据。数据来源多样,包括实验室分析报告、工艺验证文件、稳定性研究数据、批生产记录、偏差调查报告以及变更控制文件。这些文档通常以 PDF、Word 或结构化数据库的形式存在。更新频率不一,研发阶段可能每周甚至每天有新数据,生产阶段则随批次或变更触发。文档结构高度标准化,遵循 ICH Q 系列指南和各国药监机构要求,包含明确的章节标题、数据表格、图谱和签名页。字段内容涵盖物理化学性质、含量、杂质、溶出度、微生物限度等,单位严谨,如 mg/mL、ppm、ng/mL、℃、kPa。
这些特征在「工具调用与插件」这一环带来什么约束
CMC 质量文档的高度结构化和标准化,使得工具调用需要具备精准识别特定字段和表格内容的能力。例如,提取批次号 Batch No.、生产日期 Manufacture Date 或检验结果 Assay Result 时,需要确保工具能准确解析文档布局。数据更新频率的不一致性,特别是研发阶段的快速迭代,要求工具调用机制能够支持增量更新,并能处理版本控制,避免调用到过时的数据。严格的单位和数值要求,意味着插件在执行计算或数据比对时,必须能够正确识别和处理单位转换,例如将 µg/mL 转换为 mg/L,并对数值精度有高要求。此外,文档通常包含大量图谱和质谱数据,这要求工具具备一定的图像识别或数据嵌入能力,以支持更深层次的分析。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 4096 | CMC文档通常较长,需要较大的上下文窗口来保持连贯性。 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 大型PDF文件解析耗时较长,避免因超时导致解析失败。 |
分段长度 | 800–1200 字符 | 兼顾上下文完整性与检索效率,适应文档中较长的描述性段落。 |
召回条数 | 前 10 条 | 确保能覆盖到 CMC 文档中可能分散在不同章节的关键信息。 |
相似度阈值 | 0.75 | 保证检索结果的相关性,过滤掉不相关的质量标准或实验数据。 |
重排返回条数 | 前 5 条 | 在高相关性结果中进一步精选,聚焦核心数据和结论。 |
容易做错的三处
- 工具调用后返回的字段值为空或格式不正确,现象是输出中缺失关键数据,原因在于文档解析器未能正确识别复杂的表格结构或非标准化的数据表示。
- 在一次提问中按顺序调用多个工具时,后续工具的输入参数引用了前序工具的错误输出,现象是链式调用中断或产生逻辑错误的结果,原因在于中间结果的数据类型或结构不匹配。
- 升级
fastgpt-mcp-server后系统无法启动,现象是服务启动日志中出现端口占用或依赖库缺失错误,原因在于新版本对运行环境或依赖库有特定要求,或配置文件的兼容性问题。
怎么确认配好了
- 上传一份包含典型图表和数据表格的 CMC 报告,检查解析后文档的分段是否合理,关键字段如
批号、含量、杂质限度是否被正确提取。 - 设计包含多个工具调用的复杂问题,例如“查询批号
20230101的某个产品在6个月时的溶出度结果,并与质量标准比对”,验证工具链能按预期顺序执行并给出准确结果。 - 在不同网络环境下,模拟高并发访问,观察工具调用的响应时间是否在可接受范围内,通过系统监控工具确认
PARSE_FILE_TIMEOUT_SECONDS配置是否足以应对。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。