这个品类的数据长什么样
CMC(化学、制造与控制)研究的注册申报资料涉及新药或仿制药从研发到生产的全生命周期数据。其数据来源广泛,包括实验室研究报告、中试生产记录、质量标准与检验报告、稳定性研究数据、工艺验证文件等。这些文档通常以 PDF、Word、Excel 等格式存在,结构化程度不一。数据更新频率较高,尤其在研发早期和临床试验阶段,工艺参数、质量属性和稳定性结果会持续迭代。文档中包含大量专业术语、化学结构式、图表和单位(如 mg/mL、℃、pH 值、HPLC 峰面积),对准确性和一致性要求极高。
这些特征在「引用来源与溯源」这一环带来什么约束
CMC 数据的多样性与复杂性对引用来源与溯源构成挑战。首先,文档格式的异构性要求知识库具备强大的多格式解析能力,以确保所有关键信息都能被有效抽取。其次,数据的高度专业性和单位敏感性,使得在引用时必须精确到具体数值和单位,避免语义模糊。高更新频率则要求知识库能够快速识别并更新关联信息,确保引用的始终是最新版本。此外,由于CMC资料的严谨性,溯源必须能够定位到原始文档的具体页码或段落,甚至具体图表或表格,以满足监管机构对数据完整性和可追溯性的要求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | CMC 报告段落较长,包含多上下文信息,需保持语义完整性。 |
召回条数 | 前 10 条 | 确保覆盖多份相关文档的关键信息,避免遗漏。 |
相似度阈值 | 0.75–0.85 | 既要保证相关性,又要兼顾专业术语的精确匹配。 |
重排返回条数 | 前 5 条 | 在召回基础上精选最相关内容,提升最终引用的准确性。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大型 PDF 文件解析耗时,预留充足时间防止超时中断。 |
UPLOAD_FILE_MAX_SIZE | 200 MB | 应对包含大量图表和扫描件的申报资料文件大小。 |
容易做错的三处
- 引用结果出现大量无关内容或重复信息,原因在于
相似度阈值设置过低,导致召回了语义上不够精确的文档片段。 - 工作流中部分节点无法获取到知识库引用,现象为返回内容中缺少引用信息,原因可能是前置节点对
datasetid变量的传递存在问题,导致知识库检索节点未能正确识别目标数据集。 - 引用结果中缺失关键的数值或单位,原因在于原始文档解析质量不佳,未能准确抽取包含数字和单位的特定表格或图表数据。
怎么确认配好了
- 选择一份包含复杂图表和专业术语的 CMC 报告进行测试,验证引用结果能否精准定位到图表标题或表格数据。
- 上传同一份报告的修订版,确认系统在更新后,引用结果能指向最新版本的内容,并能区分新旧版本差异。
- 模拟提问涉及多个关联文档才能完整回答的问题,检查引用结果是否能同时从不同文档中抽取相关段落,并能溯源到各自的原始文件和页码。
- 针对包含特定化学结构式或公式的文本进行查询,核对引用结果是否能准确呈现这些特殊字符,且能链接回原始出处。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。