这个品类的数据长什么样
CMC(化学、制造与控制)研究文档是新药研发过程中的核心产物,涵盖了从药物合成路线、生产工艺、质量标准到稳定性研究等多个方面。这些文档通常以 PDF、Word 或扫描件形式存在,内容结构化程度不一。早期研发阶段的文档可能包含大量实验记录、图谱和手写批注,结构松散;后期申报文档则更为规范,有明确的章节划分和数据表格。数据更新频率相对较低,主要发生在关键研发节点或变更控制流程中。文档中常出现化学式、单位(如 mg/mL、ppm、℃)、特定术语(如 API、杂质谱、ICH 指南)以及复杂的反应流程图。
这些特征在「上下文与 token」这一环带来什么约束
CMC 研发文档的数据特征直接影响了上下文处理和 token 管理。文档中包含的复杂图谱和表格,在文本化后会产生大量冗余信息或格式错乱,增加了 token 消耗。特定化学术语和单位需要精确识别,才能保证结构化解析的准确性,这要求模型上下文具备足够的语义理解深度。文档更新频率低,意味着知识库需要定期全量或增量更新,每次更新可能涉及大量文档的重新处理,对 token 效率和处理时长提出要求。此外,文档长度普遍较长,单个文档可能超过常规上下文窗口限制,需要高效的分段策略和召回机制,以确保关键信息不被截断或遗漏。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 平衡了长文档信息完整性与单段 token 消耗,减少关键信息被切断的风险。 |
分段重叠长度 | 100–200 字符 | 确保分段边界上下文的连贯性,提高跨段信息召回的准确率。 |
召回条数 | 前 5–8 条 | 考虑到 CMC 文档信息的密度和关联性,增加召回条数有助于覆盖更多相关细节。 |
相似度阈值 | 0.78–0.85 | 针对专业术语和数据密集型文档,设定较高的阈值以确保召回内容的精准性。 |
最大响应tokens | 按实测标定 | 依据实际使用的大模型上下文窗口和预期输出长度,确保回复完整。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 多数 CMC 文档处理时间较长,预留充足时间防止因超时导致处理失败。 |
容易做错的三处
- 知识库检索结果不完整或相关性差,表现为回复中缺少关键数据或流程描述。原因在于
召回条数或相似度阈值设置不当,未能充分捕获文档中的专业信息。 - 上传大尺寸 PDF 文档时系统报错
文件处理超时或UPLOAD_FILE_MAX_SIZE限制。原因是文档处理复杂或文件大小超过系统默认限制,需要调整PARSE_FILE_TIMEOUT_SECONDS或UPLOAD_FILE_MAX_SIZE参数。 - 模型输出内容出现截断,例如报告中的数据表格只显示一部分。此现象通常与
最大响应tokens设置过小有关,导致大模型在生成回复时超出其允许的最大长度。
怎么确认配好了
- 上传典型 CMC 研发文档,检查知识库分段预览,确认分段完整且语义连贯,无关键信息被截断。
- 针对文档中的特定化学结构、工艺步骤或质量标准提问,观察模型回复是否准确引用原文内容,并核对引用原文的
分段长度和召回条数是否符合预期。 - 测试处理不同大小和复杂度的 CMC 文档,监控系统日志,确认无
文件处理超时或内存溢出等错误。 - 模拟实际查询场景,多次测试长文本生成,确保模型输出的回复长度不被截断,且
最大响应tokens配置合理。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。