这个品类的数据长什么样
CMC 研究的质量文档主要来源于药物研发过程中的实验室记录、分析报告、批生产记录、稳定性研究数据和注册申报资料。这些文档的更新频率相对较低,通常在项目的不同阶段或发生重大变更时进行修订。文档结构高度规范化,遵循 ICH Q 系列指导原则和各国药监机构的要求,例如 CTD(通用技术文档)格式。内容多为结构化与半结构化数据混合,包含大量的实验数据、图谱、表格、SOP(标准操作规程)文本以及批次号、规格、含量、纯度、降解产物等关键字段。单位严格统一,如 mg/mL、℃、小时、ppm 等,且常伴随上下限范围的规定。
这些特征在「模型接入与配置」这一环带来什么约束
CMC 研究文档的规范性对模型接入提出了明确要求。文档中包含大量表格和图谱,需要模型具备强大的多模态处理能力,确保这些非文本信息也能被有效解析和向量化。较低的更新频率意味着模型训练和知识库构建可以采用相对稳定的批处理方式,无需实时增量更新。然而,文档的专业性极高,术语密集,对模型的领域知识和语义理解深度构成挑战,避免泛化模型带来的误解。严格的结构化和半结构化数据要求在数据预处理阶段进行精细的字段提取和实体识别,确保关键质量属性、批次信息和实验参数的准确关联。单位和范围的精确性,决定了模型在问答时必须能正确识别和比较数值,支持基于数值的逻辑推理。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | CMC 文档段落逻辑完整,过短丢失上下文,过长导致单段信息密度低,影响向量召回效果。 |
重叠长度 | 100–200 字符 | 确保相邻分段间的上下文连续性,弥补分段边界可能导致的信息割裂。 |
召回条数 | 前 8–12 条 | CMC 文档中的关键信息通常分散在多个相关段落中,增加召回条数可提高覆盖率,确保相关性高的碎片信息被检索。 |
相似度阈值 | 0.75 | CMC 领域术语精确,高阈值有助于过滤掉语义不相关的结果,提高检索准确性。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大型 CMC 文档(如 CTD 模块)解析耗时较长,增加超时时间可避免解析中断,确保完整文档处理。 |
VECTOR_DIMENSION | 按实测标定 | 向量维度需与所选嵌入模型(如 bge-reranker)输出维度匹配,确保向量空间一致性,避免维度不匹配导致的检索失败。 |
容易做错的三处
- 现象:模型回答只给出 XML 或 JSON 代码块,不渲染图表。原因:
mcp插件配置正确,但模型未被明确指示生成渲染指令,或渲染引擎未能识别模型输出的特定图表描述格式。 - 现象:检索结果重排后,相关性高的文档排序未显著提升,甚至出现
rerank: false状态。原因:重排模型(如bge-reranker)部署后,可能未正确集成到检索流程中,导致其输出未能有效影响最终排序,或模型权重加载异常。 - 现象:模型对批次号、含量等关键字段的问答出现数值错误或单位混淆。原因:文档解析阶段未能准确识别和提取 CMC 文档中的数值型实体及其单位,导致模型在生成回答时缺乏精确的上下文信息。
怎么确认配好了
- 上传典型 CMC 文档,测试其解析时长,确认在
PARSE_FILE_TIMEOUT_SECONDS限制内完成,并检查解析后的文本内容是否完整无误,尤其是表格和图注信息。 - 针对文档中的关键质量属性、批次信息、实验数据等提出问答,验证模型能否精确识别并引用相关数值和单位,检查问答结果是否与文档内容一致,并能进行简单的数值比较。
- 执行一系列包含专业术语和概念的检索,观察
召回条数和相似度阈值设定下,模型召回的文档片段是否覆盖了所有相关信息,并通过重排返回条数检查重排结果的合理性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。