这个品类的数据长什么样
CMC 研究数据主要来源于药品研发过程中的各类报告与文件,包括实验记录、分析方法验证、稳定性研究、质量标准、生产工艺规程、批生产记录等。这些数据生成于药物研发的不同阶段,从临床前到商业化生产,更新频率相对较低,通常随研发进展或法规要求进行阶段性修订。文档结构复杂,常包含大量表格、图谱、流程图以及专业术语。字段与单位具有高度专业性,例如“主成分含量(%)”、“降解产物(ppm)”、“溶出度(mg/L)”、“晶型(I/II/III)”等,且不同报告之间可能存在术语异构性。
这些特征在「向量模型与索引」这一环带来什么约束
CMC 数据的复杂结构和专业术语对向量模型生成高质量嵌入提出了挑战。文档中嵌入的表格和图谱信息难以直接向量化,可能导致语义丢失。更新频率低意味着需要高效的增量索引策略,避免重复处理大量不变数据。专业术语和单位的异构性要求向量模型具备更强的语义理解能力,能够识别同义词、近义词,并区分不同上下文中相同词汇的含义。例如,“批次”在生产工艺和稳定性研究中具有不同的关注点。此外,文档长度差异大,从几页的分析报告到数百页的申报资料,对分块策略和上下文窗口管理提出了要求,需确保关键信息不被截断,同时避免无关信息引入噪声。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾 CMC 报告中段落的完整性与向量模型上下文窗口的有效利用,避免关键信息被截断。 |
分段重叠 | 100–200 字符 | 确保分段边界上下文的连续性,提高跨段落信息检索的召回率,尤其适用于流程描述。 |
召回条数 | 前 5–8 条 | 考虑到 CMC 问题的复杂性,多召回相关片段可增加大语言模型获取全面信息的概率。 |
相似度阈值 | 按实测标定 | 根据实际数据集的语义相似度分布进行调整,平衡召回率与准确率,避免无关段落干扰。 |
重排返回条数 | 前 3 条 | 在初次召回的基础上,通过重排模型进一步筛选最相关的片段,提升大语言模型回答质量。 |
索引模型 | 阿里-emb3-v2.1 | 需支持中文及专业术语的语义理解,对长文本处理能力有一定要求。 |
容易做错的三处
- 检索结果中包含大量无关的段落,导致大语言模型无法准确回答。原因在于分段策略不合理或相似度阈值设置过低,引入了大量噪声。
- 大语言模型声称未找到相关信息,尽管索引中存在对应文件。原因可能是索引分段过细,关键信息被拆散,或向量模型未能准确捕捉专业术语的语义。
- 部分 CMC 报告中的表格和图谱信息未被有效利用。原因在于当前向量模型对非文本内容的理解能力有限,或预处理阶段未能将这些信息转化为可向量化的形式。
怎么确认配好了
- 选择典型 CMC 咨询问题,在 FastGPT 界面进行测试,检查召回的原始分段是否包含问题所需的关键信息。
- 对比不同
分段长度和分段重叠配置下的检索效果,评估其对关键信息完整性的影响,并据此调整阈值。 - 针对包含专业术语和缩写的问题进行测试,验证向量模型对这些术语的理解能力,可通过观察召回段落的相关性来判断。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。