这个品类的数据长什么样
CMC(化学、制造与控制)研究数据主要来源于药物研发过程中的实验室记录、分析报告、批生产记录和质量控制文件。这些数据更新频率相对较低,通常在药物开发的不同阶段进行归档,例如临床前、临床I期、临床II期和临床III期。文档结构高度规范,遵循ICH(人用药品注册技术要求国际协调会议)Q系列指南,例如ICH Q7(药品GMP指南)和ICH Q11(原料药开发和生产)。数据字段包括但不限于批次号、生产日期、有效期、起始物料信息、中间体规格、成品质量属性(如纯度、含量、杂质)、分析方法(如HPLC、GC-MS)、设备校准记录、偏差处理和变更控制记录。单位涵盖质量(mg, g, kg)、体积(mL, L)、浓度(%, ppm)、温度(℃)、压力(kPa)和时间(min, h)。
这些特征在「多轮对话与提示词」这一环带来什么约束
CMC 数据的规范性与专业性对多轮对话的准确性提出了高要求。严格的文档结构意味着需要精确的知识库分段策略,避免关键信息被截断。低更新频率使得知识库版本管理成为重点,确保引用的数据是最新的批准版本。字段的专业性要求提示词能准确引导用户提问,并理解复杂的术语。例如,用户查询“某批次杂质谱”时,AI需要理解“杂质谱”在CMC语境下的具体含义,并能从对应的分析报告中提取数据。单位的统一性要求对话系统能进行单位转换或明确指出单位,避免混淆。此外,多轮对话中需要记录并跟踪用户对特定批次或分析方法的查询历史,以便在后续对话中提供上下文相关的响应,例如在用户询问完纯度后,继续询问该批次的溶剂残留情况。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 8–12 轮对话 | 确保在复杂CMC查询中保留足够上下文,应对用户多步追问。 |
分段长度 | 800–1200 字符 | CMC文档结构严谨,需保证关键信息单元(如一个分析方法描述或一批次记录)完整。 |
召回条数 | 前 5–7 条 | 增加召回范围,以覆盖可能分散在不同报告中的相关CMC数据。 |
相似度阈值 | 0.78 | 平衡召回率与精确度,过滤掉不相关的专业术语匹配,聚焦核心CMC信息。 |
重排返回条数 | 前 3 条 | 精准筛选与用户查询最相关的CMC报告片段,减少无关信息干扰。 |
温度 | 0.3–0.5 | 保持AI回答的专业性和事实准确性,避免在CMC数据解释中引入不确定性或幻觉。 |
容易做错的三处
- 对话中途响应长度突然变短,返回信息不完整。这通常是由于
max_tokens参数被意外重置或知识库召回内容过长,导致模型在生成完整回复前达到max_tokens限制。 - AI 在处理特定批次号或分析方法查询时,无法定位到正确的数据。这可能是因为知识库分段策略不合理,导致批次号或方法名称被分割,或索引未包含这些关键识别字段。
- 用户输入引导开启后,自定义词库中的内容未能正常触发或引发报错。这可能与自定义词库的格式不符合系统要求,或者词库加载路径
CUSTOM_VOCAB_PATH配置错误有关。
怎么确认配好了
- 进行一系列包含专业术语(如“HPLC 色谱图”、“ICH Q7 指南”)的多轮对话,核对 AI 是否能准确理解并引用知识库中的相关段落,特别关注批次号和分析方法等关键识别信息。
- 测试对话系统在不同轮次下对上下文的保持能力,例如先询问一个批次的纯度,再追问该批次的有效期,确认 AI 能正确关联信息。
- 检查知识库召回结果,确认在CMC查询中,
召回条数和相似度阈值的设置能有效筛选出高质量、强相关的文档片段,避免无关或低质量结果的干扰。 - 通过模拟复杂查询,观察 AI 的回复长度是否稳定,确保不会出现因
max_tokens限制导致回复被截断的情况,必要时调整模型的max_tokens参数。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。