这个品类的数据长什么样
小分子化药的质量文档主要包括原辅料检验标准、中间体控制限度、成品质量标准、批生产记录、批检验记录、稳定性研究报告、偏差处理报告、变更控制文件以及年度产品质量回顾报告等。这些文档通常以 PDF、Word 或扫描件形式存在,结构相对固定,例如质量标准会包含理化性质、鉴别、含量测定、杂质检查等固定字段。数据更新频率较低,主要发生在新药注册、工艺变更、供应商审计或法规更新时。文档中常包含 IUPAC 命名、CAS 号、分子量、熔点、比旋度、吸收光谱等专属字段,以及 ug/mL、ppm、% (w/w) 等特定单位。
这些特征在「引用来源与溯源」这一环带来什么约束
小分子化药质量文档的固定结构和特定字段,要求在引用来源时必须能精准定位到文档的具体章节或表格,避免因泛化引用而导致歧义。较低的更新频率意味着知识库内容更新不宜过于频繁,但一旦更新,则需确保所有关联引用同步刷新。文档中大量的专业术语、化学结构式和计量单位,对文本分段和嵌入模型提出了更高要求,确保模型能正确理解并区分不同实体的含义。此外,对溯源性的高要求,使得每次引用不仅要指向原文,还需能追溯到文档的版本号、修订日期以及审批记录,以满足合规性审查的需求。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 确保包含足够的上下文信息,同时避免单个分段过长导致召回不精确。 |
召回条数 | 前 5 条 | 平衡召回效率与相关性,减少无关信息的干扰。 |
相似度阈值 | 按实测标定 | 小分子化药术语专有性强,需根据实际语料测试,确保召回结果的精确性。 |
重排返回条数 | 前 3 条 | 在召回结果基础上,通过重排模型进一步优化,突出最相关内容。 |
maxContext | 3000 Tokens | 适应文档中可能出现的复杂描述和多步实验流程。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 考虑大型 PDF 文件或扫描件 OCR 处理可能需要较长时间。 |
容易做错的三处
- 模型未回答问题,只引用了原文片段:原因可能是
相似度阈值设置过高,导致召回结果过于稀疏,模型无法从中提炼出有效答案,只能复述原文。 - 部分文档未生成问答对,直接作为原文存储:原因可能是
分段长度或maxContext设置不当,导致文档内容无法被有效切分和理解,或者选用的嵌入模型对特定格式(如复杂表格或图片中的文本)处理能力不足。 - FastGPT 在连接外部应用时提示错误,但在引用中仍能运行:这通常是由于外部连接器的配置问题,例如 API 密钥、回调地址或权限设置不正确,导致系统层面的连接失败,但不影响 FastGPT 内部的引用逻辑。
怎么确认配好了
- 选取一批包含特定化学结构、计量单位和合规要求的质量文档,提问相关问题,检查回答中引用的来源是否精准指向原文的具体段落或表格。
- 通过系统日志或调试界面,核对
PARSE_FILE_TIMEOUT_SECONDS参数在处理大型文件时是否触发超时,根据实际情况调整。 - 对模型生成答案中的专业术语和数据进行人工核查,确保与原始文档中的信息完全一致,特别是分子量、纯度百分比等关键数据。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。