这个品类的数据长什么样
小分子化药的质量文档主要来源于药品注册申报资料、生产工艺规程、质量标准、检验报告、偏差处理、变更控制、批生产记录等。这些文档通常以 PDF、Word、Excel 等格式存储,更新频率取决于药品的生命周期阶段,例如研发阶段更新频繁,上市后则主要为年度回顾或变更触发更新。文档结构高度标准化,遵循 GMP/GLP/GSP 等法规要求,包含批次信息、CAS 号、分子式、结构式、纯度、杂质、含量、稳定性数据等核心字段,单位严格遵循药典或行业惯例,如 %、ppm、μg/mL、℃、pH 值等。
这些特征在「知识库检索与召回」这一环带来什么约束
小分子化药质量文档的标准化结构和严谨的数值单位,要求知识库检索必须具备高度的结构化信息识别能力,以区分不同批次、不同检测方法下的同名指标。文档更新的周期性与审计追溯需求,使得知识库需要支持版本管理和历史快照,确保检索结果的时效性与准确性可追溯。此外,法规遵循性对召回结果的完整性提出高要求,任何关键信息的遗漏都可能导致合规风险。对 CAS 号、分子式等特定标识符的精确匹配,以及对纯度、杂质等数值范围的理解,是检索与召回效能的关键。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾上下文完整性与检索粒度,避免长文本稀释关键信息。 |
召回条数 | 前 8–12 条 | 确保涵盖多个潜在相关文档片段,增加召回全面性。 |
相似度阈值 | 0.75–0.85 | 在保证相关性的前提下,过滤掉低质量召回结果。 |
重排返回条数 | 5 条 | 精炼最终呈现结果,聚焦最相关内容,提升用户体验。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型 PDF 或复杂 Excel 文件解析耗时长的场景。 |
maxContext | 4000 token | 确保能容纳多个召回片段的完整上下文及用户查询。 |
容易做错的三处
- 检索结果中出现大量无关的文档片段,原因是分段策略过于粗糙,未能有效识别文档内部的逻辑边界。
- 面对数值范围查询(如“纯度高于 99%”),召回结果无法精确筛选,原因在于切片时未对数值型数据进行结构化识别和索引。
- 文件上传后长时间无响应或解析失败,表现为日志中出现
PARSE_FILE_TIMEOUT错误,原因在于文件体积过大或内容复杂导致解析超时,PARSE_FILE_TIMEOUT_SECONDS参数设置过低。
怎么确认配好了
- 上传一批包含不同批次、不同指标的小分子化药质量文档,查询特定批次的特定指标,检查召回结果是否精确指向对应批次和指标。
- 针对包含数值范围的查询,例如“查找杂质含量低于 0.1% 的批次”,验证召回结果是否能准确过滤并呈现符合条件的文档片段。
- 模拟高并发文件上传,观察文件解析进度和状态,确认无大量解析失败或超时记录,可根据实际文件大小调整
PARSE_FILE_TIMEOUT_SECONDS。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。