这个品类的数据长什么样
小分子化药的质量文档通常包括批生产记录、检验报告、稳定性研究报告、偏差处理报告、变更控制文件和年度产品质量回顾等。这些文档多以 PDF、Word 或扫描件形式存在,结构化程度不一。数据更新频率与药品生命周期和生产批次紧密相关,例如批生产记录随批次生成,检验报告随检验结果更新,年度产品质量回顾则每年更新。文档中包含大量专业术语、化合物名称、分析方法代码、设备编号以及具体的数值型数据,如含量(%)、溶出度(mg/L)、杂质(ppm)等,单位严格遵循药典或内部标准。
这些特征在「多轮对话与提示词」这一环带来什么约束
小分子化药质量文档的特点对多轮对话与提示词的构建提出了具体要求。文档中高密度的专业术语和数值型数据要求 RAG 检索模型具备精准匹配能力,避免语义漂移。多轮对话需要维持上下文连贯性,尤其是在追溯特定批次或某个质量参数的历史趋势时。提示词设计需考虑药学工程师的提问习惯,例如针对特定批号的溶出度、某项杂质的限度或特定分析方法的验证情况。同时,由于文档可能存在不同版本或修订,提示词应能引导系统识别并优先使用最新、最权威的版本,以确保回答的准确性和合规性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | 3000 Tokens | 适应多轮对话中较长的上下文追溯需求 |
分段长度 | 800–1200 字符 | 兼顾语义完整性和检索效率,避免切断关键信息 |
召回条数 | 前 10 条 | 确保覆盖相关度较高的文档片段,提高回答准确性 |
相似度阈值 | 0.75 | 过滤掉不相关文档,提高检索结果的精准性 |
重排返回条数 | 前 5 条 | 进一步精选最相关内容,减少模型处理负担 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型质量文档(如年度回顾报告)的解析时间 |
容易做错的三处
- 上传大型 PDF 质量文档时,界面提示“fail to create post presigned ur”,这通常是由于
UPLOAD_FILE_MAX_SIZE参数设置过小,导致文件大小超出限制。 - 在多轮对话中追溯特定批次的检验结果,模型未能给出准确数值,而是泛泛而谈,这可能是因为
召回条数或相似度阈值配置不当,未能召回包含具体数值的关键段落。 - 升级新版本后,文件上传功能报错,日志显示文件传输失败,这可能与 S3 存储配置迁移不完全或权限设置问题有关,导致系统无法正确写入文件。
怎么确认配好了
- 上传一份包含图表和大量专业术语的典型批生产记录 PDF 文件(例如 50MB 大小),确认文件上传成功且内容解析无误。
- 针对一份已知批号的检验报告,提出关于该批号下特定化合物含量或杂质限度的问题,检查模型是否能准确从文档中提取并回答具体数值。
- 连续提出关于某药品不同批次或不同年份的质量趋势问题,验证模型在多轮对话中能否保持上下文一致性,并能准确引用不同文档中的信息。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。