这个品类的数据长什么样
DTP 药房的质量文档主要包括药事管理制度、药品养护记录、冷链设备验证报告、药品收发存台账、不良反应上报流程、GSP(药品经营质量管理规范)符合性文件等。这些文档通常以 PDF、Word 或扫描件形式存在,部分关键数据可能录入内部 ERP 系统。文档更新频率受法规要求、药品批次、设备维护周期等因素影响,例如药品批次记录每日更新,GSP 迎检文档可能季度或年度修订。文档结构多为规范性文本、表格数据与签字页结合,字段涉及药品批号、有效期、存储条件、温湿度记录、检查人员、检查结果等,单位包括摄氏度、百分比、批次号、日期等。
这些特征在「模型接入与配置」这一环带来什么约束
DTP 药房质量文档的特性对模型接入配置产生直接影响。文档更新频率高且数据量大,要求向量存储和索引更新机制具备高效率,以确保召回结果的时效性。大量扫描件和表格的存在,意味着需要针对图片文字识别(OCR)和表格结构化抽取进行优化配置,确保信息准确入库。文档中包含的药品批号、有效期等敏感信息,需要结合权限管理,确保模型在召回时遵循数据安全策略。此外,迎检场景下,对特定条款或记录的精准召回要求模型具备更强的语义理解能力和细粒度匹配能力,相似度阈值的设定需要更为严格,以避免模糊匹配带来的误报。对于时间敏感性强的记录,如温湿度日志,模型需能理解时间序列数据,并在召回中体现其时效性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 适应质量文档中较长的制度性文本和详细记录,保留足够上下文信息。 |
分段重叠长度 | 100–200 字符 | 确保段落间上下文连续性,避免关键信息被切断。 |
召回条数 | 前 5 条 | 迎检场景下,通常需要快速定位少量最相关的文档或条款进行核验。 |
相似度阈值 | 0.78–0.85 | 保证召回结果的高相关性,减少不相关文档的干扰,尤其适用于法规条款匹配。 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 应对大型 PDF 或扫描件的 OCR 解析耗时,避免解析中断。 |
maxContext | 32000 token | 确保模型能处理较长的查询和召回结果,进行综合分析,特别是多条文档内容合并的情况。 |
容易做错的三处
- 现象:模型在查询药品批号时,经常返回不相关的文档,或者重要字段缺失。原因:OCR 识别配置不足,未能有效处理扫描件中的手写批号或特殊字体,导致索引建立不准确。
- 现象:上传大量更新后的药品养护记录后,模型查询结果仍是旧数据。原因:向量存储的索引更新机制未及时触发或配置不当,导致新数据未被纳入检索范围。
- 现象:模型无法区分不同日期或批次的温湿度记录,导致信息混淆。原因:文档分段策略过于粗糙,未充分考虑时间戳或批次号等关键标识符的独立性,影响了细粒度召回。
怎么确认配好了
- 针对典型迎检问题,使用不同的查询语句进行测试,检查召回结果是否包含预期的法规条款或记录。
- 上传包含表格和扫描件的模拟质量文档,检查模型能否准确抽取其中的关键字段和数值,并进行有意义的检索。
- 在文档更新后,立即进行相关查询,核对模型返回结果是否反映最新的文档内容,验证索引更新机制的有效性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。