DTP 药房质量文档的向量模型与索引

DTP药房的质量文档主要包括药品采购记录、入库验收报告、储存养护记录、销售出库凭证、不合格品处理流程、以及各类SOP(标准操作规程)文件。这些文档多以PDF

这个品类的数据长什么样

DTP 药房的质量文档主要包括药品采购记录、入库验收报告、储存养护记录、销售出库凭证、不合格品处理流程、以及各类 SOP(标准操作规程)文件。这些文档多以 PDF、Word 或扫描图片形式存在,部分新生成的数据可能直接是结构化的数据库记录。更新频率相对稳定,通常在药品批次变更、法规更新或内部流程优化时进行,每月或每季度会有批量更新。文档结构严谨,遵循 GSP(药品经营质量管理规范)要求,包含批号、有效期、生产企业、批准文号、储藏条件等关键字段,且常带有明确的计量单位和时间戳。

这些特征在「向量模型与索引」这一环带来什么约束

DTP 药房文档的严谨结构和合规性要求,决定了向量模型与索引在处理时需要高度重视文本切分的逻辑完整性。包含批号、有效期等关键信息的内容块,切分时必须保持其上下文的完整性,避免因断裂导致信息失真或无法溯源。更新频率虽然不高,但每次更新可能涉及大量关联文档,要求索引更新机制能够高效处理批量增量,减少停机时间。扫描件文档需要高质量的 OCR 识别,以确保文本提取的准确性,进而影响向量生成质量。字段与单位的标准化则有利于在向量检索后进行结构化信息提取和交叉验证,对召回结果的准确性提出更高要求。

配置怎么定

配置项建议取法这样取的依据
分段长度500–800 字符确保关键信息(如批号、有效期、药品名称)在切片中保持完整,并兼顾上下文语义。
分段重叠100–150 字符增加相邻切片间的语义关联,提高召回的鲁棒性,尤其对于流程性文档。
召回条数8–12 条在保证覆盖度的同时,限制返回结果数量,减轻后续重排模型负担。
相似度阈值0.75–0.85平衡召回精度与召回率,减少不相关文档的干扰,避免合规性风险。
索引模型渠道text-embedding-ada-002 或 bge-large-zh综合考虑中文语义理解能力、向量维度与计算成本,确保嵌入质量。
PARSE_FILE_TIMEOUT_SECONDS600 秒应对大型 PDF 或扫描件 OCR 识别可能耗时较长的情况。

容易做错的三处

  • 上传文档后,检索结果中重要字段(如药品批号、有效期)缺失或错误。原因在于文本切片时,这些关键信息被错误地分割到不同的块中,导致向量嵌入时语义不完整。
  • 知识库更新后,部分最新上传的文档内容无法被检索到。原因在于索引更新策略未设置为增量更新或更新频率过低,新文档未能及时纳入向量索引。
  • 检索特定法规条款时,返回大量不相关的通用性文档。原因在于向量模型在训练时对生物医药领域的专业术语理解不足,未能准确捕捉到细微的语义差别。

怎么确认配好了

  • 上传一批包含批号、有效期、生产企业等关键信息的DTP药房典型文档,然后使用这些关键信息进行检索,检查召回结果中这些字段的完整性与准确性。
  • 定期向知识库中添加少量更新后的文档,观察索引更新后,这些新文档是否能被及时且准确地检索到,并检查索引更新日志。
  • 使用一份包含行业专业术语和法规条文的测试集进行检索,评估召回结果的相关度,并与人工判断的预期结果进行对比,以此标定 相似度阈值 的合格范围。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。