DTP 药房产品的文档解析与分块

DTP药房产品的核心数据来源于药品生产企业的官方产品说明书、药店内部的促销活动文档、患者用药指南以及相关法规文件。这些文档通常以PDF、Word或扫描图片形

这个品类的数据长什么样

DTP 药房产品的核心数据来源于药品生产企业的官方产品说明书、药店内部的促销活动文档、患者用药指南以及相关法规文件。这些文档通常以 PDF、Word 或扫描图片形式存在。更新节奏方面,新药上市、药品说明书修订、促销政策调整会触发数据更新,频率从每月数次到每季度一次不等。文档结构上,药品说明书具有固定的章节划分,如【药品名称】、【适应症】、【用法用量】等。促销活动文档则结构灵活,常包含产品列表、折扣信息和有效期。字段与单位方面,药品剂量常以“mg”、“g”表示,用法用量涉及“次/日”、“片/次”,而价格和折扣则以“元”、“%”为单位。

这些特征在「文档解析与分块」这一环带来什么约束

药品说明书的固定章节结构要求解析时能识别并保留逻辑分段,以确保相关信息聚合。例如,【不良反应】与【注意事项】应保持独立分块,避免交叉,影响咨询准确性。促销活动文档的灵活结构和高更新频率,则要求解析器具备较强的版面自适应能力,能快速处理不同布局,并能高效更新知识库,及时反映最新优惠。图片格式的文档,特别是扫描件,对 OCR 能力提出要求,需确保文字识别的准确性。同时,医学术语和计量单位的准确识别与上下文关联,对于构建精准的问答系统至关重要,需要避免因分块不当导致单位信息丢失或误解。

配置怎么定

配置项建议取法这样取的依据
UPLOAD_FILE_MAX_SIZE50 MBDTP 药房产品说明书及相关文档普遍较大,确保能处理大部分文件。
分段长度800–1200 字符兼顾信息完整性和召回效率,避免单个分块信息过少或过多。
分段重叠长度100–200 字符确保上下文连续性,减少因分块截断导致的信息丢失。
PARSE_FILE_TIMEOUT_SECONDS300 秒应对复杂 PDF 和 OCR 识别的耗时,防止解析超时失败。
ENABLE_OCRTrue考虑到存在大量扫描版药品说明书和图片格式促销文档。
SPLIT_BY_HEADINGTrue利用药品说明书的固定章节结构,提高分块逻辑性。

容易做错的三处

  • 上传文件后知识库内容为空,后台日志显示 Error: OCR failed。这通常是由于图片质量过低或 OCR 引擎配置不当导致文字识别失败。
  • 用户咨询药品用法用量时,回答中出现剂量单位错误或缺失。这通常是由于文档分块时将关键的数字和单位拆开,导致上下文关联性差。
  • 系统对最新促销活动无法进行准确回答,即使文件已上传。这通常是因为解析器未能正确识别促销文档的动态结构,导致关键信息未被有效提取或分块。

怎么确认配好了

  • 随机选取 5 份不同来源、不同格式(PDF、Word、扫描件)的文档,上传后检查知识库中是否生成了对应的分块,并验证分块内容与原文是否一致。
  • 针对上传的药品说明书,检查【适应症】、【不良反应】等关键章节是否被完整且独立地分段,确保没有出现跨章节分块或关键信息缺失的情况。
  • 上传一份包含复杂表格或图片内容的促销活动文档,检查表格数据和图片文字是否被准确识别并纳入分块,验证其召回效果是否符合预期。
  • 通过 API 接口上传一份修订后的药品说明书,检查知识库中对应旧版本的内容是否被正确更新或替换,并验证更新后的分块内容准确性。

问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。