这个品类的数据长什么样
DTP 药房的质量文档主要包括药事管理制度、药品养护记录、温湿度监测报告、供应商资质证明、批次检验报告、不良反应记录等。这些文档多以 Word、PDF、Excel 等格式存在,部分扫描件以图片形式嵌入。数据更新频率较高,例如温湿度记录每日更新,药品批次信息和供应商资质则随采购和审核周期更新。文档结构相对规范,通常有固定的标题层级、章节编号和表格布局。字段方面,涉及药品通用名、批号、有效期、生产企业、存储条件、检测指标及其单位(如 mg/片、℃、%RH),需要精确识别。
这些特征在「文档解析与分块」这一环带来什么约束
DTP 药房文档的结构化特征要求解析器能准确识别标题、段落和表格,以保持文档语义完整性。频繁的数据更新,特别是温湿度记录和批次信息,对文档的重新解析和索引更新效率提出了要求。文档中嵌入的图片(如扫描件、图表)需要 OCR 能力,并确保文本内容与图片上下文的关联性。药品批号、有效期等关键字段的精确提取,是后续问答准确性的基础,若解析不准,可能导致药品信息错误。此外,不同文档类型(制度、报告、记录)在分块策略上应有所区分,避免将不同语义的段落混淆。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | DTP 药房单份质量文档(如年度审计报告)可能包含大量图片和附件,文件体积较大。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 大型 PDF 或 Word 文档,特别是包含复杂表格和多层级结构的,解析时间较长。 |
分段长度 | 800–1200 字符 | 确保每个分块包含足够上下文,同时避免过长导致信息冗余,影响召回精度。 |
分段重叠长度 | 100 字符 | 维护分块间的语义连续性,防止关键信息被截断。 |
ENABLE_OCR | True | 质量文档中常包含扫描件或图片形式的批次检验报告、签名页,需识别图片中的文本。 |
TABLE_PARSING_STRATEGY | markdown | 药品批次、温湿度记录等数据多以表格形式呈现,转换为 Markdown 更利于后续理解。 |
容易做错的三处
- 现象:部分文档上传后,对话时无法召回表格中的关键药品批次信息。 原因:
TABLE_PARSING_STRATEGY配置未设置为markdown或text,导致表格内容被忽略或解析不正确。 - 现象:更新后的温湿度记录文档上传后,模型仍回答旧数据,或出现
408 Request Timeout错误。 原因:文件尺寸或解析复杂度超出PARSE_FILE_TIMEOUT_SECONDS设定,解析未完成,或未触发文档的重新索引。 - 现象:对话中提及文档内图片内容时,模型无法提供相关信息。 原因:
ENABLE_OCR未开启,或 OCR 服务识别率不足,导致图片中的文本内容未能被提取并索引。
怎么确认配好了
- 上传一份包含复杂表格和扫描件的质量文档,检查其索引状态,并通过
GET /api/v1/vectors/search接口查询该文档内容,验证表格和图片文本是否被正确分块和索引。 - 针对特定药品批号或有效期等关键字段,通过问答测试,验证模型能否准确召回相关信息,并检查召回结果的
chunk_id是否指向正确的文档区域。 - 上传一份更新频率较高的文档(如温湿度记录),观察其再次上传后,问答结果是否能及时反映最新数据,并检查
last_modified字段的更新情况。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。