这个品类的数据长什么样
高值耗材制度文档主要来源于国家及地方医保局、卫健委、药品监督管理局等监管机构发布的政策文件,以及医院内部管理部门制定的实施细则。这类文档更新频率相对稳定,通常在政策发布后进行修订,年度调整或根据特定事件触发。文档结构以规章制度、操作规范、目录清单等形式为主,常见于 PDF、Word 格式。内容涵盖耗材分类、编码、准入标准、采购流程、使用规范、报销规定、不良事件管理等。字段涉及耗材名称、型号、规格、生产厂家、注册证号、医保支付类别、限价、使用科室等,单位多样,如“件”、“套”、“毫升”、“克”或无单位。
这些特征在「文档解析与分块」这一环带来什么约束
高值耗材制度文档的特点对文档解析与分块提出了特定要求。首先,政策文件的权威性和严谨性要求文档解析必须保证内容的完整性和准确性,任何信息缺失或解析错误都可能导致制度理解偏差。其次,文档中大量的表格、清单信息,特别是耗材目录和编码,对结构化数据提取能力是考验,表格数据的正确识别和关联是关键。再者,不同层级的规章制度之间可能存在引用和关联,需要解析工具能够识别文本中的交叉引用,确保知识块的上下文完整性。最后,涉及众多专业术语和缩写,需要解析时能准确识别,避免因词汇歧义造成分块不准确。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 平衡上下文完整性与检索粒度,避免单一知识块过长或过短。 |
重叠长度 | 50–100 字符 | 确保相邻知识块之间有足够上下文联系,提升检索召回率。 |
OCR_ENABLED | True | 许多政策文件是扫描件,需开启 OCR 确保图像文本可识别。 |
TABLE_EXTRACTION_MODE | ROW_BASED | 高值耗材目录多为行式数据,按行解析可保持表格结构完整性。 |
EMBEDDING_MODEL | text-embedding-large | 捕捉复杂政策文本中的语义信息,提升检索准确性。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型政策文件或含有复杂表格的文档,预留充足解析时间。 |
容易做错的三处
- 知识库中表格数据显示不完整或格式错乱,原因在于文档解析时未正确识别表格边界或单元格内容。
- 检索结果中出现大量无关段落,现象是召回条数过多且相关性低,原因在于分块粒度过细,导致上下文信息不足。
- OCR 识别后的中文文本出现乱码,日志中显示
UnicodeDecodeError,原因在于 OCR 引擎未正确处理中文编码。
怎么确认配好了
- 上传典型的高值耗材制度 PDF 文件,检查知识库中分块内容是否完整,特别是表格和清单数据。
- 针对文档中的关键术语和制度条款进行测试问答,评估检索结果的相关性和准确性,核对召回条数是否合理。
- 随机抽取解析后的知识块,检查其上下文是否连贯,是否存在语义断裂或信息缺失,并与原始文档进行比对。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。