这个品类的数据长什么样
病历质控的质量文档主要包括病历首页、住院志、医嘱单、检验报告、检查报告、手术记录、护理记录、出院小结等。这些文档通常以 PDF、Word 或扫描图片形式存在。数据来源是医院信息系统(HIS)、电子病历系统(EMR)或 PACS 系统,更新频率与患者就诊周期和病程进展高度相关,例如医嘱单可能每日多次更新,出院小结则在患者出院后生成。文档结构通常遵循医疗行业的标准化模板,如国家卫健委发布的病历书写规范。字段包括患者基本信息、诊断、治疗方案、用药、检查结果等,涉及大量医学术语、缩写和数值,单位涵盖毫克(mg)、毫升(ml)、℃、mmHg 等。
这些特征在「文档解析与分块」这一环带来什么约束
病历文档的标准化结构使得文档解析可以依赖预设模板或布局特征进行结构化提取,但扫描件和非结构化文本的存在增加了 OCR 和信息抽取的需求。高更新频率要求知识库具备高效的增量更新机制,以确保质控规则基于最新数据。文档中大量医学术语和缩写对分词和语义理解提出挑战,需要专门的医学词典支持。数值型字段和单位的准确识别是质控的关键,例如用药剂量、检验结果阈值等,这要求分块时能有效保留上下文的完整性,避免关键数值与单位被割裂。分块长度需兼顾上下文完整性和检索效率,过短可能丢失关键信息,过长则影响召回精度。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 兼顾病历条目完整性与检索粒度,避免关键信息被截断。 |
分段重叠长度 | 50–100 字符 | 确保分块边界处的语义连贯性,提高召回率。 |
自定义分段规则 | 定义正则表达式,匹配病历章节标题 | 利用病历结构化特征,如“主诉”、“现病史”、“诊断”等,强制分段。 |
文件类型白名单 | ['pdf', 'docx', 'doc', 'jpg', 'png'] | 覆盖常见的病历文档格式,包括扫描件。 |
OCR 启用 | 是 | 处理扫描病历和图片形式的检验报告,确保内容可解析。 |
解析超时时间 | 300 秒 | 考虑大型病历文档的解析时间,避免因文件过大导致解析失败。 |
容易做错的三处
- 上传 PDF 文档后,搜索测试无结果或显示错误,现象是日志显示
OCR_FAILED或EMPTY_CONTENT。原因可能是 PDF 为扫描件且未启用 OCR 功能,或 OCR 识别质量不佳导致文本内容为空。 - 知识库中导入的 Word 文档,特定医学术语或数值无法被准确检索,现象是召回结果中缺少相关条目。原因可能是默认分词器对医学专有名词支持不足,导致分词错误或语义理解偏差。
- 上传大型病历文档(如包含数百页的住院病案)后,解析过程卡顿或最终解析失败,现象是文件状态停留在“处理中”或显示
PARSING_TIMEOUT。原因可能是解析超时时间设置过短,未能满足大型文件处理所需的时间。
怎么确认配好了
- 上传不同类型(PDF、Word、扫描件)和不同复杂度的病历文档,检查知识库中是否成功生成文档分块。
- 使用病历中的关键医学术语、患者信息或检验结果数值进行搜索测试,核对召回结果的相关性和完整性。
- 对比原始病历文档与解析后的分块内容,检查分块边界是否合理,关键信息(如诊断、用药剂量、单位)是否保持完整。
- 模拟质控场景,输入包含质控规则的查询,验证系统是否能准确召回支持或反驳该规则的病历片段。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。