这个品类的数据长什么样
患者援助项目(PAP)中涉及的药物警戒数据,主要来源于患者提交的各类申请表、随访记录、用药日志以及医疗机构出具的诊断报告等。这些文档通常以 PDF 扫描件、图片或结构化电子表格的形式存在。数据更新频率较高,尤其在项目初期或患者用药周期内,可能每周甚至每天都有新的随访或不良反应报告。文档结构多样,包含患者基本信息、用药历史、不良反应描述(症状、发生时间、严重程度)、处理措施、医嘱等。字段单位复杂,例如剂量可能涉及 mg、g、ml,时间涉及 年/月/日、小时、分钟,严重程度描述则多为自由文本。
这些特征在「文档解析与分块」这一环带来什么约束
患者援助项目中多样化的文档来源和结构,对文档解析能力提出了高要求。扫描件和图片格式需要精确的 OCR 识别,以确保文本内容的完整性和准确性。高频更新意味着知识库需要支持增量更新和高效的索引重建。自由文本字段中包含的不良反应描述,需要更细粒度的分块策略,避免关键信息被截断。复杂的字段单位和非标准化的描述,要求分块后能够保留足够的上下文信息,以便后续准确提取和理解。同时,文档中可能包含敏感的患者隐私信息,解析和分块过程需要考虑数据脱敏或权限控制,防止信息泄露。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 50 MB | 患者提交的影像资料和扫描件常导致文件较大,此值可容纳多数情况 |
分段长度 | 300-500 字符 | 多数不良反应描述的详细程度,确保完整捕获症状及关联信息 |
分段重叠长度 | 50 字符 | 保证分段边界上下文连续性,应对跨段落的关键信息关联 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型 PDF 扫描件或图片转文本的 OCR 过程可能耗时较长 |
maxContext | 2000 字符 | 容纳患者用药史、不良反应描述及处理措施等完整信息 |
OCR 引擎模式 | 精确模式 | 确保扫描件和图片中医学术语及剂量信息的识别准确性 |
容易做错的三处
- 知识库导入 PDF 文件后,检索结果中无法正确显示原文档链接或内容。这通常是由于文档解析时未能正确提取元数据或链接信息,或者存储路径配置有误。
- 调用外部工具解析特定格式文档(如飞书多维文档、语雀链接)时,工具返回成功但实际未执行解析。这可能是因为工具接口参数映射错误,或者外部工具本身对特定链接类型有访问限制。
- 导入 Excel 文件后,部分字段内容缺失或错位。这往往是由于 Excel 文件的复杂表头、合并单元格或非标准数据格式导致解析器无法正确识别数据结构。
怎么确认配好了
- 随机抽取不同类型的患者援助文档,上传至知识库,通过预览功能检查文本内容是否完整、无乱码,并验证 OCR 识别的准确性。
- 使用不同关键词进行检索,检查返回的分段内容是否包含完整的关键信息(如不良反应症状、用药剂量),同时观察分段边界是否自然,无语义中断。
- 对比解析前后的文档大小与分段数量,确保大型文件能够被有效处理,且分段数量符合预期,避免出现过少或过多的分段。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。