这个品类的数据长什么样
病历质控相关数据主要来源于医院信息系统(HIS)、电子病历系统(EMR)以及各类医疗规章制度文档。这些数据更新频率相对稳定,规章制度通常以年为周期修订,病历数据则实时产生。文档结构方面,规章制度多为 PDF 或 Word 格式的非结构化文本,包含章节、条款、细则等层级,其中涉及大量医学术语、缩写和特定格式要求。病历数据则包含结构化字段(如诊断、医嘱、手术记录)和非结构化文本(如主诉、现病史),字段名称和单位需严格遵循国家卫健委及医院内部规范,例如“诊断”字段可能包含 ICD-10 编码,“用药剂量”字段需明确单位如mg、ml。
这些特征在「工作流编排」这一环带来什么约束
规章制度的年更新周期决定了知识库的更新策略可采用定期全量或增量更新,避免频繁的数据同步。非结构化制度文档需要进行精细的文本预处理和分块,以确保 RAG 召回的精准性,例如需要识别并保留条款号。病历数据的实时性要求工作流具备低延迟处理能力,以支持在线质控。医学术语和缩写的普遍性,使得在工作流中集成专业词典或术语标准化工具成为必要,以提升模型理解能力。严格的字段与单位要求,则约束了数据解析节点必须能准确提取并验证这些信息,例如确保剂量字段后跟随正确的单位,并在发现不一致时触发异常处理。复杂的工作流可能涉及多个工具调用,例如先调用规则引擎判断合规性,再调用大模型进行自由文本分析。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 800–1200 字符 | 兼顾制度文档的条款完整性与模型上下文窗口限制 |
召回条数 | 前 5 条 | 平衡召回精度与模型处理负担,减少无关信息干扰 |
相似度阈值 | 0.78–0.85 | 确保召回内容与质控问题高度相关,减少误判 |
maxContext | 32k token | 容纳更多召回文档和复杂质控指令,支持深度分析 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 适应大型 PDF 制度文档的解析时间,避免超时中断 |
重排返回条数 | 3 条 | 聚焦最相关的少量信息,提升最终输出的准确性和效率 |
容易做错的三处
- 现象:模型回复中出现大量与问题不相关的制度条款或病历记录。原因:
相似度阈值设置过低或召回条数过多,导致知识库召回了大量低相关性内容。 - 现象:处理复杂病历质控流程时,工作流长时间无响应或最终报错超时。原因:工作流中包含了耗时较长的工具调用或多步骤推理,但未配置足够的
PARSE_FILE_TIMEOUT_SECONDS或后端服务requestTimeout。 - 现象:代码执行节点输出结果正确,但后续的指定回复节点未能引用该结果。原因:代码执行节点输出的变量名与指定回复节点引用的变量名不一致,或者变量作用域未正确配置。
怎么确认配好了
- 针对不同复杂度的质控问题,进行端到端测试,检查模型回复是否准确引用了相关制度条款和病历信息,并确保逻辑推理正确。
- 通过查看工作流的运行日志,确认各个节点(如文档解析、向量召回、工具调用)的执行时间是否在预期范围内,没有出现超时或异常中断。
- 随机抽取多个病历质控场景,模拟真实用户提问,比对模型输出与人工判断结果的一致性,根据业务需求调整
相似度阈值和重排返回条数。 - 检查工作流中所有变量的输入输出,确保数据流转正确,特别是跨节点的数据引用和格式转换无误。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。