这个品类的数据长什么样
眼科制度数据主要来源于医院内部管理系统、国家及地方卫健委发布的规范性文件、行业协会制定的指南,以及医学期刊发布的临床路径。数据形式以非结构化文档为主,包括 Word 文档、PDF 文件、扫描件和少量电子表格。更新频率相对稳定,国家级或行业级制度通常每年或每数年更新一次,院内SOP可能根据设备更新、技术发展或临床实践反馈进行季度或半年度修订。文档结构上,通常包含目录、章节标题、正文、附件和修订历史。字段与单位方面,常涉及操作步骤、设备型号、药物剂量(如 mg/kg)、时间单位(如 分钟、小时)、成功率指标(如 %)和风险等级。
这些特征在「工作流编排」这一环带来什么约束
眼科制度数据以非结构化文档为主,且更新周期相对较长,决定了工作流编排在数据预处理阶段需要重点关注文档解析与结构化提取。特别是针对扫描件,需要额外的OCR识别步骤。文档修订历史的存在,要求工作流具备版本管理能力,确保问答基于最新或指定版本的制度。制度中包含的特定医学术语和计量单位,如 眼压、视力矫正度数、IOP,使得工作流中的语义理解模块需要专业的词典支持,避免因术语不识别导致召回偏差。此外,制度间可能存在引用关系或互补条款,工作流的知识图谱构建或RAG检索策略需能处理多文档关联查询,例如,一个关于白内障手术的SOP可能引用麻醉科的通用麻醉制度。制度中涉及的步骤和条件逻辑,例如“若患者出现A情况,则执行B步骤”,需要工作流的判断节点能够准确捕获并执行。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 眼科SOP文档多为长篇幅,包含图片和复杂表格,解析耗时较长。 |
maxContext | 8000 字符 | 制度问答需要较长的上下文以理解复杂流程和多条件判断。 |
分段长度 | 300–500 字符 | 兼顾语义完整性和检索效率,避免过度切分导致信息丢失。 |
召回条数 | 前 10 条 | 考虑到制度间可能存在交叉引用,适当增加召回量以提高覆盖。 |
相似度阈值 | 0.78 | 确保召回内容的准确性,减少无关制度的干扰。 |
WORKFLOW_MAX_RUN_TIMES | 100 | 复杂制度问答可能涉及多轮推理或多个辅助工具调用。 |
容易做错的三处
- 工作流执行超时或返回
None:通常是由于文档解析节点超时,或者在循环节点内,后续的文本拼接等操作因上游节点返回空值而失败,例如mcp接口在并发高时返回空。 - 节点连线正确但无法推进到下一步:可能原因在于前置判断节点(
IF节点)的条件表达式配置有误,导致条件始终不满足,流程卡在当前分支。 - 回答内容缺乏特定医学术语或计量单位:指示知识库或工作流的语义理解模块未能有效识别眼科专业词汇,可能需要更新词典或调整
embedding模型。
怎么确认配好了
- 通过上传典型的眼科SOP文档,检查
PARSE_FILE_TIMEOUT_SECONDS配置下所有文档是否都能成功解析,并查看解析后的文本内容是否完整。 - 针对包含多步骤、条件判断的制度,构造复杂查询,验证工作流在不同条件分支下能否正确流转,并检查
WORKFLOW_MAX_RUN_TIMES是否满足最大推理深度。 - 使用包含特定眼科术语和计量单位的提问,例如“白内障术后
IOP超过21 mmHg如何处理”,检查回答中是否准确包含并理解这些专业信息。 - 模拟高并发场景,检查
mcp等外部工具调用节点是否能稳定返回预期结果,避免因并发压力导致None值出现。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。