这个品类的数据长什么样
高值耗材质量文档主要包括产品注册证、生产许可证、检验报告、风险分析报告、质量管理体系文件(如 ISO 13485 认证)、供应商审计报告、不良事件报告、召回记录、用户反馈等。这些文档多以 PDF、Word、Excel 格式存在,部分扫描件或图片格式。数据更新频率不一,注册证、许可证更新周期较长,可能为数年;检验报告、不良事件报告则可能按批次或事件触发,更新较频繁。文档结构通常包含固定模板,如注册证会有“产品名称”、“型号规格”、“注册证编号”、“生产企业”等字段,检验报告则有“检验项目”、“检验结果”、“判定依据”等。部分关键字段可能涉及专用术语或缩写,且单位表达多样,如“mm”、“cm”、“mg”、“g”、“%”等。
这些特征在「工作流编排」这一环带来什么约束
高值耗材的文档结构化程度高,但格式多样,要求工作流在数据抽取时能同时处理多种文件类型。更新频率差异大,意味着需要灵活的触发机制,例如针对许可证的定期检查与针对不良事件的事件驱动。文档中存在大量专业术语和缩写,对模型理解能力提出较高要求,可能需要定制化的词汇表或领域知识注入。字段与单位的多样性,使得在信息提取后进行标准化处理成为必要环节,以确保后续分析和比对的准确性。此外,部分文档为扫描件,要求工作流具备OCR能力,并能处理OCR识别可能引入的误差。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 200 MB | 高值耗材的文档,特别是包含图片或扫描件的检验报告,文件体积可能较大。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理复杂的PDF或扫描件文档,OCR及文本解析耗时较长,需要充足的超时时间。 |
chunkOverlapRatio | 0.15 | 确保在文档分段时,相邻段落有足够的重叠,以捕捉跨段落的上下文信息,特别是针对描述性强的质量报告。 |
top_k | 8 | 质量文档查询通常需要综合多方面信息,较高的召回条数有助于覆盖全面。 |
rerank_top_n | 3 | 经过初步召回后,精选最相关的少数条目进行重排,提升最终结果的精准度,避免无关信息干扰。 |
similarity_threshold | 0.75 | 质量文档对精确度要求高,设置较高的相似度阈值,过滤掉相关性较低的召回结果。 |
容易做错的三处
- 工作流执行超时,提示
Process timeout。原因通常是文件解析或OCR识别时间过长,PARSE_FILE_TIMEOUT_SECONDS参数设置不足以应对大文件或复杂扫描件。 - 关键字段信息缺失或提取错误,例如注册证编号或生产批次号为空。原因可能是文档格式变化导致预设的正则或模板匹配失败,或者OCR识别误差较大导致字符识别不准确。
- 工作流在特定分支中途停止,未按预期输出 HTML 代码或跳转至下一节点。原因可能是条件判断节点配置错误,导致不满足分支条件而提前终止,或者
指定回复节点未正确配置输出类型。
怎么确认配好了
- 选取不同类型(PDF、Word、扫描件)和不同大小的典型质量文档,运行工作流,检查日志中是否有
Process timeout或其他错误信息。 - 针对关键字段(如产品名称、注册证编号、生产批次、检验结果),分别输入查询,核对模型提取的信息与原始文档内容是否一致,并检查单位和数值是否正确。
- 模拟异常情况,如上传损坏文件或包含模糊文字的扫描件,观察工作流的失败处理机制是否按预期触发,并检查错误提示是否清晰。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。