这个品类的数据长什么样
供应商审计资料主要来源于药企对上游供应商的定期或不定期审计报告、供应商提供的资质文件(如 GMP 证书、生产许可证、产品标准、检验报告)、变更通知以及历史审计整改记录等。这些数据更新频率不一,资质文件通常每年或根据变更情况更新,审计报告则依审计周期而定。文档结构上,审计报告多为结构化或半结构化文档,包含审计发现、缺陷分类、建议整改措施等固定字段;资质文件则格式多样,PDF、扫描件、Word 文档兼有,其中可能内嵌图片形式的章印、签名或图表。字段与单位方面,涉及生产批号、有效期、检验结果(如含量百分比、杂质 ppm 值)、设备校准数据等,单位标准化程度高,但表述可能存在差异。
这些特征在「文档解析与分块」这一环带来什么约束
供应商审计资料的多样性对文档解析提出了多重约束。首先,大量扫描件和内嵌图片的资质文件,要求解析工具具备强大的 OCR(光学字符识别)能力,能准确识别图片中的文本信息,包括复杂的表格和手写批注。其次,审计报告中的结构化数据提取,需要细粒度的分块策略,以确保审计发现、缺陷描述与整改建议等关键信息不被割裂,同时能有效关联。再次,字段与单位的标准化处理,如将不同表述的百分比、ppm 值统一识别,是确保后续知识库检索准确性的基础。此外,历史审计资料的版本管理与增量更新,要求解析流程能识别文档差异,避免重复入库或遗漏重要变更。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500-800 字符 | 兼顾审计报告的段落完整性与检索效率,避免关键信息被过度拆分。 |
重叠长度 | 50-100 字符 | 确保上下文连续性,尤其在审计发现与整改措施的关联性上。 |
OCR_ENABLED | True | 供应商资质文件常包含扫描件与图片信息,需开启 OCR 识别。 |
IMAGE_EMBEDDING_ENABLED | True | 识别内嵌图片中的章印、图表等视觉信息,提升语义理解。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 处理大型审计报告和包含复杂图表的资质文件,预留充足解析时间。 |
CHUNK_STRATEGY | 按段落 | 审计报告多以段落组织,按段落分块能保持语义完整。 |
容易做错的三处
- 解析结果中图片内容缺失或识别错误,现象为相关字段为空或乱码,原因是未开启 OCR 功能或 OCR 引擎识别能力不足。
- 审计报告的关键信息(如缺陷描述和整改建议)被割裂成多个不连贯的分块,导致检索时上下文缺失,原因是
分段长度设置过小。 - 知识库未能识别某些供应商资质文件链接,日志显示“不支持的链接类型”,原因是仅支持特定格式的公共分享链接,例如
https://docs.yuque.com/类型的公开文档。
怎么确认配好了
- 选取包含扫描件和内嵌图片的供应商资质文档,解析后检查文本内容是否完整且准确,特别是图片中的关键信息。
- 选择典型审计报告,解析后检查审计发现、缺陷分类、整改措施等关键段落是否被完整分块,且分块之间保持逻辑连贯。
- 使用包含特定字段和单位(如含量百分比、ppm 值)的文档进行解析,验证字段抽取结果是否正确且单位标准化。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。