这个品类的数据长什么样
生物医药行业的供应商审计,其质量文档主要来源于供应商提供的质量管理体系文件、生产记录、检验报告、变更控制记录、偏差处理报告、CAPA(纠正与预防措施)等。这些文档的更新频率通常遵循供应商的质量管理体系规定,如年度审核、重大变更触发更新,或根据批次生产要求周期性生成。文档结构复杂,多为 PDF 格式的扫描件或电子版,包含大量表格、图示和非结构化文本。字段与单位具有高度专业性,例如批号、有效期、生产日期、检验项目、检测方法、限度、结果、单位(如 ppm、mg/mL、IU/mg)等,并且在不同文档类型中可能存在交叉引用或命名差异。
这些特征在「文档解析与分块」这一环带来什么约束
供应商审计文档的复杂性对文档解析提出了高要求。扫描件中的文字识别(OCR)准确性至关重要,特别是对于包含手写批注或低质量扫描的文档。文档中表格和图示的正确识别与结构化提取是关键,因为这些内容往往承载着核心的质量数据和审计证据。专业术语和计量单位的准确识别,直接影响后续检索的精准度。更新频率的不确定性要求系统能够高效处理增量更新,区分新旧版本。此外,由于文档间的交叉引用,需要确保分块能够保留文档的上下文关联性,避免因过度切分而丢失重要信息,这对于后续的审计问答和溯源至关重要。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 考虑单个审计报告或体系文件可能较大,避免上传失败。 |
分段长度 | 800–1200 字符 | 平衡上下文完整性与检索效率,适应专业文档的长句和段落结构。 |
分段重叠长度 | 150–200 字符 | 确保分段边界上下文的连续性,提高跨段落信息的召回能力。 |
解析策略 | 表格识别优先 | 审计文档中表格数据是关键信息来源,优先保证其结构化提取。 |
OCR_ENABLED | True | 应对大量扫描件或图片形式的审计文档,确保文本内容可被识别。 |
MAX_CHUNKS_PER_FILE | 按实测标定 | 限制单个文件生成的块数,避免文件过大导致内存溢出或处理时间过长。 |
容易做错的三处
- 知识库上传 Excel 文件时,系统仅识别前两列,导致表格中的关键审计数据(如批次、结果、限度等)丢失。原因在于默认解析器可能未针对多列复杂表格进行优化,或未正确配置
表格识别优先策略。 - 上传的 PDF 审计报告内容在检索时出现大量乱码或缺失,尤其是在扫描件部分。现象表明
OCR_ENABLED未设置为 True,或使用的 OCR 引擎对该类文档的识别效果不佳。 - 审计人员提问后,返回的答案缺乏关键上下文,导致无法准确判断问题答案的来源或完整性。这可能是因为
分段长度设置过短,导致关键信息被切割到不同的分段中,或者分段重叠长度不足。
怎么确认配好了
- 上传典型供应商审计文档(包含扫描件、复杂表格、多页文字),检查解析后是否所有文本内容均可被检索,特别是表格中的数据是否被正确提取并结构化。
- 随机抽取文档中的专业术语或关键数据,进行知识库检索,确认返回的分段内容包含完整的上下文信息,且无乱码或缺失。
- 通过 FastGPT 的调试界面查看解析日志,确认
OCR_ENABLED和解析策略配置项是否按预期生效,并检查是否有解析失败或超时的提示。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。