这个品类的数据长什么样
偏差与 CAPA (Corrective and Preventive Action) 质量文档主要来源于制药企业的质量管理系统、生产执行系统 (MES) 和实验室信息管理系统 (LIMS)。这些文档通常以 PDF、Word 或扫描件形式存在,结构化程度较高,包含事件描述、调查结果、根本原因分析、纠正措施、预防措施、验证结果等固定字段。更新节奏通常与生产批次或质量事件发生频率相关,可能每日更新,也可能每周或每月更新,但一旦定稿,文档内容修改频率较低。文档中常包含特定术语、缩写以及计量单位,如“批号”、“偏差等级”、“OOS (Out of Specification)”、温度单位“℃”、压力单位“psi”等。
这些特征在「文档解析与分块」这一环带来什么约束
偏差与 CAPA 文档的结构化特性要求解析器能识别并提取关键信息区块,例如事件编号、发生时间、根本原因等,以确保后续检索的精准性。其更新频率与定稿后修改少的特点,意味着初次解析时需要投入足够的资源进行高质量处理,后续增量更新以新增文档为主,对已有文档的重复解析需求较低。文档中包含的行业特定术语和单位,对分块模型理解上下文语义构成挑战,需要避免将专业名词拆散,或者将关键数值与单位分离,影响信息完整性。扫描件的存在则额外增加了 OCR 识别准确性的要求,尤其是对于表格数据和手写批注。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
分段长度 | 500–800 字符 | 确保关键信息(如偏差描述、根本原因)在同一分段内,避免上下文缺失。 |
分段重叠长度 | 100 字符 | 保持上下文连贯性,尤其在跨段落的逻辑关联处。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 应对大型 PDF 或复杂扫描件的 OCR 及结构化解析耗时。 |
OCR_RECOGNITION_MODE | 高精度模式 | 保证扫描件中的专业术语和表格数据识别准确率,降低错误率。 |
maxContext | 3000 token | 确保在 RAG 检索时能涵盖完整的偏差事件描述及相关措施。 |
容易做错的三处
- 上传大尺寸 PDF 文档时,系统提示“偏移量超出范围”。这通常是由于文件体积超过了服务器或代理层配置的
UPLOAD_FILE_MAX_SIZE限制。 - 文档解析后,部分关键字段(如“根本原因”)检索结果为空或不完整。这可能是因为默认分块策略将关键信息拆散,或者 OCR 对文档中特定字体、表格识别不准确。
- 使用 API 上传的文档与通过平台界面上传的文档分块结果不一致。这可能源于 API 调用时未明确指定
chunk_strategy参数,导致使用了默认策略,而平台界面可能采用了特定的、为该品类优化的分块配置。
怎么确认配好了
- 上传具有代表性的偏差与 CAPA 文档,检查知识库中每个分段的内容是否完整且语义连贯,不出现关键信息被截断的情况。
- 对上传的文档执行关键词检索,验证包含批号、OOS、偏差等级等专业术语的查询能够准确召回相关分段。
- 针对包含表格和手写批注的扫描件,检查解析后的文本内容,确保 OCR 识别结果与原文高度一致,特别是数字和专业词汇。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。