这个品类的数据长什么样
批记录是生物医药生产过程中的核心文件,详细记录了药品生产的每一步操作、物料使用、设备参数、环境条件及质量控制结果。其数据来源主要是生产线上的各类传感器、操作员手工录入、实验报告系统以及历史归档文件。更新频率通常与批次生产周期同步,一个批次结束后即生成一份完整的批记录,少有实时更新。文档结构高度标准化,通常遵循 GMP(良好生产规范)要求,包含固定章节如批号、产品名称、生产日期、工序记录、偏差记录、清场记录、检验结果等。字段类型多样,涵盖数值(如温度 25.0 ± 0.5 ℃、湿度 45 ± 5 %)、文本(如操作规程描述、异常情况说明)、日期时间(如 2023-10-26 14:30:00)、布尔值(如 合格/不合格)。单位标注严格,如毫升 ml、克 g、摄氏度 ℃、相对湿度 %RH。
这些特征在「文档解析与分块」这一环带来什么约束
批记录的高度标准化结构使得基于模板或规则的解析成为可能,但其内部包含大量嵌套信息和表格数据,对精确识别字段边界提出挑战。生产周期性的更新频率意味着单份文档在解析后通常不再变动,可以优先考虑离线批量处理,降低对实时解析性能的要求。文档中严格的单位和数值范围需要解析器具备单位识别和数值校验能力,例如将 25.0 ℃ 与 25.0 g 区分开来。大量图片形式的签名、图表或扫描件,若未进行 OCR 预处理,将导致关键信息丢失。此外,批记录的法律合规性要求任何解析和结构化过程都不能丢失或篡改原始信息,因此对解析的准确性和完整性有极高要求,任何解析错误都可能带来审计风险。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunkOverlapRatio | 0.1 | 批记录中关键信息常以短句形式出现,适当重叠可确保上下文完整性。 |
分段长度 | 500-800 字符 | 批记录单步操作描述通常在数百字符内,此长度可捕获完整操作步骤。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 批记录文件可能较大,包含多页表格和图示,预留充足解析时间。 |
maxContext | 4000 字符 | 确保在召回时能包含批记录中一个完整操作环节的上下文。 |
PDF_OCR_ENABLED | true | 大量批记录为扫描件或包含图片,启用 OCR 确保图片内容可解析。 |
text_splitter_type | recursive_character | 批记录结构复杂,递归字符分割能更好地处理嵌套结构和表格。 |
容易做错的三处
- 现象:上传的批记录文件显示解析失败或索引进度长时间停滞。原因:文件体积过大或内容复杂,超过了
PARSE_FILE_TIMEOUT_SECONDS设定的超时时间,导致解析器中断。 - 现象:解析后的数据中,批记录中的关键数值字段(如
温度、批次量)为空或识别错误。原因:未启用PDF_OCR_ENABLED,或 OCR 质量不佳,导致图片中的文本信息未能被正确提取。 - 现象:召回结果中,特定操作步骤的上下文信息不完整,或相邻步骤被分割到不同块中。原因:
分段长度设置过小,导致语义关联紧密的内容被不合理地切分。
怎么确认配好了
- 选择多份具有代表性的、不同结构和文件类型的批记录进行导入,检查其解析状态是否均为成功。
- 随机抽取解析后的批记录数据块,核对关键字段(如批号、生产日期、关键参数值及其单位)是否与原始文档内容一致且完整。
- 通过搜索功能,输入批记录中的特定操作步骤或异常描述,验证召回结果是否包含完整的上下文信息,并评估召回内容的准确性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。