这个品类的数据长什么样
批记录审核涉及的文档主要为药品的批生产记录、批检验记录等,以及相关的SOP(标准操作规程)、方法学验证报告。这些文档通常以PDF或扫描件形式存在,内容结构化程度较高,包含大量表格数据、特定术语和单位。数据更新频率相对较低,主要发生在新批次生产、工艺变更或法规更新时。文档中字段命名规范,例如“批号”、“生产日期”、“有效期”、“检验结果”等,并严格遵循GMP(药品生产质量管理规范)要求,单位如“mg”、“mL”、“℃”、“%”等精确且一致。
这些特征在「文档解析与分块」这一环带来什么约束
批记录的文档特性对文档解析与分块提出了特定要求。其高度结构化的表格数据需要精确识别,避免解析错误导致关键信息丢失。大量专业术语和特定单位要求解析器具备准确的实体识别能力,防止语义偏差。扫描件的存在意味着需要进行OCR(光学字符识别)处理,且要求高识别准确率以应对潜在的字迹不清或排版问题。文档更新频率低,意味着初期投入解析配置的成本可以分摊到较长的使用周期。对解析结果的准确性要求极高,任何批记录数据的错误解析都可能导致严重的质量风险。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
UPLOAD_FILE_MAX_SIZE | 500 MB | 批记录文档可能包含大量图片或扫描件,文件体积较大。 |
分段长度 | 800–1200 字符 | 兼顾批记录中表格和文本内容的完整性,避免关键信息被截断。 |
分段重叠 | 100–150 字符 | 确保上下文连续性,特别是跨段落的表格或描述性文本。 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | OCR处理大型扫描件或复杂PDF可能耗时较长,防止解析超时。 |
启用表格识别 | true | 批记录大量使用表格记录数据,必须确保表格内容被正确解析。 |
自定义实体提取 | 配置批号、生产日期、有效期等正则表达式 | 精准识别批记录中的关键字段,提高信息提取准确性。 |
容易做错的三处
- 解析日志中出现
slow operation xxxxms且文件上传失败,通常是由于文件体积过大或解析超时,需要检查UPLOAD_FILE_MAX_SIZE和PARSE_FILE_TIMEOUT_SECONDS配置。 - 上传包含图片的
docx文件后,返回结果显示Invalid image fi,原因在于当前解析器对嵌入式图片的识别能力有限,需要预处理图片为文本或单独上传。 - 解析后的文档内容中,表格数据出现错位或缺失,这往往是
分段长度设置不当,导致表格结构被错误切分。
怎么确认配好了
- 上传多种类型(纯文本、带表格、扫描件)的批记录文档,检查解析后的分块内容是否完整保留了原文的结构和关键信息。
- 随机抽取解析后的多个分块,核对其中批号、生产日期、检验结果等关键字段的提取准确性,确保与原文一致。
- 针对解析出的表格数据,验证其行、列对应关系是否正确,尤其是数字和单位的匹配度。
- 模拟实际查询场景,输入与批记录内容相关的专业问题,评估召回结果是否精准指向了文档中的正确分块。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-21,当时的最新发布版本为 FastGPT v4.17.0。