这个品类的数据长什么样
中药智能尽调报告的数据来源包括国家药典委员会发布的法定标准文件、中药材种植基地的种植档案、饮片生产企业的生产记录、第三方检测机构的检验报告、行业协会的流通数据报告。更新节奏上,法定标准按固定周期修订,企业内部报告按年度或季度更新,第三方检测报告随抽检批次发布。文档多为混合格式,包含纯文本说明、多页结构化表格、扫描件转写的PDF、内嵌工艺公式的文档。字段包含种植基地信息、采收日期、有效成分含量、重金属与农药残留限值,部分字段附带法定计量单位。
这些特征在「文档解析与分块」这一环带来什么约束
混合格式的文档要求解析模块支持OCR转写、表格结构化提取与公式还原,避免丢失检测数据的排版关联。字段附带法定单位,分块时需保留“有效成分含量+mg/kg”这类完整字段单元,不能拆分指标与单位。文档长度跨度大,短则数页长则数百页,需适配可变长度的分块策略,避免截断关键检测批次信息。法定标准与企业自有报告混排时,需识别文档来源标记,确保分块时不跨类型合并数据。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_OCR_ENABLE | 设为true | 适配扫描件格式的中药材检测报告,还原印刷体与手写体的检测数据 |
PARSE_TABLE_STRUCTURE | 设为true | 保留中药成分检测表格的行列结构,避免字段与单位错位 |
MAX_CHUNK_SIZE | 取800–1200 字符 | 适配中药尽调报告中检测数据块的长度,避免拆分单批次的完整检测信息 |
CHUNK_OVERLAP_RATIO | 取0.15–0.2 | 保留相邻分块的检测批次关联,避免跨块丢失数据上下文 |
PARSE_TIMEOUT_SECONDS | 取600 秒 | 适配单份数百页的尽调报告解析时长,避免中途超时中断 |
UPLOAD_FILE_PARALLEL_LIMIT | 取5–8 个 | 适配多份PDF/docx尽调报告的并行上传解析,提升批量处理效率 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传多份中药尽调PDF后,部分文件解析状态显示
408 Request Timeout。原因:未调整PARSE_TIMEOUT_SECONDS参数,单份千页报告的解析时长超出默认阈值。 - 现象:分块结果中,单批次的重金属残留检测数据被拆分为两个独立块,无法关联对应有效成分指标。原因:
MAX_CHUNK_SIZE取值过小,截断了完整的检测数据块。 - 现象:导入内网confluence中的中药尽调文档时,提取内容为空。原因:未配置内网域名白名单,解析模块无法访问内部文档源,导致无法拉取内容。
怎么确认配好了
- 上传一份扫描件格式的中药检测报告,核对解析结果是否保留表格结构化信息与OCR转写内容,确认
PARSE_OCR_ENABLE与PARSE_TABLE_STRUCTURE参数生效。 - 导入包含多批次检测数据的文档,检查分块结果是否未拆分单批次的完整检测条目,确认
MAX_CHUNK_SIZE与CHUNK_OVERLAP_RATIO的取值适配数据长度。 - 批量上传多份不同格式的尽调文档,确认所有任务均在设定的超时阈值内完成解析,核对
PARSE_TIMEOUT_SECONDS与UPLOAD_FILE_PARALLEL_LIMIT的配置。 - 配置内部访问权限后,导入内网文档源的尽调内容,确认能正常提取完整页面数据。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。