这个品类的数据长什么样
普钢智能尽调报告的数据源主要包括钢厂出厂质检报告、供应链供货台账、行业协会供需统计文档。更新节奏随数据源类型有所差异:出厂报告随生产批次实时更新,供货台账按月更新,行业统计文档按周或月度更新。单份文档通常包含批次标识、生产信息、理化检测数据、尺寸参数、合规声明几个部分,批量文档会按批次打包整合。核心字段包括批次号、炉号、抗拉强度、厚度、单卷重量等,抗拉强度单位为兆帕(MPa),厚度单位为毫米(mm),单卷重量单位为吨(t)。
这些特征在「文档解析与分块」这一环带来什么约束
数据源多样带来了解析格式差异:结构化的质检报告包含固定表格,半结构化的供货台账存在字段偏移,非结构化的行业文档无固定格式,需针对性适配解析逻辑。核心字段与单位绑定紧密,拆分时需保留检测项与对应数值、单位的关联关系,避免字段混淆。批量文档的单包体积较大,需支持大文件解析与批量任务调度,同时需避免跨批次的上下文干扰。部分文档存在钢厂自定义的检测项,需保留原始文本的字段完整性,不可强行标准化拆分。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
marker_ocr_batch_size | 4-6 | 普钢文档多为表格型结构化内容,小批量OCR可减少识别错误,避免内存溢出 |
parse_chunk_size | 800-1200 字符 | 普钢文档的理化检测表格单块数据约500-800字符,预留上下文空间保证字段关联完整 |
PARSE_FILE_TIMEOUT_SECONDS | 120 秒 | 单份批量打包的普钢质检报告合集通常需较长解析时间,该取值适配多数批量场景 |
enable_field_binding | 开启 | 普钢文档的字段与数值强关联,开启后可保留检测项与对应数据的绑定关系 |
UPLOAD_FILE_MAX_SIZE | 2000 MB | 批量打包的普钢质检报告合集通常可达1-1.5GB,预留足够上传空间 |
ocr_language | 中文+钢铁专业术语库 | 普钢文档包含大量钢铁行业专业术语,加载对应术语库可提升识别准确率 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:部署v2版本marker后,日志显示
ocr error报错。原因:未加载钢铁行业专业OCR术语库,导致对型钢标识、检测项名称的识别失败。 - 现象:接入大模型后,正常聊天功能正常,但文件解析环节触发报错。原因:未配置
enable_field_binding参数,导致结构化表格的字段与数值拆分后关联丢失,触发大模型解析时的格式校验失败。 - 现象:本地部署4.8.22版本后,文件解析功能失效。原因:未正确配置
UPLOAD_FILE_MAX_SIZE参数,导致批量文档上传时被系统拦截,无法进入解析环节。
怎么确认配好了
- 上传单份普钢出厂质检报告,核对解析后的文本是否保留了批次号、炉号等核心关联标识,确认分块结果未拆分单条完整的理化检测数据。
- 查看OCR识别后的内容,确认专业术语如“抗拉强度”“屈服强度”等未被错认或乱码,验证OCR语言配置的加载状态。
- 上传批量打包的普钢文档合集,检查解析任务的执行状态,确认未因超时触发任务中断。
- 触发结构化表格解析,核对字段与对应数值的绑定关系,确认未出现字段与数据分离的情况。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。