这个品类的数据长什么样
特钢相关数据主要来自中国特钢企业协会月度报告、钢厂出厂质检报告、下游装备制造企业订单文档、期货交易所品种行情数据。更新节奏覆盖月度、季度及不定期更新。文档结构包含结构化成分表、强度参数表格、长文本研评内容,以及带牌号、规格标注的技术参数页。字段包含屈服强度、抗拉强度(单位MPa)、碳含量(百分比)、产品牌号、截面规格等,部分文档附带批次编号与检测日期。
这些特征在「文档解析与分块」这一环带来什么约束
结构化表格与非结构化文本混排的文档占比高,要求解析环节保留表格的行列关联关系,避免拆分后丢失参数与说明的对应性。特钢参数存在专用单位,解析时需关联参数名与对应单位,防止分块后单位脱离参数主体。多来源、多更新节奏的文档批量上传时,需保留文档原始元数据用于后续溯源。部分文档存在扫描件格式,需额外配置OCR识别模块适配金属材料参数的字体与排版。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 800–1000 字符 | 特钢文档兼具长文本研评与紧凑参数表格,该区间可平衡上下文关联与分块粒度 |
chunk_overlap | 100–150 字符 | 特钢材料参数常伴随前后说明文本,重叠可保留参数与说明的关联关系 |
parse_table_mode | preserve_structure | 特钢文档含大量成分、强度参数表格,保留结构可避免拆分后参数脱离说明 |
parse_ocr_enable | auto | 覆盖可编辑文档与扫描件格式的特钢质检报告、行业月报 |
parse_file_timeout_seconds | 120 秒 | 大型多页特钢产能报告需预留足够解析时长,避免中途中断 |
metadata_extract_fields | ["product_grade", "yield_strength", "batch_number"] | 提取特钢核心参数作为元数据,辅助后续检索匹配 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 上传docx格式文档后,RAG检索结果未包含章节标题。原因是未开启对应配置项,导致解析环节未提取文档结构标题。
- 部署Vllm 0.10版本时,无法从PDF解析结果中提取
product_grade字段。原因是该版本对结构化元数据的字段提取适配存在兼容性问题。 - 分块内容中附带的单位信息未被检索匹配到。原因是分块时未保留参数与单位的关联,或未配置元数据提取规则将单位纳入检索维度。
怎么确认配好了
- 上传一份包含结构化参数表格与章节标题的特钢文档,核对解析后的分块内容是否保留表格结构与章节标题信息。
- 触发单份文档解析任务,检查返回的元数据字段是否包含预设的特钢核心参数项。
- 上传扫描件格式的特钢质检报告,确认解析环节自动启用OCR并完成文本提取。
- 调整分块重叠参数后,对比不同配置下的分块结果,确认材料参数与配套说明文本的关联完整性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。