这个品类的数据长什么样
军工电子智能尽调的数据来源包括军工集团公开年度报告、配套厂商资质文件、行业产业链研报、招投标公告及军用标准文档。更新节奏随文档类型不同,年度报告按财年更新,招投标公告按月度、季度更新,资质文件随承制范围变动同步更新。文档多为PDF格式,部分为扫描件,结构包含结构化参数表格、资质说明段落、产业链产能数据,字段涉及元器件型号、功率、工作温度、供货周期,单位多采用瓦、摄氏度、自然日等多数机构常用的单位。
这些特征在「文档解析与分块」这一环带来什么约束
军工电子尽调文档的特征对解析分块带来多重约束。扫描件资质文件需OCR预处理,会提升解析耗时;结构化参数表格的多列混杂单位,分块时需保留字段关联,避免拆分破坏参数完整性;招投标公告的标段信息分散,需按标段维度分块,不单纯按段落长度划分;部分文档含敏感涉密字段,需在解析时识别标记。长文档的跨章节参数需保留上下文关联,防止关键信息被拆分。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCR_ENABLED | 扫描件文档设为开启,非扫描文档设为关闭 | 军工电子文档含扫描件资质文件时需提取文本,非扫描PDF无需额外OCR步骤 |
PARSE_SEGMENT_LENGTH | 800–1200 字符 | 平衡军工电子短参数字段与长分析段落的分块需求,避免拆分破坏关联信息 |
TABLE_PRESERVE_STRUCTURE | 开启 | 保留参数表格的列结构,防止型号、功率、供货周期等关联字段错位拆分 |
PARSE_CHUNK_OVERLAP | 100–150 字符 | 覆盖跨标段、跨章节的上下文关联,避免关键参数被分块截断 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 适配长文档的OCR与解析耗时,防止因超时导致解析失败 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 覆盖军工电子多标段招投标文档、年度研报的单文件体积需求 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传含内嵌图片或扫描件的PDF文档后,解析结果无对应文本内容,关键参数字段为空。原因:未开启
OCR_ENABLED配置项,或OCR模型未适配军工电子文档中的技术图纸、参数图表。 - 现象:解析后的分块内容出现跨章节拼接,或核心参数被拆分到多个独立分块中。原因:未正确配置
PARSE_SEGMENT_LENGTH与PARSE_CHUNK_OVERLAP,或取值未匹配文档的章节层级结构。 - 现象:在知识库创建流程中,无法选中表格格式的军工电子文档作为解析数据集。原因:未开启表格结构保留配置项,或上传的表格文件格式未被系统识别。
怎么确认配好了
- 上传单份扫描件资质文档,查看解析结果是否包含完整的资质文本与参数字段,确认
OCR_ENABLED配置生效。 - 上传含多列参数的表格文档,核对分块结果是否保留表格的列关联,确认
TABLE_PRESERVE_STRUCTURE配置生效。 - 上传单份长文档,查看解析后的分块是否按章节层级拆分,确认段落深度配置匹配文档结构。
- 查看解析任务的日志,确认未出现超时错误,确认
PARSE_FILE_TIMEOUT_SECONDS配置取值合理。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。