这个品类的数据长什么样
基建工程投研的数据主要来自行业标准图纸PDF、施工日志Excel、造价清单CSV、招投标公告Word等。更新节奏随项目进度调整,单项目周期内按月或按周更新。文档多带有固定章节结构,包含工程概况、工程量清单、进度计划等模块,字段多带专属单位,如立方米、平方米,部分文档包含扫描图纸与嵌套表格。
这些特征在「文档解析与分块」这一环带来什么约束
固定章节结构要求解析环节保留原文档的章节层级,避免跨章节内容拼接导致语义断裂。嵌套表格与专属工程单位需要解析工具准确识别单元格关联关系,防止数值与对应单位错位。包含扫描图纸的PDF需支持精准OCR识别矢量标注文字,避免工程参数丢失。高频更新的项目文档需适配批量解析的效率要求,避免单文件处理超时影响整体进度。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
ocrEnable | 扫描版图纸PDF设为开启,普通文本PDF设为关闭 | 基建工程文档包含大量扫描版施工图纸,开启OCR可提取图纸内的工程参数与标注文字,普通文本PDF关闭可节省解析资源 |
chunkSize | 800–1200 字符 | 基建工程文档多含长文本的工程量清单与进度说明,该区间可保留单条工程数据的完整语义,避免拆分后数值与单位分离 |
chunkOverlap | 100–150 字符 | 保留相邻分块的重叠内容,避免跨章节的工程逻辑被拆分断裂,适配基建文档的长段落结构 |
excelParseMode | 保留原始表格结构,按行拆分单元格 | 基建工程的造价清单Excel多为嵌套表格,按行拆分可保留每个工程量项的完整字段与单位关联 |
parseTimeout | 600 秒 | 大型基建项目的PDF图纸文件体积较大,600秒的超时时间可避免大文件解析被强制中断 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传造价清单Excel后,检索结果中工程量与单位错位。原因:未配置
excelParseMode为按行拆分单元格,导致解析时丢失单元格与字段的关联关系。 - 现象:扫描版图纸PDF解析后,图纸内的标注文字未被召回。原因:未开启
ocrEnable配置,未触发OCR提取图片内嵌文字。 - 现象:分块后出现单条工程量数据被拆分到两个分块,且单位未跟随数值。原因:未明确分块单位为字符,误用token数量作为分块依据,导致中文语义拆分不连贯。
怎么确认配好了
- 上传单份扫描版施工图纸PDF,查看解析结果中的文字内容,确认OCR提取的标注文字完整。
- 上传造价清单Excel,检查解析后的表格结构,确认每个工程量项的数值与单位关联未断裂。
- 测试不同分块长度的解析效果,对比分块后的语义完整性,调整至符合业务需求的取值。
- 上传大型PDF图纸文件,查看解析任务的状态,确认未出现超时报错。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。