这个品类的数据长什么样
房建工程智能尽调报告的数据主要来源于项目招投标文件、施工图设计文件、造价清单、现场签证单、竣工结算报告等。数据更新随项目阶段推进,立项后逐步生成,竣工后归档定型。文档多为多页PDF,混合结构化表格、技术说明文本与图纸截图,包含建筑面积、工程造价、材料规格、工期等字段,单位多为平方米、元、天、毫米等。
这些特征在「文档解析与分块」这一环带来什么约束
房建工程尽调文档的多页混合结构,要求解析时保留跨页的表格与文本关联,避免拆分时割裂同一工程量清单条目;嵌套式结构化表格包含多单位字段,常规解析易丢失层级关系与单位信息;带数字签名的PDF存在加密或签名层,可能阻断基础OCR读取流程;文档随项目阶段更新,不同版本的字段差异明显,需关联版本标识;长文本技术说明段落边界模糊,需结合行业术语识别自然分段逻辑。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunkSize | 800–1200 字符 | 适配房建工程文档中长文本技术说明与结构化表格的内容密度,避免单块包含过多嵌套表格导致语义断裂 |
chunkOverlap | 100–150 字符 | 保留跨分段的工程量清单条目关联,避免拆分时切断连续的计价项说明 |
PARSE_FILE_TIMEOUT_SECONDS | 600 秒 | 适配多页大型PDF的解析耗时,避免因超时中断复杂文档的解析流程 |
enable_table_parse | 开启 | 精准提取嵌套式工程量清单的层级与字段信息,避免表格内容被打散为无序文本 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 容纳单份大型竣工结算报告类文档,满足房建项目全周期尽调的文档上传需求 |
enable_ocr | 按文档类型触发 | 针对带签名或图片嵌入的PDF启用OCR提取文本,针对纯文本PDF关闭以提升解析效率 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传带数字签名的PDF后,知识库解析结果为空或仅包含少量文本。原因:数字签名层会阻断基础OCR的文本读取路径,未配置针对性OCR触发规则。
- 现象:调用Doc2x工具时返回读取文件错误,报错包含“file read failed”字段。原因:本地部署的pdf-marker服务未正确关联FastGPT的容器网络,导致FastGPT无法访问解析服务端口。
- 现象:上传大型造价清单PDF后,解析结果的表格条目缺失嵌套层级。原因:未开启
enable_table_parse配置,常规文本解析将嵌套表格打散为无序文本块。
怎么确认配好了
- 上传一份带数字签名的房建工程PDF,核对解析结果是否包含完整的表格与文本内容,确认OCR配置是否按文档类型正确触发。
- 查看知识库解析日志,确认未触发超时报错,匹配文档实际解析耗时调整超时配置。
- 检查分段后的文本块,确认工程量清单的嵌套层级被完整保留,验证分段配置适配当前文档结构。
- 上传单份符合项目规模的大型竣工报告,确认上传与解析流程未被中断,验证上传大小配置合理性。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。