这个品类的数据长什么样
煤化工投研相关数据主要来自行业协会月度公报、上市公司年度/半年度年报、煤化工项目环评报告、专业研报及每日大宗商品价格数据。数据更新节奏差异明显,行业价格数据为每日更新,研报为不定期发布,年报与环评报告按项目进度或季度更新。文档类型涵盖数十页的长文研报、结构化统计表格、可复制文本的官方公告及扫描版行业报告,字段包含产能、开工率、吨产品耗煤量、煤气化效率等,单位多为千克标煤/吨、标方每小时、百分比等行业专属单位。
这些特征在「文档解析与分块」这一环带来什么约束
煤化工投研数据的多类型特征对文档解析与分块环节带来多重约束。长文研报占比高,要求分块需保留章节逻辑,避免跨章节的工艺、产能内容被强制拆分合并;结构化统计表格数量多,需保留原始行列结构,防止字段与对应数值的关联关系丢失;数据更新节奏差异大,增量解析时需区分历史文档与新上传文档的处理规则;行业专属单位与术语较多,解析过程需准确识别并保留,避免专业术语被截断或单位信息丢失;部分文档为扫描版格式,需通过OCR完成文本提取,否则无法获取有效内容。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
chunk_size | 800–1200 字符 | 煤化工专业文档包含长句和专属术语,该区间可保留单段逻辑完整性,避免术语被拆分截断。 |
chunk_overlap | 100–150 字符 | 煤化工研报中工艺、产能等内容存在跨段落关联,重叠长度可覆盖关键术语的前后衔接需求。 |
PARSE_TABLE_STRUCTURE | 开启 | 煤化工文档包含产能、单耗、价格等结构化表格,保留表格结构可避免搜索时丢失字段与数值的对应关系。 |
OCR_LANGUAGE | zh+en | 煤化工文档同时包含中文专业术语和英文技术标注,该配置可准确识别两类文本内容。 |
PARSE_FILE_TIMEOUT_SECONDS | 300 秒 | 单份大型环评报告或年度行业统计报表解析耗时较长,该时长可覆盖多数常规解析场景。 |
PARSE_PDF_USE_OCR | 扫描版PDF强制开启,可复制版PDF关闭 | 煤化工官方公告多为可复制文本,扫描版行业报告需OCR识别,避免解析后内容缺失。 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:上传Excel格式的煤化工产能统计表格后,解析结果仅显示无格式纯文本,表格行列结构丢失。原因:未开启
PARSE_TABLE_STRUCTURE配置,导致结构化表格被直接转为普通文本。 - 现象:搜索导入的煤化工研报PDF时,仅显示OCR Error报错或无匹配结果。原因:扫描版PDF未开启OCR识别,或
chunk_size设置过小,将专业术语拆分后无法形成有效检索单元。 - 现象:在上传文件界面未看到高精度解析选项,无法启用miner-u相关功能。原因:FastGPT版本低于v4.8.0,miner-u功能在该版本后集成到默认解析流程中,或未在系统设置中开启第三方解析插件权限。
怎么确认配好了
- 上传一份煤化工结构化Excel表格,检查解析结果是否保留行列标题与对应数值的对应关系,确认
PARSE_TABLE_STRUCTURE配置生效。 - 上传一份扫描版煤化工行业报告PDF,检查解析结果是否包含完整文本内容,确认OCR配置与语言参数匹配文档内容。
- 发起一次知识库搜索测试,输入煤化工专属术语如“吨烯烃耗煤量”,检查返回结果是否包含对应段落的完整上下文,确认
chunk_overlap与chunk_size配置合理。 - 查看解析任务的日志,确认解析耗时未超过
PARSE_FILE_TIMEOUT_SECONDS设置的时长,无超时报错。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。