这个品类的数据长什么样
焦炭研报数据主要来自期货交易所焦炭品种日报、中国炼焦行业协会月度报告、券商专题研报及现货贸易商周报。数据更新节奏随类型不同:现货类每日更新,行业报告每月发布,券商研报随行业政策、供需变化触发更新。文档多为PDF格式,包含供需分析、价格走势、产区与港口数据,核心字段包含焦炭出厂价格(单位:元/吨)、港口库存(单位:万吨)、产能规模(单位:万吨/年),部分文档附带不同产区的指标对比表格。
这些特征在「文档解析与分块」这一环带来什么约束
不同来源的文档格式差异明显,可编辑PDF的文本提取易出现排版错乱,扫描版文档需额外触发OCR流程,增加解析环节复杂度。每日更新的短周期现货数据与月度长报告混合录入,分块时需区分短片段数据与长文本分析,避免跨类型内容被错误合并。核心数值字段与单位绑定紧密,分块时需保留字段与单位的关联,防止拆分后单位错位。研报内常包含跨章节的供需联动数据,分块逻辑需保留上下文关联,避免割裂关键逻辑链。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_OCR_ENABLE | 自动判断 | 焦炭研报包含可编辑文本与扫描版表格,自动判断可适配混合格式文档,减少手动配置成本 |
PARSE_TABLE_MODE | 保留原始单元格结构 | 焦炭研报中的价格、库存表格需完整保留字段与数值的对应关系,避免表格拆分后数据错位 |
CHUNK_SIZE | 800–1200 字符 | 焦炭研报包含短周期数据片段与长周期分析,该区间可平衡上下文完整性与检索精度 |
CHUNK_OVERLAP | 100–150 字符 | 避免跨分块的联动数据被割裂,保障供需逻辑的上下文连贯性 |
PARSE_FILE_TIMEOUT_SECONDS | 120 秒 | 长文档的OCR与表格解析耗时较长,该时长可覆盖多数焦炭研报的解析需求 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 部分月度焦炭研报合集体积较大,该阈值可兼容多数批量上传场景 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 调用图片解析工作流API时,接口返回400状态码。原因:未正确携带
file字段的二进制流或表单参数格式,未匹配文档解析模块的入参规范。 - 解析后的分块结果中出现价格数值与单位分离的情况。原因:未开启
PARSE_TABLE_MODE的单元格结构保留配置,导致表格拆分时字段与单位错位。 - 尝试解析焦炭研报附带的音视频附件时,解析结果为空。原因:当前文档解析模块未适配音视频文件格式,无法提取其中的文本内容。
怎么确认配好了
- 上传一份扫描版焦炭研报,查看解析后的文本是否包含完整识别内容,确认OCR配置的开启状态符合业务需求。
- 上传包含价格表格的研报,检查分块结果中是否保留了字段与数值的绑定关系,确认表格解析配置符合业务场景。
- 通过外部系统推送研报文件,查看知识库是否自动生成对应分块数据,确认自动解析触发逻辑符合配置要求。
- 上传单份体积符合业务上限的研报,检查解析是否在预设时长内完成,确认超时配置适配当前文档规模。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。