这个品类的数据长什么样
焦煤尽调相关数据主要来源于中国煤炭工业协会、大连商品交易所、主要港口通关系统、上市煤企财报及生态环境部政策文件。更新节奏因数据源类型不同分为四类:期货行情数据每日更新,港口通关统计每周更新,行业月度报告每月发布,企业财报每季度更新。文档形态包含结构化Excel报价表、PDF格式行业研报、网页版政策公告三类。结构化文档字段包含产地、灰分、硫分、粘结指数、胶质层厚度、现货价格等,单位分别为百分比、毫米、元/吨等;非结构化研报则包含产能分析、政策解读、运输成本测算等章节。
这些特征在「知识库检索与召回」这一环带来什么约束
焦煤数据的多源异构特性要求检索系统同时适配结构化字段与非结构化文本,需避免割裂专业术语与对应指标的关联。不同更新频率的数据源需对应差异化的召回优先级:期货行情数据需优先召回当日最新内容,月度行业报告则需按固定周期更新至知识库。专业字段的唯一性要求检索时需精准匹配术语,例如不可将“粘结指数”与“挥发分”混淆,否则会导致尽调数据偏差。长文档的章节结构要求分段检索时保留上下文关联,避免因分段过短丢失政策解读与对应指标的绑定关系。跨品类数据的相似性(如动力煤与焦煤的价格字段)要求检索时增加品类标签过滤,防止无关数据混入结果。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PARSE_SEGMENT_LENGTH | 800–1200 字符 | 焦煤尽调报告包含专业术语组合与长句,分段过长会丢失上下文关联,过短会割裂指标与解读的绑定关系 |
召回条数 | 前 8–12 条 | 焦煤数据涉及现货、期货、政策、产能等多维度内容,过少会遗漏关键数据源,过多会增加上下文冗余 |
相似度阈值 | 0.75–0.85 | 焦煤专业术语辨识度高,阈值过低会引入动力煤等无关品类数据,过高会遗漏相似指标的有效文档 |
重排返回条数 | 前 3–5 条 | 智能尽调报告需聚焦核心指标,过多的召回结果会增加阅读与整理成本 |
maxContext | 4000–6000 字符 | 焦煤数据的字段关联紧密,需保留足够上下文以支撑跨字段(如灰分与粘结指数)的联合检索 |
UPLOAD_FILE_MAX_SIZE | 500 MB | 单份焦煤行业研报或批量港口数据文件体积较大,需适配大文件上传需求 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象为通过API上传知识库文件时,中文文件名显示为乱码,接口返回200状态码但文件解析失败。原因是未在API请求头中指定
Content-Type为multipart/form-data; charset=utf-8,导致文件名编码未正确传递。 - 现象为创建知识库时无法选择本地部署的ChatGLM2模型,检索时返回空结果。原因是未在OneAPI的配置中正确绑定FastGPT的API密钥,或
config.json中未配置模型的base_url与model_name参数。 - 现象为知识库召回结果中包含动力煤等无关品类数据,召回条数与设置不符。原因是相似度阈值设置过低,且未对文档添加焦煤品类的标签过滤,导致跨品类相似数据被召回。
怎么确认配好了
- 上传单份焦煤现货报价Excel文件,检查解析后的字段是否包含产地、灰分、硫分等专业字段,无缺失或乱码。
- 发起检索测试,输入“主焦煤现货价格”,核对召回结果的文档来源是否为焦煤相关数据源,无动力煤等无关品类内容。
- 查看知识库的更新日志,确认每日更新的期货数据与月度更新的行业报告已按预设节奏同步完成。
- 调用FastGPT V4.8.17版本的API检索接口,检查返回结果的字段是否包含正确的焦煤专业指标,无异常空值。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。