这个品类的数据长什么样
焦炭类尽调数据主要来自行业协会月度供需报告、沿海港口现货交易平台实时报价、期货交易所交割仓单数据、下游钢厂采购台账。数据更新节奏分为日度(现货价格、港口库存)、周度(行业周度库存)、月度(供需平衡表)。单份文档多为结构化表格或带标注的PDF报告,核心字段包含产地、硫分、灰分、基准交货价,单位包含元/吨、百分比、万吨等,部分非标调研数据需人工标注归类。
这些特征在「引用来源与溯源」这一环带来什么约束
焦炭品类的多源异构数据特征,对引用溯源环节带来多重约束。日度更新的现货价格数据需配置实时同步的数据源接入,否则无法保证引用内容的时效性。结构化的港口库存、供需表格文档,需开启专用的表格解析配置,否则核心字段无法被精准提取与溯源。不同数据源的时间戳格式存在差异,期货交割数据以交割日为基准,现货报价以交易日为节点,需统一对齐溯源的时间维度。长篇幅的月度行业报告,需限制单段召回的长度,避免超出上下文窗口导致溯源信息截断。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
召回条数 | 前8-12条 | 焦炭数据多为结构化条目,过多召回会导致上下文冗余,过少则无法覆盖核心供需与价格信息 |
PARSE_TABLE_ENABLE | 开启 | 焦炭核心数据多以表格形式存储,开启后可精准提取产地、价格等字段用于溯源 |
相似度阈值 | 0.75-0.85 | 焦炭行业术语专业性较强,过低阈值会引入无关的煤炭品类数据,过高则无法召回相关细分信息 |
SOURCE_TIMESTAMP_ALIGN | 按交易日对齐 | 焦炭现货与期货数据的时间基准存在差异,统一对齐后可避免溯源时间混乱 |
MAX_DOC_PARSE_LENGTH | 800-1200字符 | 月度供需报告篇幅较长,限制单段长度可避免上下文窗口溢出 |
API_KNOWLEDGE_BASE_ACCESS | 绑定专属API密钥 | 私人知识库需限制外部访问权限,确保溯源数据的安全性 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:调用API查询时,返回的引用列表包含本地知识库条目,但回答正文未关联对应内容。原因:未配置
召回内容拼接开关,导致召回的知识库内容未被注入到生成上下文。 - 现象:解析后的焦炭表格数据缺失硫分、灰分字段。原因:未开启
PARSE_TABLE_ENABLE配置,或表格解析的列匹配规则未覆盖非标表头。 - 现象:溯源时间戳显示混乱,部分数据标注为交割日部分为交易日。原因:未配置
SOURCE_TIMESTAMP_ALIGN参数,未统一对齐不同数据源的时间基准。
怎么确认配好了
- 上传一份焦炭现货报价表格文档,查看解析结果是否完整提取产地、价格、硫分等核心字段,确认表格解析配置生效。
- 发起包含焦炭现货价格的查询,检查返回的引用列表是否包含对应数据源的条目,且时间戳格式统一。
- 调用API接口传入私人知识库查询请求,验证返回结果是否仅包含授权后的知识库内容,确认API访问权限配置生效。
- 调整
召回条数参数后,对比不同取值下的回答内容覆盖范围,确认召回数量符合业务需求。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。