这个品类的数据长什么样
焦煤投研数据来源包括中国煤炭工业协会发布的月度供需报告、大连商品交易所的焦煤期货行情数据、港口的每日库存周报、上下游企业的产销公告、行业政策文件及第三方机构的焦煤质检报告。数据更新节奏差异明显,期货行情按日更新,供需报告按周或月更新,政策文件按需发布。文档结构包含结构化字段如干基灰分、硫分、粘结指数、产量、销量、库存、价格等,单位涉及吨、万吨、元/吨等,单份文档长度从数百字的行情快报到数万字的行业分析报告不等。
这些特征在「上下文与 token」这一环带来什么约束
焦煤数据的多类型、长度差异大及字段专业性强的特征,首先会导致上下文召回时容易混杂无关数据,引发上下文污染。长文档的分段处理会增加token消耗,单份长行业报告的解析和召回后单段token占比过高,若分段重叠不足会导致上下文断裂。实时行情数据的高频更新,要求上下文召回的时效性要求高,若上下文条数设置不足会导致无法关联最新行情变化。超长任务如跨周期焦煤供需分析需要大量上下文支撑,容易触发token超限或任务超时。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
maxContext | `前15-20条 | 焦煤数据类型多,召回过多会超出token上限,过少无法覆盖核心供需、价格、库存等关键信息,15-20条可平衡关联度与token消耗 |
chunkSize | 800-1200字符 | 焦煤的行业报告单份长度差异大,800-1200字符的分段可避免单段token占用合理,同时减少上下文断裂 |
similarityThreshold | 0.75-0.85 | 焦煤专业术语多,阈值过低会召回无关的煤炭品类数据,0.75-0.85可筛选强相关的焦煤专业内容 |
rerankTopN | 前5-8条 | 焦煤的供需、价格、库存等数据关联性强,重排后保留核心关联度最高的结果,避免上下文混杂 |
maxTokenLimit | 12000-15000 token | 焦煤长分析报告的总token消耗较高,12000-15000 token可覆盖多数投研分析的上下文需求 |
parseChunkOverlap | 100-150字符 | 焦煤的时序数据如每日行情需要上下文连贯性,100-150字符的重叠可避免分段断裂导致的信息丢失 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象为在fastgpt4.10.0版本中设置
maxContext为30条,但对话明细仅显示2条。原因是开启了重排环节,仅保留了与当前查询强相关的上下文,或相似度阈值设置过高,过滤了大部分召回结果。 - 现象为AI回复出现不符合预期的JSON格式内容。原因是知识库中包含焦煤交割标准、质检报告等带JSON格式的文档,上下文携带的结构化数据干扰了模型的输出格式生成。
- 现象为超长任务如跨周期焦煤供需分析提示任务超时,或系统提示上下文token数超标。原因是召回的上下文总token数超过
maxTokenLimit的配置值,或单份焦煤行业分析报告过长导致解析与召回耗时过长。
怎么确认配好了
- 查看知识库解析后的分段列表,核对分段长度处于
800-1200字符的设置,确认无过长或过短的分段。 - 发起包含焦煤供需、价格的测试查询,查看对话明细中的上下文条数,匹配
maxContext的设置,确认召回条数符合预期。 - 提交包含长时序焦煤数据的查询,检查系统日志,确认未出现token超限提示,调整
maxTokenLimit的设置合理。 - 发起包含焦煤专业术语如干基灰分、粘结指数的查询,检查AI回复未出现异常格式,确认上下文未被结构化数据干扰。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。