这个品类的数据长什么样
数据来源为国内焦煤主产区贸易企业台账、北方港口每日交割记录、行业资讯平台公开融资信息。更新节奏为每日固定时点完成更新。文档以结构化表格为主要形式,包含日期、主产地、坑口报价、港口平仓价、期货合约结算价、融资成交量、融资成本区间、授信额度等字段。报价类单位为元/吨,成交量单位为万吨,授信额度单位为万元。单篇文档对应单日全市场焦煤融资相关的结构化记录,无冗余非结构化文本。
这些特征在「知识库检索与召回」这一环带来什么约束
结构化为主的文档结构要求检索环节同时支持语义匹配与字段级过滤,避免仅依赖语义召回导致字段信息丢失。每日固定更新的节奏要求知识库配置增量同步任务,匹配数据更新周期,避免检索结果滞后。多字段且带明确单位的设计,要求召回结果需完整保留字段与单位对应关系,防止不同品类的单位混淆。单篇文档对应单日全量记录的形式,要求检索时可按日期、产地等维度快速定位目标范围,同时需处理多来源同字段数据的去重逻辑,确保结果准确性。
配置怎么定
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
召回条数 | 前10-15条 | 焦煤融资日报单条记录信息紧凑,过多召回会导致上下文过载,10-15条可覆盖主流检索需求 |
相似度阈值 | 0.72-0.85 | 结构化数据语义匹配精度较高,阈值过低会引入无关记录,过高会遗漏有效匹配项 |
maxContext | 4096-8192 tokens | 需保留足够的结构化字段信息,避免上下文截断导致关键业务数据丢失 |
分段长度 | 800-1200字符 | 单条结构化记录长度适中,分段过长破坏字段关联性,过短割裂字段信息 |
增量同步周期 | 每日1次,早7点执行 | 匹配焦煤融资日报每日固定更新的节奏,确保检索结果的时效性 |
字段过滤开关 | 开启 | 焦煤融资日报包含多维度业务字段,开启后可支持按产地、价格区间等条件精准筛选 |
本页给出的参数取值均为常规建议,用于确定配置的起点。实际取值受材料形态、数据量与业务规则影响,具体问题需具体分析,建议在自有样本上实测后再定。
容易做错的三处
- 现象:创建知识库时文本理解模型下拉框无已添加的ollama qwen2.5模型。原因:未将模型正确挂载至知识库的文本理解模型池,或模型加载格式不符合FastGPT的接入规范。
- 现象:知识库搜索时返回报错信息invalid configuration parameter name "hnsw.iter"。原因:向量库配置中填写了不存在的参数名,触发配置校验失败。
- 现象:检索结果包含其他企业的焦煤融资日报数据。原因:未开启知识库的权限隔离配置,或未为不同企业的知识库设置独立的访问权限控制规则。
怎么确认配好了
- 执行一次增量同步任务,检查知识库更新时间与焦煤融资日报的更新时点是否一致。
- 发起包含字段条件的检索请求,确认返回结果仅包含符合筛选条件的记录。
- 触发知识库搜索,检查返回结果的相似度得分是否处于预设的阈值区间内。
- 验证权限控制规则,使用不同权限的账号发起检索,确认仅可访问授权范围内的知识库数据。
问题素材取自公开社区提问(2026-09-11 去重 4,834 条)。文中的配置项名称与取值区间需以所用版本的实际界面与文档为准;本页核验日 2026-09-14,当时的最新发布版本为 FastGPT v4.17.0。