这一档模型的参数意味着什么
StepFun 8K 上下文模型档位中的 step-1-flash 和 step-2-mini 模型,其 8000 的上下文长度 (maxContext) 决定了单次请求中可以承载的输入文本总量,包括用户提问、历史对话、系统指令以及检索到的内容。引用上限 (quoteMaxToken) 设定了检索内容在整个上下文中所占的 token 预算,它直接限制了所有引用内容合计的 token 量。段落条数由检索系统的配置决定,与引用上限是两个独立维度。该档模型不支持图片输入和工具调用,意味着其应用场景限于纯文本对话与知识检索。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 数据库连接字符串,确保 FastGPT 能正确连接到 openGauss 实例 |
ef_construction | 64 | 影响索引构建时的图连接度,数值越大索引质量越高,检索精度潜在提升,但构建时间增加 |
ef_search | 32 | 影响查询时的图遍历深度,数值越大召回率越高,但查询耗时增加 |
m | 32 | HNSW 索引中每个节点的最大连接数,影响索引结构和查询性能 |
召回条数 (top_k) | 5 | 结合模型引用上限和单段平均长度,避免超出引用预算 |
| 单段最大字符数 | 500 字符 | 确保每段内容不过长,以提高模型处理效率和召回效率 |
这两者互相约束的地方
StepFun 8K 上下文模型与 openGauss 向量库的配合,核心在于如何平衡检索效率和模型处理能力。模型 8000 的上下文预算是硬性限制,检索系统返回的召回条数乘以每段内容的 token 数,必须在这一预算之内。引用上限 (quoteMaxToken) 是对检索内容的 token 预算限制,而 openGauss 返回的是具体条数。当每段内容较短时,引用上限允许返回更多条目;当每段内容较长时,即使返回条目不多,也可能率先触及引用上限。openGauss 的 ef_construction 和 ef_search 参数调大,意味着索引质量和召回率可能提升,检索到的内容在语义上更贴近用户意图,但这也会增加索引构建和查询的资源消耗。
容易做错的三处
- 报错信息显示
context window exceeded:原因可能是检索返回的条数过多,或者每段内容过长,导致引用内容总 token 超过了模型的上下文限制。 - 查询结果召回条数与预期不符:openGauss 的
ef_search参数设置过低,导致查询时搜索深度不足,未能召回足够多的相关文档。 - 检索结果语义相关性不佳:openGauss 的
ef_construction参数设置过低,导致索引构建质量不高,影响了向量搜索的准确性。
怎么确认配好了
- 在 FastGPT 界面中,观察模型每次响应时引用的原文内容是否完整且相关,确认没有截断或内容缺失的情况。
- 通过 FastGPT 的调试工具,查看每次检索请求返回的
token计数,确保引用内容的总 token 量未超过模型的quoteMaxToken限制。 - 在 openGauss 数据库的日志中,检查向量搜索的查询耗时,确保在可接受的响应时间内完成,并根据业务需求调整
ef_search参数。