这一档模型的参数意味着什么
SparkDesk 8K 上下文模型系列,如 generalv3、generalv3.5 和 4.0Ultra,其上下文长度为 8000 token。这意味着单次模型请求中,输入和输出内容的总和不能超过此限制。引用上限 8000 token 规定了引用内容可用的 token 预算,即所有被引用的文档片段合计可占用的最大 token 数。引用内容的段落条数由检索侧决定,与引用上限是两个独立的量。该档模型不支持图片输入和工具调用,因此相关功能链路不会被激活。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | FastGPT 连接 openGauss 数据库的标准格式,确保服务正常通信 |
ef_construction | 100-200 | 构建 HNSW 索引时的邻居数量,数值越大索引质量越高,召回准确性提升 |
ef_search | 80-150 | 搜索 HNSW 索引时的邻居数量,数值越大搜索精度越高,但查询耗时增加 |
m | 32 | HNSW 图中的最大邻居数,影响索引结构和查询性能,32 是通用平衡值 |
chunk_size | 800-1200 字符 | 单个文本块的字符长度,影响召回粒度和模型处理效率 |
overlap_size | 150-250 字符 | 文本块之间的重叠字符数,有助于保持上下文连贯性 |
这两者互相约束的地方
召回条数与每段文本长度的乘积,其总 token 量必须控制在模型的上下文预算之内。引用上限是按 token 计数的,而向量库返回的是独立的段落条数,谁先达到限制取决于每个段落的实际 token 长度。如果每个段落较短,可能会先达到引用上限的 token 限制,而条数可能还未触及上限;如果段落较长,则可能在条数较少时就达到了 token 限制。openGauss 索引参数 ef_construction 和 ef_search 调大后,向量检索的准确性会提高,可能返回更相关的少量高质量段落,这有助于在引用上限内提供更精准的信息,避免因大量冗余内容挤占模型上下文。
容易做错的三处
- 日志显示
400 Bad Request: Context window exceeded。原因是在检索结果和用户输入一起送给模型时,总 token 数超过了 8000。 - 检索结果返回的文档片段数量远低于预期,但内容很长。原因可能是
chunk_size设置过大,单个文档块占用 token 过多,导致在引用上限内只能返回少量片段。 - 模型回答内容缺乏相关性,尽管向量库返回了多条结果。原因可能是
ef_search设置过低,导致向量检索的精度不足,返回的虽然是多条,但实际相关性不强。
怎么确认配好了
- 在 FastGPT 界面发起测试对话,观察模型回答是否流畅,没有因上下文不足而中断。合格阈值应根据实际业务场景的平均问答长度和引用需求确定。
- 检查 FastGPT 后台的日志输出,确认没有出现
Context window exceeded错误。合格阈值是零此类错误。 - 通过 FastGPT 的 RAG 调试功能,查看实际召回的文档片段数量及其 token 长度,确保总长度在引用上限 8000 token 内。合格阈值是平均每次检索的引用内容 token 数不超过 7000 token。
- 执行一系列包含长文本和短文本的查询,验证 openGauss 能够稳定返回相关结果,并且返回的段落数量和内容长度符合预期。