模型指南官方文档4 分钟阅读模型组合页

Qwen 128K 上下文 这一档模型配 openGauss 的配置口径

`qwen-coder-turbo` 模型所处的这一档,其上下文长度为 128000 token,表示模型一次处理的输入信息总量上限。单次最大输出未标注,通常意味着模型会根据其内部设定和当前会话长度动态调整输出上限。引用上限为 50000 token,这是用于承载检索到的引用内容的 token 预算

这一档模型的参数意味着什么

qwen-coder-turbo 模型所处的这一档,其上下文长度为 128000 token,表示模型一次处理的输入信息总量上限。单次最大输出未标注,通常意味着模型会根据其内部设定和当前会话长度动态调整输出上限。引用上限为 50000 token,这是用于承载检索到的引用内容的 token 预算,它限定了引用内容的总量。引用内容的段落条数由检索系统决定,与引用上限是两个独立的概念。此档模型不支持图片输入和工具调用,因此在集成时无需考虑对应的多模态或 Agent 链路。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/database数据库连接字符串,确保可达性
ef_construction100–200索引构建时的邻居数量,影响索引质量和构建时间
ef_search50–100查询时的邻居数量,影响检索精度和查询速度
m32HNSW 图中每个节点的最大连接数,影响索引结构
召回条数(k)5–10 条结合模型上下文和引用上限,平衡召回量与相关性
单段最大字符数800–1200 字符避免单段过长导致 token 浪费,或过短丢失语义

这两者互相约束的地方

模型上下文长度与向量库召回结果之间存在紧密约束。向量库返回的段落条数乘以每段的平均 token 数量,其总和必须控制在模型 128000 token 的上下文预算之内。引用上限 50000 token 专门用于预算检索到的引用内容。向量库的检索结果是按条数计量的,而模型的引用上限是按 token 计量的。当检索到的段落总 token 数达到 50000 token 时,引用内容预算触顶。当检索到的段落条数导致总 token 数超过 128000 token 时,模型上下文触顶。究竟是哪一个先触顶,取决于每段内容的平均长度。 openGauss 的索引参数,例如 ef_construction 和 ef_search,调大后可以提升检索精度。对于 qwen-coder-turbo 这样的模型,更精准的召回意味着模型能获得更高质量的输入,从而可能生成更准确的回复。然而,这也可能增加向量检索的延迟,需要权衡。

容易做错的三处

  • 日志中出现 connection refused 错误,原因是 OPENGAUSS_URL 配置的数据库地址或端口不正确。
  • 模型返回的回答内容空泛或不准确,原因是向量库召回的有效条数过少,未能提供足够的相关信息。
  • 检索结果中包含大量无关内容,原因是 ef_search 设置过低,导致召回精度不足。

怎么确认配好了

  • 运行端到端测试,检查模型回复是否准确引用了向量库中的相关内容,并观察回复长度是否合理。
  • 监控 openGauss 的数据库连接状态,确保 OPENGAUSS_URL 配置的连接池稳定,没有大量连接错误。
  • 在 FastGPT 界面中,通过调试模式查看每次查询的召回条数和引用内容 token 数量,与预期值进行比对。
  • 通过 FastGPT 的检索日志,分析检索耗时和召回结果的相关性,根据业务场景调整 ef_construction 和 ef_search 的阈值。

参考资料