模型指南官方文档4 分钟阅读模型组合页

Qwen 25K 上下文 这一档模型配 openGauss 的配置口径

Qwen 25K 上下文模型档位中的模型,如 `qwen3-vl-flash` 和 `qwen3-vl-plus`,提供了 25000 token 的上下文长度,允许一次性处理大量输入信息。单次最大输出长度未明确标注,意味着其生成能力可能相当灵活。引用上限为 20000 token,这是对引用内容总

这一档模型的参数意味着什么

Qwen 25K 上下文模型档位中的模型,如 qwen3-vl-flash 和 qwen3-vl-plus,提供了 25000 token 的上下文长度,允许一次性处理大量输入信息。单次最大输出长度未明确标注,意味着其生成能力可能相当灵活。引用上限为 20000 token,这是对引用内容总量的预算,它独立于检索系统返回的段落条数。图片输入能力支持处理视觉信息,而工具调用功能则允许模型在生成过程中与外部工具交互,扩展其解决问题的能力。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/database连接数据库实例的必要信息,确保可达性
ef_construction100–200控制 HNSW 索引构建质量,过低影响召回,过高增加构建时间
ef_search60–120检索时遍历的近邻数量,影响召回精度与查询耗时
m32HNSW 索引中每个节点的最大连接数,影响索引结构
vector_dimension1536向量维度需与模型输出的 embedding 维度一致
检索条数10–20 条依据上下文预算与单段平均长度,平衡召回与 token 消耗

这两者互相约束的地方

模型 25000 token 的上下文预算是总的输入限制,召回系统返回的段落条数与每段内容的长度共同决定了占用多少 token。引用上限 20000 token 限制了模型可用于引用的内容总量。向量库返回的是条数,模型引用的是 token 总量。当每段内容较短时,可以在引用上限内包含更多条目;当每段内容较长时,即使条目较少也可能迅速触及引用上限。openGauss 的 ef_construction 和 ef_search 参数调大,可以提高检索的准确性,这意味着模型能够获得更高质量的引用内容,从而提升生成效果,但同时也会增加索引构建和查询的资源消耗。

容易做错的三处

  • OPENGAUSS_URL 配置错误,导致 FastGPT 启动时报错 database connection failed。
  • ef_construction 设置过低,检索结果中相关性高的条目未被召回,导致模型回答质量下降。
  • 向量库返回的段落总 token 量超出模型引用上限,导致模型输出结果中引用内容被截断或报错 quote content exceeds limit。

怎么确认配好了

  • 通过 FastGPT 管理界面检查 openGauss 连接状态,确保显示为“已连接”。
  • 上传文档后,在 FastGPT 知识库测试界面尝试检索,观察返回结果的相关性,并调整 ef_search 参数直至满意。
  • 在 FastGPT 对话测试中,输入长问题并观察模型引用内容的完整性,确认引用内容未被截断,以此反向确定合适的检索条数与单段最大字符数。

参考资料