这一档模型的参数意味着什么
Qwen 25K 上下文模型档位中的模型,如 qwen3-vl-flash 和 qwen3-vl-plus,提供了 25000 token 的上下文长度,允许一次性处理大量输入信息。单次最大输出长度未明确标注,意味着其生成能力可能相当灵活。引用上限为 20000 token,这是对引用内容总量的预算,它独立于检索系统返回的段落条数。图片输入能力支持处理视觉信息,而工具调用功能则允许模型在生成过程中与外部工具交互,扩展其解决问题的能力。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 连接数据库实例的必要信息,确保可达性 |
ef_construction | 100–200 | 控制 HNSW 索引构建质量,过低影响召回,过高增加构建时间 |
ef_search | 60–120 | 检索时遍历的近邻数量,影响召回精度与查询耗时 |
m | 32 | HNSW 索引中每个节点的最大连接数,影响索引结构 |
vector_dimension | 1536 | 向量维度需与模型输出的 embedding 维度一致 |
| 检索条数 | 10–20 条 | 依据上下文预算与单段平均长度,平衡召回与 token 消耗 |
这两者互相约束的地方
模型 25000 token 的上下文预算是总的输入限制,召回系统返回的段落条数与每段内容的长度共同决定了占用多少 token。引用上限 20000 token 限制了模型可用于引用的内容总量。向量库返回的是条数,模型引用的是 token 总量。当每段内容较短时,可以在引用上限内包含更多条目;当每段内容较长时,即使条目较少也可能迅速触及引用上限。openGauss 的 ef_construction 和 ef_search 参数调大,可以提高检索的准确性,这意味着模型能够获得更高质量的引用内容,从而提升生成效果,但同时也会增加索引构建和查询的资源消耗。
容易做错的三处
OPENGAUSS_URL配置错误,导致 FastGPT 启动时报错database connection failed。ef_construction设置过低,检索结果中相关性高的条目未被召回,导致模型回答质量下降。- 向量库返回的段落总 token 量超出模型引用上限,导致模型输出结果中引用内容被截断或报错
quote content exceeds limit。
怎么确认配好了
- 通过 FastGPT 管理界面检查 openGauss 连接状态,确保显示为“已连接”。
- 上传文档后,在 FastGPT 知识库测试界面尝试检索,观察返回结果的相关性,并调整
ef_search参数直至满意。 - 在 FastGPT 对话测试中,输入长问题并观察模型引用内容的完整性,确认引用内容未被截断,以此反向确定合适的检索条数与单段最大字符数。