这一档模型的参数意味着什么
Qwen 260K 上下文模型(qwen3.6-max-preview)具备 260000 token 的上下文长度,这意味着在单次交互中可以处理极大量的信息输入。引用上限 260000 token 规定了模型在生成回复时可以引用的内容总量。引用的内容条数由检索系统返回决定,引用的 token 预算与检索返回的条数是两个独立的维度。工具调用能力允许模型与外部系统进行交互,执行特定任务。模型不具备图片输入能力,因此在处理视觉信息时需要预先进行文本转换。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | FastGPT 连接 openGauss 数据库的必要参数,确保数据库可访问 |
ef_construction | 600–1000 | 构建 HNSW 图时的邻居数量,影响索引质量与构建时间,高值提升召回率 |
ef_search | 200–400 | 检索 HNSW 图时的邻居数量,影响查询速度与召回率,高值提升准确性 |
m | 32 | HNSW 图中每个节点的最大连接数,影响索引大小与查询性能 |
| 检索返回条数 | 15–20 | 结合模型引用上限与平均单段长度,避免单次检索召回内容过多或过少 |
| 单段最大字符数 | 800–1200 | 结合模型上下文长度,确保单段内容既能包含足够信息又不会过长 |
这两者互相约束的地方
检索系统返回的文档条数与每段文档的长度共同决定了召回内容的总 token 数。这个总 token 数必须在模型的上下文长度(260000 token)之内。引用上限(quoteMaxToken)按 token 计量,而向量库返回的是固定条数的文档片段。引用内容总 token 数达到引用上限时,模型将停止引用,这与向量库返回的文档条数无关。当索引参数 ef_construction 或 ef_search 调大时,向量检索的准确性可能提高,从而为模型提供更相关的上下文,这可能导致模型在相同条数下引用的有效信息更多,进而更快触及引用上限。
容易做错的三处
- 日志显示
Connection refused:OPENGAUSS_URL配置的数据库地址或端口不正确,或者数据库服务未启动。 - 查询结果相关性低:
ef_search设置过低,导致 HNSW 索引在查询时未能充分探索邻近节点。 - 模型返回内容为空或过短:检索返回的文档条数过少,或者每段文档的平均 token 数远低于预期,导致模型缺乏足够的引用内容。
怎么确认配好了
- 通过 FastGPT 界面上传测试文档,观察索引构建日志,确认没有报错信息。
- 执行几次带有复杂查询的对话,查看 FastGPT 的引用内容,确认引用条数与内容相关性符合预期。
- 模拟高并发查询,监控 openGauss 数据库的 CPU 和内存使用率,确保系统稳定运行,响应时间在可接受范围内。
- 调整 FastGPT 的检索返回条数和单段最大字符数,观察模型输出的引用总 token 数,确定最适合当前模型档位的配置阈值。