这一档模型的参数意味着什么
Qwen 10000K 这一档模型具备 10000000 的上下文长度,这意味着在单次对话中模型可以处理极大量的输入信息,为复杂的 RAG 应用提供了广阔的空间。引用上限为 10000000 token,这是模型用于处理引用内容的预算。引用内容的总 token 量应在此预算内,以便模型能充分利用检索到的信息。段落条数由检索结果决定,与引用上限是不同的度量。该档模型不支持图片输入和工具调用,因此基于这些功能的链路无法被激活。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 数据库连接字符串,确保可访问性和权限 |
ef_construction | 64–128 | 索引构建时邻居节点数量,影响索引质量与构建速度 |
ef_search | 32–64 | 查询时邻居节点数量,影响查询召回率与查询速度 |
m | 32 | HNSW 图中每层最大连接数,影响索引结构紧密程度 |
chunk_size | 800–1200 字符 | 单个文本块的理想长度,平衡信息密度与检索效率 |
top_k | 5–10 | 向量检索返回的条数上限,影响召回广度 |
这两者互相约束的地方
模型上下文长度决定了单次请求能容纳的总信息量,包括用户输入、历史对话和召回内容。向量库返回的召回条数乘以每段文本的平均长度,其总和不能超出模型上下文预算。引用上限是模型处理引用内容的 token 预算,而向量库返回的是固定条数的段落。这两者并非直接对应,引用上限按 token 计,向量库返回按条数计,最终谁先触顶取决于每段召回文本的实际 token 长度。当 openGauss 的索引参数,如 ef_construction 或 ef_search 调大时,通常会提高检索的准确性和召回率,这使得模型能够获得更相关、更全面的引用内容,进而提升模型对复杂问题的理解和响应能力。
容易做错的三处
- 日志显示
Connection refused:OPENGAUSS_URL中主机名或端口错误,或数据库未启动。 - 检索结果
[]或为空:top_k设置过小,或向量索引未正确构建,导致召回失败。 - 模型返回内容与召回内容关联性弱:
ef_search参数过低,导致检索精度不足,未能召回真正相关的段落。
怎么确认配好了
- 检查 FastGPT 后台日志,确认
openGauss连接成功且无报错信息。 - 执行一次带有检索的对话测试,观察模型返回内容是否包含来自知识库的引用,并核对引用原文。
- 逐步调整
top_k参数,并测试不同值下的召回条数和模型回复质量,找出平衡点。 - 针对特定查询,在 openGauss 中直接执行向量检索,比对返回结果与预期是否一致,并确认
ef_search参数的效果。