这一档模型的参数意味着什么
Qwen 128K 这一档模型具有 128000 的上下文长度,决定了单次交互中模型能处理的总信息量。引用上限 120000 意味着模型用于引用检索内容的 token 预算为 120000。模型在生成回答时可以从检索结果中引用内容,这些被引用的内容累计所占的 token 数不能超过此上限。单次最大输出未标注,表示模型生成回答的长度可能受到上下文总长度的隐式限制。工具调用功能开启,允许模型通过外部工具增强其能力。图片输入为 false,表示模型不直接处理图像信息。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | 按实际连接字符串 | 数据库连接的唯一标识 |
ef_construction | 100–200 | 影响索引构建质量与速度,召回率与写入性能的平衡 |
ef_search | 50–100 | 影响查询召回率与查询速度,召回率与查询性能的平衡 |
m | 32 | HNSW 索引的图层连接数,影响索引结构与查询效率 |
vector_dimensions | 模型的嵌入维度数 | 需与模型生成的嵌入向量维度保持一致 |
max_connections | 100–200 | 数据库并发连接数,需根据并发量调整 |
这两者互相约束的地方
Qwen 128K 模型的 128000 上下文长度对检索结果的总量提出了明确限制。当从 PostgreSQL(pgvector)检索到多条段落时,这些段落的总 token 数与用户输入、系统指令以及模型生成的回答共同占据上下文预算。引用上限 120000 token 专门用于检索到的内容。向量库返回的是固定数量的段落条数,每条段落的长度是可变的。最终是引用上限先达到还是检索到的段落总 token 数先触及上下文预算,取决于每段内容的平均长度。如果段落较短,可能通过增加召回条数来充分利用引用上限;如果段落较长,则少量段落就可能达到引用上限。Pgvector 的索引参数,如 ef_construction 和 ef_search,调大可以提高检索的召回率和准确性。这意味着模型能够获得更相关的上下文信息,进而可能提高回答质量。但同时,更高的召回率和更长的段落也可能更快地消耗模型的上下文和引用预算。
容易做错的三处
- 日志中出现
context window exceeded错误:检索到的内容总 token 数加上用户输入等超过了 128000 上下文长度。 - 模型回答内容过短或不完整:引用内容未充分利用 120000 token 引用上限,或者单次最大输出的隐式限制导致。
- 检索结果与查询不相关:
ef_search参数设置过低,导致 pgvector 在查询时未能充分探索索引,返回次优结果。
怎么确认配好了
- 运行一组标准测试用例,观察每次交互中模型引用的 token 总数,确保其在 120000 引用上限之内,并能充分利用。
- 监控 PostgreSQL(pgvector)的查询延迟,确保在
ef_search调整后,查询响应时间满足业务需求。 - 检查 FastGPT 后台的检索召回条数,并比对每条召回内容的平均长度,评估其是否与模型的上下文预算相匹配。
- 针对特定查询,手动检查 pgvector 返回的向量相似度分数,确认检索结果的准确性和相关性。