这一档模型的参数意味着什么
Qwen 1000K 上下文模型档位,其 上下文长度 高达 1,000,000 token,这意味着在单次交互中可以处理极大量的信息输入,为复杂的知识问答和长文本理解提供了基础。引用上限 同样达到 1,000,000,表明 FastGPT 在构造模型输入时,可以从知识库中召回并引用极多的段落。单次最大输出 未标注,通常由模型本身决定,影响回答的详细程度。工具调用 为 true,支持模型通过工具函数与外部系统交互,扩展了其功能边界。图片输入 为 false,说明此档模型不具备多模态的图像理解能力。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/database | FastGPT 连接 PostgreSQL 数据库的必要配置,包含认证信息。 |
ef_construction | 80 | HNSW 索引构建时的参数,影响索引质量和构建速度,通常 ef_construction 越大索引质量越好,召回更精准。 |
ef_search | 60 | HNSW 索引查询时的参数,影响查询效率和召回率,通常 ef_search 越大召回率越高,查询时间越长。 |
m | 32 | HNSW 索引中每个节点的最大连接数,影响索引大小和查询性能,较大的 m 值可以提高召回性能,但会增加存储和构建开销。 |
vector_ip_ops | true | pgvector 扩展的配置,启用内积(IP)操作,适用于某些嵌入模型的相似度计算。 |
| 召回条数 | 15 | 基于模型引用上限和单段平均长度,平衡召回精度与模型输入长度。 |
这两者互相约束的地方
Qwen 1000K 上下文模型的 上下文长度 和 引用上限 对 PostgreSQL(pgvector)的召回策略有直接约束。具体来说,召回的条数乘以每段的平均长度,其总 token 数必须控制在模型的 上下文长度 之内,否则会导致模型输入超限。引用上限 决定了 FastGPT 从向量库中获取的最大段落数量,即使 PostgreSQL(pgvector) 返回了更多结果,FastGPT 也会在此上限处截断。同时,PostgreSQL(pgvector) 中的 ef_construction 和 ef_search 参数调大,可以提高向量召回的准确性和全面性,这意味着有更多高质量的候选段落送达模型,但如果最终召回条数超过了 引用上限,额外的性能投入就无法完全体现在模型输入中。
容易做错的三处
- 日志显示
context window exceeded错误,原因是向量库召回的段落总长度超过了模型的上下文长度。 - 模型回答缺乏相关信息,但数据库中存在,现象是 FastGPT 的调试界面中
引用内容字段为空或不全,原因可能是ef_search参数设置过低导致召回率不足。 - 查询响应时间过长,甚至出现超时,原因是
ef_construction和ef_search参数设置过高,导致 HNSW 索引构建或查询开销巨大。
怎么确认配好了
- 在 FastGPT 调试界面,检查
引用内容字段是否包含与问题高度相关的知识库段落,并检查其数量是否符合预期。 - 通过 FastGPT 的模型输入预览功能,核对模型最终接收的 token 总数,确保其未超过
上下文长度。 - 使用
EXPLAIN ANALYZE命令分析 PostgreSQL(pgvector) 的向量查询语句,确认 HNSW 索引是否被有效利用,并记录查询耗时作为性能基线。 - 模拟高并发场景,测试系统的整体响应时间,确保在实际负载下仍能保持可接受的性能水平,并与前期设定的性能阈值进行比对。