这一档模型的参数意味着什么
此档模型提供高达 200000 token 的上下文窗口,这意味着单次交互中可容纳大量历史对话和召回信息。单次最大输出 token 未明确标注,但在实际应用中,模型会根据需求生成相应长度的回答。引用上限为 120000 token,这是对检索到的信息用于生成回复时的总预算,它限制了引用内容的总量。段落条数由检索策略决定,与引用上限是两个独立维度。模型支持图片输入,允许在对话中处理视觉信息,并具备工具调用能力,可与外部系统集成,执行特定任务。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/database | 标准连接字符串,确保可访问性和权限 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量与构建速度的平衡,此值提供较好的召回率 |
ef_search | 64 | HNSW 索引查询参数,控制查询时遍历的邻居数,此值平衡召回率与查询速度 |
m = 32 | 32 | HNSW 索引的邻居数,影响图的稠密程度,此值适用于高维向量 |
vector_ip_ops | true | pgvector 启用内积操作符,支持基于内积的相似度计算 |
| 检索条数 | 10–20 条 | 结合引用上限,避免单次召回内容过多超出模型预算 |
这两者互相约束的地方
召回的段落总 token 数与模型 200000 token 的上下文预算紧密相关,总和不能超出此限制。引用上限 120000 token 约束了最终用于生成回答的引用内容总量,这是按 token 计量的。向量库返回的则是独立的段落条数。当每段内容较短时,可能会召回更多段落才达到引用上限;而当每段内容较长时,较少的段落条数就可能触及引用上限。索引参数 ef_construction 和 ef_search 调大,通常会提高召回的准确性,确保模型能接收到更相关的上下文信息,从而提升回答质量。但过高的值也会增加索引构建和查询的资源消耗。
容易做错的三处
- 日志中出现
ERROR: index row size exceeds maximum:ef_construction或m值设置过大,导致索引构建时内存或磁盘空间不足。 - 检索结果的
quote字段为空,或仅包含少量内容:召回的条数过多,但每条内容过长,导致在达到引用上限 120000 token 时,实际可引用的段落数量不足。 - 查询响应时间过长,甚至超时:
ef_search值设置过高,导致查询时遍历的邻居节点过多,影响检索性能。
怎么确认配好了
- 在 FastGPT 知识库测试界面,上传文档并进行问答,观察模型返回的引用内容是否准确且数量合理。
- 检查 PostgreSQL 数据库的
pg_stat_statements视图,确认向量查询的total_time在可接受范围内。 - 在模型推理日志中,确认每次请求的
prompt_tokens和completion_tokens总和远低于 200000 token 的上下文限制。 - 通过 FastGPT 的引用详情,观察引用的总 token 数是否接近 120000 token 引用上限,并评估召回内容的完整性。