这一档模型的参数意味着什么
上下文长度 1000000 意味着模型能够处理极长的输入序列,为 RAG 应用提供了充足的召回内容承载空间。单次最大输出未标注,通常表示模型在生成回答时没有硬性 token 限制,但实际输出长度仍受限于应用侧的配置。引用上限 1000000 指定了模型在生成回复时可引用的召回内容总 token 预算。引用内容的总 token 量是限制模型参考信息量的关键,而检索系统返回的段落数量则是一个独立变量。图片输入 true 表示模型能够理解并处理图像信息,为多模态应用提供了可能。工具调用 true 允许模型与外部工具交互,扩展了其处理复杂任务的能力。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/database | 数据库连接字符串,确保可达性与权限。 |
ef_construction | 80–120 | 控制 HNSW 索引构建时的邻居搜索广度,影响索引质量与构建时间。 |
ef_search | 40–60 | 控制 HNSW 索引查询时的邻居搜索广度,影响查询召回率与速度。 |
m | 32 | HNSW 索引的每个节点的最大邻居数量,影响索引存储与查询效率。 |
vector_ip_ops | true | 启用内积(Inner Product)操作符,适用于余弦相似度计算。 |
max_connections | 50–100 | 数据库最大并发连接数,需根据并发请求量和服务器资源调整。 |
这两者互相约束的地方
这一档模型拥有 1000000 的上下文长度,使得其能够容纳大量的召回内容。在与 PostgreSQL(pgvector)结合时,需要确保从向量库中检索出的所有段落的总 token 数不超过模型的上下文预算。引用上限 1000000 是模型可用于生成回复的召回内容总 token 预算,而向量库返回的是固定数量的段落。当每段召回内容的平均长度较短时,可能会先达到向量库返回的最大条数限制,此时引用上限仍有余裕。反之,当每段召回内容较长时,即使向量库返回的段落数量不多,也可能迅速触及引用上限。PostgreSQL(pgvector)的 ef_construction 和 ef_search 等索引参数调大,通常意味着索引构建更耗时、占用更多资源,但查询召回率更高、更准确。对于这一档模型,更准确的召回有助于充分利用其高引用上限,提供更精准的回答。
容易做错的三处
- 日志中出现
PG::ConnectionBad错误,原因是没有正确配置PG_URL环境变量或数据库凭证。 - 检索结果相关性差,但在向量库中存在相关文档,原因可能是
ef_search参数设置过小,导致查询时未能充分探索邻近向量。 - 模型返回的回答中引用的内容不完整或缺失,原因是在 FastGPT 侧的 RAG 配置中,单次召回内容总 token 量超出了模型的引用上限。
怎么确认配好了
- 通过 FastGPT 的调试接口,观察每次检索请求的 SQL 查询日志,确认
ef_search等参数是否按预期生效。 - 执行一系列包含长文本的问答测试,检查模型返回的回答是否充分利用了召回内容,且引用的内容没有被截断,从而确认引用上限与召回条数的匹配度。
- 监控 PostgreSQL 数据库的连接数和查询延迟,确保在并发请求压力下,数据库性能能够满足 FastGPT 的需求,并据此调整
max_connections等参数。 - 验证模型在处理多模态输入(如带有图片的查询)时,是否能正确识别并利用图片信息,确认图片输入功能正常。