这一档模型的参数意味着什么
上下文长度 1000000 token (maxContext) 决定了模型在单次交互中能够处理的输入信息总量,这包括用户查询、历史对话以及系统召回的知识内容。单次最大输出未标注,意味着模型可以生成较长的回复,但在实际应用中仍受 FastGPT 平台配置的限制。引用上限 1000000 token (quoteMaxToken) 明确了模型在生成回复时可以引用的知识内容总预算,这是对召回内容量的一个关键约束。图片输入 true 使得模型能够处理视觉信息,支持多模态问答。工具调用 true 则表明模型具备利用外部工具执行特定任务的能力,可扩展其功能边界。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 数据库连接的规范格式,确保 FastGPT 能够正确连接 openGauss 实例。 |
ef_construction | 100 | 构建 HNSW 索引时的邻居搜索参数,影响索引质量和构建速度,提高召回准确率。 |
ef_search | 60 | 查询 HNSW 索引时的邻居搜索参数,影响召回速度和准确率,平衡查询性能。 |
m | 32 | HNSW 索引中每个节点的最大邻居数,影响索引大小和搜索效率,兼顾存储与性能。 |
向量维度 | 768 | 与模型嵌入输出维度匹配,确保向量存储和检索的兼容性。 |
chunk_size | 800-1200 字符 | 知识库分段的建议长度,平衡单段信息的完整性和召回效率。 |
这两者互相约束的地方
模型 1000000 token 的上下文长度为 RAG 架构提供了巨大的空间,允许 FastGPT 召回并处理大量的相关内容。然而,引用上限 1000000 token 对最终被模型引用的内容总量施加了硬性限制。向量库 openGauss 返回的是按条数计的知识段落,而引用上限是按 token 计量的。当每段知识的长度较短时,可能在达到引用上限前召回较多的段落条数;反之,若每段知识较长,则可能在召回较少条数时就触及引用上限。因此,在配置知识分段的 chunk_size 时,需要综合考虑模型引用上限与单次召回的条数预算。openGauss 的索引参数 ef_construction 和 ef_search 调大,通常会提升向量检索的准确性,即召回更相关的知识段落,这使得模型有更高质量的引用内容可用,从而在 1000000 token 的引用预算内生成更精准的回答。
容易做错的三处
- 日志显示
database connection error: connection refused:OPENGAUSS_URL中主机名或端口配置有误,或者 openGauss 服务未启动。 - 回复内容与召回知识关联性不强,且引用内容为空:
ef_search设置过低,导致向量检索准确性不足,未能召回足够相关的知识。 - RAG 模式下模型输出截断,提示
context window exceeded:召回内容总 token 量加上用户输入和历史对话,超出了1000000token 的上下文长度限制。
怎么确认配好了
- 在 FastGPT 知识库测试界面,上传文档后,检查分段结果是否符合预期的
chunk_size。 - 通过 FastGPT 的 RAG 测试功能,观察模型引用内容是否准确,并检查引用的总 token 量是否在
1000000token 限制内。 - 在 openGauss 数据库中,通过
SELECT count(*) FROM your_vector_table;查询向量表的记录数,确认知识段落已成功入库。 - 执行 FastGPT 的问答测试,观察响应时间,并与调整
ef_search前的性能进行对比,判断检索效率是否符合预期。