模型指南官方文档4 分钟阅读模型组合页

Gemini 1000K 上下文 这一档模型配 openGauss 的配置口径

上下文长度 `1000000` token (`maxContext`) 决定了模型在单次交互中能够处理的输入信息总量,这包括用户查询、历史对话以及系统召回的知识内容。单次最大输出未标注,意味着模型可以生成较长的回复,但在实际应用中仍受 FastGPT 平台配置的限制。引用上限 `1000000`

这一档模型的参数意味着什么

上下文长度 1000000 token (maxContext) 决定了模型在单次交互中能够处理的输入信息总量,这包括用户查询、历史对话以及系统召回的知识内容。单次最大输出未标注,意味着模型可以生成较长的回复,但在实际应用中仍受 FastGPT 平台配置的限制。引用上限 1000000 token (quoteMaxToken) 明确了模型在生成回复时可以引用的知识内容总预算,这是对召回内容量的一个关键约束。图片输入 true 使得模型能够处理视觉信息,支持多模态问答。工具调用 true 则表明模型具备利用外部工具执行特定任务的能力,可扩展其功能边界。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/database数据库连接的规范格式,确保 FastGPT 能够正确连接 openGauss 实例。
ef_construction100构建 HNSW 索引时的邻居搜索参数,影响索引质量和构建速度,提高召回准确率。
ef_search60查询 HNSW 索引时的邻居搜索参数,影响召回速度和准确率,平衡查询性能。
m32HNSW 索引中每个节点的最大邻居数,影响索引大小和搜索效率,兼顾存储与性能。
向量维度768与模型嵌入输出维度匹配,确保向量存储和检索的兼容性。
chunk_size800-1200 字符知识库分段的建议长度,平衡单段信息的完整性和召回效率。

这两者互相约束的地方

模型 1000000 token 的上下文长度为 RAG 架构提供了巨大的空间,允许 FastGPT 召回并处理大量的相关内容。然而,引用上限 1000000 token 对最终被模型引用的内容总量施加了硬性限制。向量库 openGauss 返回的是按条数计的知识段落,而引用上限是按 token 计量的。当每段知识的长度较短时,可能在达到引用上限前召回较多的段落条数;反之,若每段知识较长,则可能在召回较少条数时就触及引用上限。因此,在配置知识分段的 chunk_size 时,需要综合考虑模型引用上限与单次召回的条数预算。openGauss 的索引参数 ef_construction 和 ef_search 调大,通常会提升向量检索的准确性,即召回更相关的知识段落,这使得模型有更高质量的引用内容可用,从而在 1000000 token 的引用预算内生成更精准的回答。

容易做错的三处

  • 日志显示 database connection error: connection refused:OPENGAUSS_URL 中主机名或端口配置有误,或者 openGauss 服务未启动。
  • 回复内容与召回知识关联性不强,且引用内容为空:ef_search 设置过低,导致向量检索准确性不足,未能召回足够相关的知识。
  • RAG 模式下模型输出截断,提示 context window exceeded:召回内容总 token 量加上用户输入和历史对话,超出了 1000000 token 的上下文长度限制。

怎么确认配好了

  • 在 FastGPT 知识库测试界面,上传文档后,检查分段结果是否符合预期的 chunk_size。
  • 通过 FastGPT 的 RAG 测试功能,观察模型引用内容是否准确,并检查引用的总 token 量是否在 1000000 token 限制内。
  • 在 openGauss 数据库中,通过 SELECT count(*) FROM your_vector_table; 查询向量表的记录数,确认知识段落已成功入库。
  • 执行 FastGPT 的问答测试,观察响应时间,并与调整 ef_search 前的性能进行对比,判断检索效率是否符合预期。

参考资料