模型指南官方文档4 分钟阅读模型组合页

Claude 200K 上下文 这一档模型配 openGauss 的配置口径

这一档模型提供 200000 token 的上下文长度,决定了单次交互中可处理的全部文本总量,包括用户输入、历史对话和召回内容。模型单次最大输出长度未明确标注,通常可支持较长的回复生成。引用上限为 100000 token,这是专用于召回内容占用的 token 预算,召回的段落总长度应在此预算内。段

这一档模型的参数意味着什么

这一档模型提供 200000 token 的上下文长度,决定了单次交互中可处理的全部文本总量,包括用户输入、历史对话和召回内容。模型单次最大输出长度未明确标注,通常可支持较长的回复生成。引用上限为 100000 token,这是专用于召回内容占用的 token 预算,召回的段落总长度应在此预算内。段落条数由向量检索侧决定,与引用上限是两个独立维度。模型支持图片输入,允许处理多模态信息,并具备工具调用能力,可集成外部服务以扩展功能。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/databaseFastGPT 连接 openGauss 数据库的标准格式,确保网络可达
ef_construction100–200影响索引构建时的图连接数量,提升构建质量,减少查询时召回不足
ef_search60–120影响查询时遍历的邻居节点数量,增加召回精度,与 m 配合优化
m32HNSW 索引中每个节点的最大连接数,平衡索引大小与查询性能
vector_dimension1536与模型嵌入向量维度保持一致,确保向量匹配的正确性
recall_max_segments前 10 条根据模型引用上限和单段平均长度估算,避免超限

这两者互相约束的地方

模型上下文长度是总预算,召回条数与每段长度的乘积必须在此预算内。引用上限是召回内容专用的 token 预算,向量库返回的段落按条数计,具体能引用多少条取决于每条段落的平均 token 长度。如果单段内容较短,可能在引用上限触达前召回更多条;如果单段内容较长,则可能在引用上限内召回较少条。openGauss 索引参数如 ef_construction 和 ef_search 调大后,向量检索的精度会提升,这意味着更相关的段落会被优先召回。对于 Claude 200K 上下文这类大模型,高召回精度能够充分利用其处理长文本的能力,确保输入给模型的上下文质量,从而提高模型输出的准确性和相关性。

容易做错的三处

  • 检索日志中出现 ERROR: context_length_exceeded 错误:原因在于召回内容与用户输入及历史对话的总 token 数超过了 200000 的上下文长度限制。
  • 模型返回的回答中引用内容不完整或缺失:原因在于向量库返回的段落总 token 数超出了 100000 的引用上限,导致部分内容被截断。
  • 查询结果相关性不佳,或召回条数远低于预期:原因可能是 ef_search 参数设置过低,导致向量索引在查询时探索不足,未能找到足够多的相关邻居。

怎么确认配好了

  • 在 FastGPT 调试界面,观察每次对话的上下文 Token 消耗,确保召回内容 Token 预算稳定在 100000 以内。
  • 通过 FastGPT 的 RAG 调试功能,检查向量召回的条数和每条内容的长度,结合模型引用上限估算单次召回的合理条数。
  • 模拟不同类型的用户查询,观察 openGauss 数据库的查询日志,确认 ef_search 参数调整后查询耗时是否在可接受范围内,并分析召回段落的相关性。

参考资料