这一档模型的参数意味着什么
这一档模型提供 200000 token 的上下文长度,决定了单次交互中可处理的全部文本总量,包括用户输入、历史对话和召回内容。模型单次最大输出长度未明确标注,通常可支持较长的回复生成。引用上限为 100000 token,这是专用于召回内容占用的 token 预算,召回的段落总长度应在此预算内。段落条数由向量检索侧决定,与引用上限是两个独立维度。模型支持图片输入,允许处理多模态信息,并具备工具调用能力,可集成外部服务以扩展功能。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | FastGPT 连接 openGauss 数据库的标准格式,确保网络可达 |
ef_construction | 100–200 | 影响索引构建时的图连接数量,提升构建质量,减少查询时召回不足 |
ef_search | 60–120 | 影响查询时遍历的邻居节点数量,增加召回精度,与 m 配合优化 |
m | 32 | HNSW 索引中每个节点的最大连接数,平衡索引大小与查询性能 |
vector_dimension | 1536 | 与模型嵌入向量维度保持一致,确保向量匹配的正确性 |
recall_max_segments | 前 10 条 | 根据模型引用上限和单段平均长度估算,避免超限 |
这两者互相约束的地方
模型上下文长度是总预算,召回条数与每段长度的乘积必须在此预算内。引用上限是召回内容专用的 token 预算,向量库返回的段落按条数计,具体能引用多少条取决于每条段落的平均 token 长度。如果单段内容较短,可能在引用上限触达前召回更多条;如果单段内容较长,则可能在引用上限内召回较少条。openGauss 索引参数如 ef_construction 和 ef_search 调大后,向量检索的精度会提升,这意味着更相关的段落会被优先召回。对于 Claude 200K 上下文这类大模型,高召回精度能够充分利用其处理长文本的能力,确保输入给模型的上下文质量,从而提高模型输出的准确性和相关性。
容易做错的三处
- 检索日志中出现
ERROR: context_length_exceeded错误:原因在于召回内容与用户输入及历史对话的总 token 数超过了 200000 的上下文长度限制。 - 模型返回的回答中引用内容不完整或缺失:原因在于向量库返回的段落总 token 数超出了 100000 的引用上限,导致部分内容被截断。
- 查询结果相关性不佳,或召回条数远低于预期:原因可能是
ef_search参数设置过低,导致向量索引在查询时探索不足,未能找到足够多的相关邻居。
怎么确认配好了
- 在 FastGPT 调试界面,观察每次对话的上下文 Token 消耗,确保召回内容 Token 预算稳定在 100000 以内。
- 通过 FastGPT 的 RAG 调试功能,检查向量召回的条数和每条内容的长度,结合模型引用上限估算单次召回的合理条数。
- 模拟不同类型的用户查询,观察 openGauss 数据库的查询日志,确认
ef_search参数调整后查询耗时是否在可接受范围内,并分析召回段落的相关性。