这一档模型的参数意味着什么
此档模型提供 131000 tokens 的上下文长度,决定了单次交互中可携带的历史对话和检索内容的上限。引用上限 100000 tokens 规定了知识库内容在模型输入中的最大占比,这直接影响了 RAG 场景下可提供的引用文本量。未标注的单次最大输出表示模型在生成回答时没有明确的字符长度限制,但实际输出仍受限于整体上下文长度。工具调用 true 意味着此档模型支持通过外部工具增强其能力,例如执行数据库查询或 API 调用,扩展了其应用边界。图片输入 false 则表明此档模型不具备处理图像信息的能力。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | FastGPT 连接 openGauss 实例的标准 PostgreSQL 连接字符串格式。 |
ef_construction | 100–200 | 索引构建时用于控制图的连接性,影响索引质量和构建时间。此范围平衡了精度与效率。 |
ef_search | 50–100 | 搜索时用于控制近邻搜索的精度,影响查询召回率和响应时间。此范围适用于多数 RAG 场景。 |
m | 32 | HNSW 图中每个节点的最大连接数,影响索引的存储空间和查询性能。32 是 openGauss 推荐的平衡值。 |
| 召回条数 | 10–20 条 | 经验值,结合模型引用上限与单段长度,避免上下文溢出。 |
| 单段最大长度 | 800–1200 字符 | 确保每段内容足够完整且不会过长,超出模型处理效率。 |
这两者互相约束的地方
模型 131000 tokens 的上下文长度是核心约束。在 RAG 场景下,openGauss 返回的召回条数与每段内容的长度乘积,加上历史对话和指令的 token 消耗,必须严格控制在此上限以内。如果 openGauss 返回的召回条数过多或每段内容过长,将导致模型输入溢出,可能引发 400 状态码的错误。引用上限 100000 tokens 进一步限制了知识库内容在模型输入中的占比,即使整体上下文未溢出,过多的引用内容也可能被截断。openGauss 的 ef_construction 和 ef_search 参数调高,可以提升向量检索的精度和召回率,意味着模型能获得更相关的上下文信息,但同时也会增加 openGauss 的计算负载和响应时间,这需要与模型处理速度和应用场景的实时性要求进行权衡。
容易做错的三处
- 日志显示
context_length_exceeded错误:原因在于 openGauss 返回的召回内容加上历史对话,总 token 数超出了模型 131000 的上下文限制。 - 检索结果相关性低,模型回答质量不佳:原因可能是 openGauss 的
ef_search参数设置过低,导致向量检索的精度不足,未召回最相关的知识片段。 - 模型回答中知识点缺失或不完整:原因可能是配置的单段最大长度过短,导致 openGauss 返回的知识片段被截断,关键信息丢失。
怎么确认配好了
- 通过 FastGPT 提供的调试界面,观察每次模型调用的实际输入 token 数,确保其稳定在 131000 tokens 以下。
- 在 FastGPT 中上传具有代表性的知识库内容,并进行多次检索测试,检查 openGauss 返回的召回条数是否符合预期,且每段内容是否完整。
- 监控 openGauss 实例的 CPU、内存和 I/O 使用率,确保在 FastGPT 高并发场景下,openGauss 能够稳定提供检索服务,响应时间在可接受范围内。