这一档模型的参数意味着什么
当前档位的模型,如 gpt-4o-mini 和 gpt-4o,提供了 128000 个 token 的上下文长度,这意味着在单次对话中能够处理大量的输入信息,为 RAG 应用提供了充足的空间容纳召回内容。引用上限 60000 token 设定了模型在生成回答时,对知识库引用内容长度的硬性天花板。支持图片输入和工具调用,则表明这些模型可以处理多模态信息,并能通过外部工具拓展能力边界,适应更复杂的业务场景。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | FastGPT 连接 openGauss 数据库的标准连接串格式 |
ef_construction | 128 | 影响 HNSW 索引构建质量,过低召回差,过高构建慢 |
ef_search | 64 | 影响查询召回精度与速度,按实测标定,通常高于 ef_construction |
m = 32 | 32 | HNSW 索引中每个节点的最大连接数,影响索引结构和查询性能 |
| 召回段落数限制 | 10–20 条 | 结合模型引用上限与单段长度,避免超出上下文 |
| 单段知识长度 | 800–1200 字符 | 兼顾语义完整性与召回效率,避免单段过短或过长 |
这两者互相约束的地方
模型上下文长度与 openGauss 召回结果之间存在直接约束。RAG 系统从 openGauss 召回的文档段落总长度,不能超过模型的上下文长度预算。具体而言,召回条数乘以每段知识的平均长度,必须小于 128000 token 的上下文上限。同时,模型的引用上限 60000 token 进一步限制了最终能用于生成回答的知识内容量。在实际部署中,openGauss 的向量召回条数设置、FastGPT 的知识库引用条数设置以及模型的引用上限会形成一个逐层过滤的关系。当 openGauss 索引参数如 ef_construction 和 ef_search 被调大时,通常会提升召回的精确度,但这也会增加查询的计算开销,可能导致 FastGPT 在等待向量库响应时出现延迟,进而影响模型生成回答的整体响应速度。
容易做错的三处
- 日志显示
context window exceeded:召回的知识段落总长度超过了 128000 token 的模型上下文限制。 - 界面提示
knowledge reference limit reached:最终引用的知识内容总量超过了 60000 token 的引用上限。 - 检索结果相关性差,但 openGauss 查询耗时正常:
ef_search参数设置过低,导致向量召回精度不足。
怎么确认配好了
- 检查 FastGPT 系统日志,确认没有
OPENGAUSS_URL连接错误或Authentication failed错误。 - 在 FastGPT 知识库管理界面,上传并切分文档,确认切分后的段落数量和单段长度符合预期。
- 对知识库进行多次查询测试,观察模型回答中引用的知识点是否准确、全面,并检查引用的 token 数量是否在 60000 token 阈值内。
- 监控 openGauss 数据库的 CPU 和内存使用率,通过多次查询评估
ef_construction和ef_search参数对查询性能的影响,并根据实际负载调整。