这一档模型的参数意味着什么
这一档模型具备 130000 token 的上下文长度,允许在单次交互中处理大量输入信息。模型的引用上限设置为 60000 token,这限定了模型在生成回复时可以引用的外部知识内容的总 token 预算。引用内容的条数由检索系统的配置决定,引用上限约束的是这些内容的合计 token 消耗。工具调用能力的提供,意味着模型可以与外部系统进行交互,执行特定任务或获取实时数据。此档模型不具备图片输入能力,因此不适用于多模态视觉任务。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:password@host:port/database | 连接 OceanBase 数据库实例的唯一标识 |
ef_construction | 100–200 | 影响 HNSW 索引构建质量与查询速度,平衡索引构建时间和查询性能 |
m=16 | 16 | HNSW 图的层数,影响召回精度,过高会增加内存占用 |
search_k | 30–50 | 查询时 HNSW 算法的邻居节点搜索范围,影响召回率 |
top_k | 5–10 | 向量检索返回的文档条数,直接影响模型可引用的内容量 |
min_segment_length | 200 字符 | 切分文本段落的最小长度,避免过短的段落影响检索质量 |
这两者互相约束的地方
模型的 130000 token 上下文长度是总预算,其中包含了用户提问、历史对话、系统指令以及检索到的引用内容。OceanBase 向量库返回的文档条数与每条文档的长度共同决定了引用内容的总 token 量。引用上限 60000 token 约束的是这些引用内容的合计 token 预算。当向量库返回的每段文本较长时,即使返回条数不多,也可能迅速触及引用上限。反之,若每段文本较短,则可以返回更多条目。OceanBase 的 ef_construction 和 m 等索引参数调高,通常会提升检索的准确性,这意味着模型能够获得更高质量的引用内容,从而在相同的引用预算下,生成更精准的回复。
容易做错的三处
- 日志显示
Connection refused或Authentication failed:通常是OCEANBASE_URL配置中的连接信息(如 IP、端口、用户名、密码)有误。 - 查询结果返回的文档条数远低于预期:可能是 OceanBase 向量库的
top_k参数设置过低,或者索引数据量不足。 - 模型回复中引用内容缺失或不相关:OceanBase 的
ef_construction或m参数设置过低,导致向量检索精度不足,未能召回高质量的相关文档。
怎么确认配好了
- 在 FastGPT 界面测试对话,观察模型回复中引用的内容是否准确且完整。
- 通过 OceanBase 客户端工具,执行 SQL 查询验证向量索引
idx_vector是否已创建并包含数据。 - 监控 OceanBase 数据库的 CPU、内存使用情况,确保在
ef_construction和m参数调整后系统负载处于正常范围。 - 对比不同
top_k设置下的召回文档条数,评估其对模型引用内容的影响,并结合模型上下文预算确定合适的阈值。