这一档模型的参数意味着什么
这一档模型具备 256000 token 的上下文长度(maxContext),这意味着单次交互中可容纳极大量的信息。引用上限(quoteMaxToken)也设定为 256000 token,这是引用内容可消耗的 token 预算。引用内容的总 token 量受到此限制。段落条数由检索结果决定,这与引用上限是两个独立的量。工具调用能力(tool_code)为 true,支持通过函数调用扩展模型能力。图片输入(image_input)为 false,当前版本不支持直接处理图像输入。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:pass@host:port/database | 连接 OceanBase 实例的必要信息,确保数据库可达。 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量与构建速度的平衡点。 |
m | 16 | HNSW 索引的邻居数量参数,影响召回精度与查询效率。 |
search_k | 按实测标定 | 检索阶段的候选邻居数,需根据实际查询性能和精度要求调整。 |
vector_dimension | 1536 | 向量维度需与 Embedding 模型输出维度保持一致。 |
chunk_size | 800–1200 字符 | 单个文档块的推荐长度,平衡语义完整性与检索效率。 |
这两者互相约束的地方
模型上下文长度与向量库召回结果之间存在紧密关联。向量库返回的段落条数与每段内容的长度决定了总的召回内容量。这个总量不能超过模型的上下文预算。引用上限按 token 计,向量库返回的按条数计。当单段内容较短时,可能在达到引用上限之前就已召回大量段落。当单段内容较长时,可能在召回少量段落后即触及引用上限。OceanBase 的索引参数 ef_construction 和 m 值调大后,向量检索的精度会提升,召回更相关的段落,这有助于在有限的引用上限内提供更高质量的上下文给模型。
容易做错的三处
- 日志显示
Connection refused:OCEANBASE_URL配置错误或 OceanBase 实例未启动。 - 检索结果为空或不相关:
ef_construction和m参数设置过低,导致 HNSW 索引质量不佳。 - 模型输出内容过短或不完整:引用上限的 token 预算不足,导致模型未能接收到足够的上下文信息。
怎么确认配好了
- 检查 OceanBase 数据库连接状态,确保
OCEANBASE_URL配置正确且可访问。 - 运行小型测试集,验证向量检索结果的召回率和相关性是否达到预期,并根据
search_k调整查询性能。 - 监控模型实际处理的上下文 token 数量,确保引用内容的 token 总量在
quoteMaxToken预算内。 - 通过 FastGPT 平台界面观察 RAG 流程,确认检索到的段落数量和内容符合预期。