这一档模型的参数意味着什么
Doubao 256K 上下文模型系列,其上下文长度高达 256000 token,这决定了单次模型交互中可以承载的大量信息,包括用户输入、历史对话以及检索到的相关内容。引用上限 224000 token 专门用于限制引用内容的 token 总量,确保模型在生成回复时有足够的预算来包含检索到的信息。段落的召回数量由向量检索系统决定,与引用内容的 token 预算是两个独立的概念。模型支持图片输入,允许在对话中处理视觉信息,并具备工具调用能力,能够与外部系统进行交互以完成特定任务。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:password@host:port/database | 数据库连接地址,需包含认证信息和目标数据库名 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量与构建速度的平衡点 |
m | 16 | HNSW 索引层数参数,决定索引图的连接度,影响召回精度 |
| 文本分段长度 | 800 字符 | 经验值,兼顾语义完整性与单段 token 消耗,减少截断 |
| 召回条数 | 5 条 | 结合引用上限,确保单次召回内容在模型预算内 |
SEEKDB_URL | seekdb://user:password@host:port/database | SEEKDB 与 OceanBase 兼容,配置方式相同 |
这两者互相约束的地方
召回条数与每段文本的长度共同决定了向量库返回的总 token 量。这一总token量需要控制在模型的上下文预算之内,以避免超出模型处理能力。引用上限按 token 计数,而向量库返回的是独立的段落条数,两者之间的关系取决于每个段落的实际 token 长度。当单个段落较短时,可以在引用上限内召回更多条段落;当单个段落较长时,召回少量段落就可能触及引用上限。索引参数 ef_construction 和 m 的调整会影响向量检索的精度和速度。当这些参数调大时,通常意味着更精准的召回结果,这对于模型理解复杂查询和生成高质量回复至关重要,能更有效地利用模型的引用上限。
容易做错的三处
- 日志显示
Connection refused错误,原因是OCEANBASE_URL配置的主机或端口不正确。 - 检索结果为空,原因可能是索引尚未完全构建或数据未正确导入 OceanBase。
- 模型回复内容缺乏相关性,通常是由于向量索引参数
ef_construction或m设置过低,导致召回精度不足。
怎么确认配好了
- 执行一次测试查询,检查向量库是否能返回预期的召回条数和内容。
- 通过 FastGPT 界面观察 RAG 链路的引用内容,确认实际引用的 token 量与配置的引用上限是否匹配。
- 监控 OceanBase 的数据库连接数和查询延迟,确保系统在高负载下稳定运行。
- 针对复杂查询进行端到端测试,评估模型回复的相关性和准确性,以确定
ef_construction和m等参数的合理阈值。