这一档模型的参数意味着什么
Grok 模型家族中 grok-build-0.1 具备 256000 的上下文长度,这意味着在单次对话中模型能够处理大量的历史信息或召回内容。单次最大输出未标注,表明模型在生成回答时没有明确的字符或 token 限制,其输出长度主要受限于上下文窗口。引用上限为 200000 token,这是模型用于理解和整合引用内容的最大 token 预算。引用内容的条数由检索系统决定,与引用上限是两个独立的考量。该模型支持图片输入,允许在提示中嵌入图像信息。同时,它支持工具调用,使其能够与外部工具集成,执行特定任务。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:pass@host:port/database | 连接 OceanBase 实例的必要信息,确保数据库可访问 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量与构建速度,64 是较好的平衡点 |
m | 16 | HNSW 索引邻居数,影响召回精度,16 为常见且有效的取值 |
recall_top_k | 5 | 向量检索返回的段落条数,与模型上下文预算相关 |
chunk_size | 1000 | 知识库分段的字符长度,与模型引用上限相关 |
index_type | HNSW | OceanBase 向量索引类型,当前版本推荐 HNSW 以保证性能 |
这两者互相约束的地方
模型的 256000 token 上下文长度是处理所有输入内容的预算,包括用户查询、历史对话、系统指令以及从向量库召回的引用内容。当从 OceanBase 向量库召回多条段落时,这些段落的总字符数转换为 token 后,不能超过模型的上下文预算。引用上限 200000 token 专门用于限制引用内容的 token 总量。向量库返回的是固定条数的段落,而模型引用上限是按 token 计算的,因此,每段文本的平均长度决定了在达到引用上限之前能包含多少条段落。如果每段文本较短,可引用的段落条数会更多;如果每段文本较长,则可能在条数较少时就触及 token 限制。OceanBase 的 ef_construction 和 m 等索引参数调大后,向量检索的精度通常会提高,召回的段落与查询的相关性更强,这有助于模型更好地理解和利用引用信息,提升回答质量。
容易做错的三处
- 日志显示
Connection refused for OceanBase:OCEANBASE_URL中的主机或端口配置不正确,或网络策略阻止了连接。 - 检索结果返回的段落条数与预期不符:
recall_top_k配置过小或向量库中符合条件的段落不足。 - 模型回答出现“知识缺失”或“无法回答”:
chunk_size设置过大,导致单段文本包含过多无关信息,或过小导致重要信息被截断。
怎么确认配好了
- 提交一个包含复杂查询的请求,观察日志中 OceanBase 的查询耗时,确保在可接受范围内。
- 检查模型返回的回答,验证其中是否包含了从知识库召回的关键信息,并与原始文档进行比对。
- 调整
recall_top_k参数,观察模型在不同召回条数下的回答质量变化,确定合适的阈值。