这一档模型的参数意味着什么
Hunyuan 这一档模型具备 6000 token 的上下文长度,这意味着在单次交互中可以处理的总文本量上限。引用上限为 4000 token,这部分预算专用于承载从知识库中检索到的引用内容。引用上限是模型处理引用内容的总量约束,而具体召回的段落条数由检索逻辑决定。图片输入功能的存在,表明该模型支持多模态输入,能够处理包含图像的请求。工具调用功能未启用,表示该模型不直接支持通过内部机制调用外部工具执行特定操作。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:pass@host:port/database | 连接 OceanBase 实例的必要信息,确保数据库可访问。 |
ef_construction | 80 | 控制 HNSW 索引的构建质量,提高召回精度与构建速度的平衡点。 |
m | 16 | HNSW 索引中每个节点的最大连接数,影响召回效率和内存占用。 |
| 召回条数 | 3-5 条 | 结合模型引用上限与单段平均长度,确保引用内容有效利用模型预算。 |
| 单段最大字符数 | 800-1200 字符 | 避免单段过长,超出模型处理能力或导致信息冗余。 |
| 检索匹配阈值 | 0.75-0.85 | 平衡召回的精确性与召回率,减少不相关内容的引入。 |
这两者互相约束的地方
模型上下文长度是总输入量的上限,召回条数与每段长度的乘积,加上用户提问和系统指令的 token 数,必须在此上限内。引用上限是模型专门用于处理检索内容的 token 预算。当向量库返回多段内容时,这些内容的 token 总和需要控制在引用上限之内。引用上限限制的是引用内容的整体 token 量,而向量库返回的是固定条数。具体能引用多少条,取决于每段内容的平均 token 长度。如果索引参数,例如 ef_construction 和 m 值调大,向量搜索的召回质量通常会提高,这可能意味着召回的段落更具相关性,从而更好地利用模型的引用上限。
容易做错的三处
- 查询结果返回空,但知识库中明明有相关文档:可能是检索匹配阈值设置过高,导致相关文档被过滤。
- 模型回答内容过短或不完整,且日志显示引用内容被截断:引用的内容总 token 数超出了模型的
quoteMaxToken上限。 - 向量搜索耗时过长,影响整体响应速度:OceanBase 的
ef_construction或m参数设置过大,导致索引构建或查询负担过重。
怎么确认配好了
- 向知识库提问,检查模型回答中引用的内容是否与检索到的文档高度相关。
- 观察日志输出,确认每次检索返回的条数与配置的召回条数是否一致。
- 通过模拟高并发请求,评估 OceanBase 的向量搜索响应时间,确保其在可接受范围内。
- 检查模型单次输出的 token 数量,确保其在
maxTokens限制内,且回答内容完整。