这一档模型的参数意味着什么
Hunyuan 这一档模型具备 256000 的上下文长度(maxContext),这意味着模型在单次交互中能处理的输入信息总量较大,能够容纳更多的召回内容或复杂指令。引用上限(quoteMaxToken)为 192000,这是对引用内容总 token 量的硬性预算,用于确保引用内容不会超出模型处理能力。工具调用(tool_calling)功能为 true,表明模型支持通过工具扩展能力,可以执行外部操作或获取实时信息。图片输入为 false,表示模型不直接接受图像作为输入。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:pass@host:port/database | 数据库连接字符串标准格式,用于建立与 OceanBase 服务的连接。 |
ef_construction | 64 | 影响 HNSW 图构建质量与检索速度的平衡,较高的值可以提高召回率但会增加构建时间。 |
m | 16 | HNSW 算法中每个节点的最大连接数,影响索引结构密度与检索性能,通常取 8-32。 |
recall_top_k | 5 | 向量检索返回的相似度最高的前 k 条数据,与引用上限共同决定最终召回内容。 |
chunk_overlap | 200 字符 | 分块时相邻文本块的重叠长度,有助于保持上下文连贯性,避免信息丢失。 |
SEEKDB_URL | mysql://user:pass@host:port/database | SEEKDB 与 OceanBase 兼容 MySQL 协议,配置方式相同。 |
这两者互相约束的地方
Hunyuan 256K 上下文模型与 OceanBase 向量库的配合需要关注多方面约束。召回条数与每段长度的乘积必须小于模型的总上下文预算,以确保所有召回内容都能被模型处理。引用上限以 token 计,而向量库返回的是按条数计的段落。具体是引用上限先触顶还是召回条数先触顶,取决于每个段落的平均 token 长度。如果段落较短,可能会先达到召回条数的上限;如果段落较长,则引用上限可能先被触发。此外,OceanBase 的索引参数,例如 ef_construction 和 m,调大后可以提高检索的准确性,这意味着模型能够获得更相关的上下文信息,进而可能提升模型的理解与生成质量。
容易做错的三处
- 连接 OceanBase 失败,日志显示
SQLSTATE[HY000] [2002] Can't connect to local MySQL server through socket。原因:OCEANBASE_URL中的主机或端口配置不正确,或者 OceanBase 服务未启动。 - 模型输出的内容明显与召回内容无关或信息不全,且响应时间较长。原因:
ef_construction或m参数设置过低,导致向量检索的召回质量差,模型接收到的上下文相关性不足。 - 模型返回的引用内容被截断,或提示
quoteMaxToken限制。原因:检索到的段落总 token 量超过了 Hunyuan 模型的 192000 引用上限,需要调整recall_top_k或分块策略。
怎么确认配好了
- 在 FastGPT 知识库管理界面上传文档,观察分块状态是否正常完成,并能通过关键词检索到相关分块。
- 配置一个 Agent,使用 Hunyuan 256K 模型和 OceanBase 向量库,进行一次包含复杂RAG查询的对话,核对模型返回的引用内容是否准确且完整。
- 在 OceanBase 数据库监控界面,观察向量检索请求的 QPS 和延迟,确保在预期负载下性能稳定。
- 通过 FastGPT 的调试工具,查看每次对话的实际输入 token 数和引用 token 数,确认未超出 Hunyuan 模型的上下文长度和引用上限。