这一档模型的参数意味着什么
Hunyuan 32K 上下文模型提供了 32000 token 的上下文长度,这意味着在单次对话中,模型可以处理包含更多历史对话和召回内容的请求。引用上限同样为 32000 token,这限定了模型在生成回复时可以引用的外部知识内容的总 token 预算。引用内容的段落条数由检索侧的返回数量决定,与引用上限是两个独立的考量维度。此档模型不具备图片输入和工具调用能力,因此在构建 Agent 流程时,需要将图片处理和外部功能调用逻辑置于模型调用之外。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | mysql://user:pass@host:port/db | 连接 OceanBase 数据库的完整 JDBC 兼容 URL,确保 FastGPT 可以访问。 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量与构建速度。较高的值能提升召回准确度,但会增加索引构建时间。 |
m | 16 | HNSW 索引参数,表示每个节点的最大邻居数。此值影响搜索精度和内存占用。 |
chunk_size | 500–800 字符 | 文本切片时的平均字符数,影响单段召回内容的粒度。 |
recall_count | 3–5 条 | 向量检索时返回的段落数量,直接影响模型可引用的信息量。 |
这两者互相约束的地方
模型 32000 token 的上下文预算是所有输入内容的总和。向量库召回的段落总字符数乘以每段的 token 转换比例,不能超过这个上限。引用上限同样按 token 计量,而向量库返回的是按条数计量的段落。具体是引用上限先触顶还是召回条数先触顶,取决于每段召回内容的平均长度。如果单段内容较短,可能在达到引用上限前就能召回更多条;反之,若单段内容较长,则可能在召回少量条数后就达到引用上限。OceanBase 的 ef_construction 和 m 等索引参数调高,通常能提升召回准确度,为模型提供更相关的上下文,从而在有限的引用预算内,提高模型回答的质量。
容易做错的三处
- 日志显示「OceanBase Connection Refused」,原因通常是
OCEANBASE_URL中的主机或端口配置不正确,或数据库防火墙未开放。 - 模型回复中引用的内容不完整或缺失关键信息,这往往是由于
chunk_size过小导致关键信息被切分,或recall_count太少未能召回足够上下文。 - 向量搜索响应时间过长,甚至超时,可能是因为 OceanBase 上的索引未正确创建,或
ef_construction值设置过高导致索引构建和查询效率下降。
怎么确认配好了
- 在 FastGPT 界面测试对话,观察模型回复是否能准确引用知识库内容,并检查引用的内容是否完整。
- 在 OceanBase 数据库客户端执行向量查询,核对查询结果的召回条数和相关性,与预期是否一致。
- 检查 FastGPT 运行日志,确保没有与 OceanBase 连接或查询相关的错误信息。
- 通过 FastGPT 的调试功能,查看模型实际接收的上下文和引用内容,评估其是否在模型上下文和引用上限范围内。