这一档模型的参数意味着什么
hunyuan-turbo-vision 模型具有 6000 token 的上下文长度,这意味着单次请求中可以处理的总输入文本量(包括指令、历史对话和检索内容)上限为 6000 token。引用上限同样设定为 6000 token,它限定了从知识库召回并用于生成回答的引用内容所能占据的 token 总数。因此,引用内容的长度直接受此约束。引用内容的段落条数由检索侧的返回条数决定,两者是不同的量。模型支持图片输入,可处理多模态信息,但不支持工具调用能力。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:password@host:port/database | 连接 OceanBase 数据库的必要凭证,确保指向正确的实例。 |
ef_construction | 100–200 | 影响 HNSW 索引的构建质量与查询速度,数值越大,索引质量越高,召回更精准。 |
m | 16 | HNSW 索引中每个节点的最大连接数,影响召回效率与内存占用。 |
recall_max_segments | 前 5 条 | 向量库单次召回的最大段落数量,直接影响送入模型的内容量。 |
segment_max_tokens | 800–1200 | 知识库中每个文本段落的最大 token 长度,避免单个段落过长超出模型处理能力。 |
这两者互相约束的地方
模型上下文长度与向量库召回内容之间存在直接约束。当 recall_max_segments 乘以 segment_max_tokens 的结果接近或超过模型的 6000 token 上下文预算时,系统可能因为输入过长而截断内容或引发错误。引用上限 6000 token 按 token 数量进行限制,而向量库返回的是按条数计的段落。具体哪个限制先被触发,取决于每个召回段落的实际长度。例如,如果每个段落很短,即使召回多条也不会触及引用上限;如果段落很长,即使召回条数不多也可能迅速达到引用上限。OceanBase 的 ef_construction 和 m 等索引参数调大后,向量检索的精度会提升,这意味着召回的段落与查询的相关性更高,但同时可能增加索引构建和查询的资源消耗,需要权衡。
容易做错的三处
OCEANBASE_URL配置错误导致连接失败,日志显示SQLSTATE[HY000] [2002] Connection refused。- 召回条数与段落长度乘积超过 6000 token 引用上限,导致模型返回内容不完整或截断提示。
ef_construction或m参数设置过小,导致检索结果相关性差,用户反馈回答质量不高。
怎么确认配好了
- 检查 FastGPT 界面中 OceanBase 连接状态,确认显示“连接成功”。
- 提交一个长查询,观察模型返回的引用内容是否完整,并检查引用内容的总 token 数是否符合 6000 token 的限制。
- 针对特定问题进行多轮对话测试,评估模型回答的相关性,以此确定
ef_construction和m等参数的合理阈值。