模型指南官方文档4 分钟阅读模型组合页

Hunyuan 250K 上下文 这一档模型配 OceanBase 的配置口径

Hunyuan 250K 上下文模型,其 250000 的上下文长度,决定了单次请求中可输入提示词与召回内容的上限。这意味着在 RAG 场景下,可以承载更丰富的知识片段,减少因上下文不足导致的信息丢失。单次最大输出未标注,通常表示模型会根据输入内容和内部逻辑生成尽可能完整的回答。引用上限 10000

这一档模型的参数意味着什么

Hunyuan 250K 上下文模型,其 250000 的上下文长度,决定了单次请求中可输入提示词与召回内容的上限。这意味着在 RAG 场景下,可以承载更丰富的知识片段,减少因上下文不足导致的信息丢失。单次最大输出未标注,通常表示模型会根据输入内容和内部逻辑生成尽可能完整的回答。引用上限 100000,则明确了知识库引用段落数量的天花板,限制了模型在生成回复时可以引用的外部知识条目总数。图片输入为 false,工具调用为 false,表明此模型专注于文本处理,不支持图像作为输入或通过工具扩展能力。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLob://user:password@host:port/database数据库连接的唯一标识,确保 FastGPT 能正确连接到 OceanBase 实例。
ef_construction64HNSW 索引构建参数,影响索引质量与构建速度。较低值索引构建快但召回质量可能下降。
m16HNSW 索引邻居数参数,影响召回精度与查询效率。较高值召回精度高,但查询延迟可能增加。
top_k5向量检索返回的相似度最高条数,结合模型上下文长度与引用上限进行调整。
chunk_size800知识库分段的文本长度,影响单次召回片段的信息密度。
max_tokens128000模型实际用于召回内容的最大 token 数,需小于模型上下文长度。

这两者互相约束的地方

Hunyuan 250K 上下文模型与 OceanBase 向量库的协同,核心在于上下文长度的有效管理。召回条数乘以每段长度的总和,必须严格控制在 250000 token 的上下文预算之内,避免因输入过长导致模型截断或理解偏差。模型的引用上限 100000,与 OceanBase 向量库返回的 top_k 条数共同作用。当 top_k 设置超过引用上限时,模型只会处理引用上限内的条目。OceanBase 的 ef_construction 和 m 等索引参数调大,通常会提升向量检索的精度,为模型提供更准确的召回结果。但这也会增加索引构建时间和存储空间,需要在召回质量与系统开销之间取得平衡。

容易做错的三处

  • 在 FastGPT 日志中出现 context length exceeded 错误,原因是 chunk_size * top_k 的总 token 数超出了 250000。
  • OceanBase 向量检索返回的 top_k 条目数,在 FastGPT 界面显示却少于预期,原因是模型的引用上限低于 top_k 设置。
  • 向量检索耗时过长,导致请求超时,原因可能是 ef_construction 或 m 设置过高,导致索引查询效率下降。

怎么确认配好了

  • 在 FastGPT 中创建一个知识库,导入少量文档,检查知识库分段是否符合 chunk_size 的设定。
  • 通过 FastGPT 的调试接口,模拟一次带知识库的对话,观察模型返回的引用信息,确认引用条数是否与 top_k 设置相符。
  • 监控 OceanBase 数据库的慢查询日志,确保向量检索的查询时间在可接受范围内,以此判断 ef_construction 和 m 参数的合理性。
  • 在 FastGPT 侧查看日志,确认没有出现 context length exceeded 或其他与上下文相关的错误信息。

参考资料