模型指南官方文档4 分钟阅读模型组合页

Hunyuan 224K 上下文 这一档模型配 OceanBase 的配置口径

Hunyuan 这一档模型具备 224000 的上下文长度,这意味着一次交互中可以处理的总输入量较大,为更复杂的指令和更长的历史对话提供了空间。模型单次最大输出未明确标注,实际输出长度需通过测试确定。引用上限为 224000 token,这限定了模型在生成回答时可以参考的引用内容总量。引用上限是引用

这一档模型的参数意味着什么

Hunyuan 这一档模型具备 224000 的上下文长度,这意味着一次交互中可以处理的总输入量较大,为更复杂的指令和更长的历史对话提供了空间。模型单次最大输出未明确标注,实际输出长度需通过测试确定。引用上限为 224000 token,这限定了模型在生成回答时可以参考的引用内容总量。引用上限是引用内容合计占用的 token 预算。段落条数由检索侧的返回条数决定,引用上限的限制与返回的段落条数是不同的量。此档模型不支持图片输入和工具调用,因此在应用设计时应避免依赖这些能力。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLmysql://user:pass@host:port/db连接 OceanBase 数据库的必要信息,确保可达性。
ef_construction100–200影响 HNSW 索引的构建质量和搜索速度,权衡查询性能与索引构建时间。
m16HNSW 索引的邻居数量参数,影响召回率与索引大小,此为推荐的通用值。
FastGPT_Max_Recall_Segments5限制从向量库召回的段落数量,防止超量占用模型上下文。
FastGPT_Segment_Char_Limit800–1200限制每段文本的字符长度,以适配模型上下文和引用上限。

这两者互相约束的地方

模型 224000 的上下文长度是总输入量的上限。向量库召回的段落总字符数乘以每段的 token 消耗,不能超过这个上下文预算。引用上限按 token 计数,而向量库返回的是按段落条数计数,哪一个先达到限制取决于每段内容的实际长度。当每段内容较短时,可能会先达到召回条数的上限;当每段内容较长时,可能会先达到引用上限的 token 限制。OceanBase 的索引参数,如 ef_construction 和 m=16,调大后可以提高检索的召回率和准确性。对于 Hunyuan 224K 这种大上下文模型,更高的召回质量意味着模型能获取更精准、更全面的信息来生成回答,从而提升输出的质量。然而,过高的 ef_construction 值会增加索引构建时间和查询延迟,需要在实际应用中进行权衡。

容易做错的三处

  • 日志显示 Connection refused 或 Authentication failed:通常是 OCEANBASE_URL 配置错误,检查主机、端口、用户名或密码是否正确。
  • 模型输出内容与预期引用内容不符,或输出长度过短:可能是召回的段落条数过少,或者 FastGPT_Segment_Char_Limit 设置过小,导致模型获取的信息不足。
  • 查询响应时间过长,甚至超时:可能是 OceanBase 的索引参数 ef_construction 设置过高,导致检索效率下降,或数据库负载过重。

怎么确认配好了

  • 执行一次简单的 RAG 查询,检查 FastGPT 控制台的调试信息中,召回的段落数量和每段的字符长度是否符合预期,没有截断或异常。
  • 在 OceanBase 数据库监控中观察查询 QPS 和延迟,确保在正常业务负载下,向量检索的 P99 延迟处于可接受范围。
  • 通过 FastGPT 的 RAG 评估功能,验证模型在引用召回内容后生成回答的准确性与相关性,判断是否达到了业务要求。

参考资料