这一档模型的参数意味着什么
Hunyuan 这一档模型具备 224000 的上下文长度,这意味着一次交互中可以处理的总输入量较大,为更复杂的指令和更长的历史对话提供了空间。模型单次最大输出未明确标注,实际输出长度需通过测试确定。引用上限为 224000 token,这限定了模型在生成回答时可以参考的引用内容总量。引用上限是引用内容合计占用的 token 预算。段落条数由检索侧的返回条数决定,引用上限的限制与返回的段落条数是不同的量。此档模型不支持图片输入和工具调用,因此在应用设计时应避免依赖这些能力。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | mysql://user:pass@host:port/db | 连接 OceanBase 数据库的必要信息,确保可达性。 |
ef_construction | 100–200 | 影响 HNSW 索引的构建质量和搜索速度,权衡查询性能与索引构建时间。 |
m | 16 | HNSW 索引的邻居数量参数,影响召回率与索引大小,此为推荐的通用值。 |
FastGPT_Max_Recall_Segments | 5 | 限制从向量库召回的段落数量,防止超量占用模型上下文。 |
FastGPT_Segment_Char_Limit | 800–1200 | 限制每段文本的字符长度,以适配模型上下文和引用上限。 |
这两者互相约束的地方
模型 224000 的上下文长度是总输入量的上限。向量库召回的段落总字符数乘以每段的 token 消耗,不能超过这个上下文预算。引用上限按 token 计数,而向量库返回的是按段落条数计数,哪一个先达到限制取决于每段内容的实际长度。当每段内容较短时,可能会先达到召回条数的上限;当每段内容较长时,可能会先达到引用上限的 token 限制。OceanBase 的索引参数,如 ef_construction 和 m=16,调大后可以提高检索的召回率和准确性。对于 Hunyuan 224K 这种大上下文模型,更高的召回质量意味着模型能获取更精准、更全面的信息来生成回答,从而提升输出的质量。然而,过高的 ef_construction 值会增加索引构建时间和查询延迟,需要在实际应用中进行权衡。
容易做错的三处
- 日志显示
Connection refused或Authentication failed:通常是OCEANBASE_URL配置错误,检查主机、端口、用户名或密码是否正确。 - 模型输出内容与预期引用内容不符,或输出长度过短:可能是召回的段落条数过少,或者
FastGPT_Segment_Char_Limit设置过小,导致模型获取的信息不足。 - 查询响应时间过长,甚至超时:可能是 OceanBase 的索引参数
ef_construction设置过高,导致检索效率下降,或数据库负载过重。
怎么确认配好了
- 执行一次简单的 RAG 查询,检查 FastGPT 控制台的调试信息中,召回的段落数量和每段的字符长度是否符合预期,没有截断或异常。
- 在 OceanBase 数据库监控中观察查询 QPS 和延迟,确保在正常业务负载下,向量检索的 P99 延迟处于可接受范围。
- 通过 FastGPT 的 RAG 评估功能,验证模型在引用召回内容后生成回答的准确性与相关性,判断是否达到了业务要求。