这一档模型的参数意味着什么
Hunyuan 256K 模型的 maxContext 达 256000,表明其能够处理极为庞大的输入文本,为RAG(检索增强生成)任务提供了宽裕的召回内容承载空间。quoteMaxToken 为 192000,意味着引用内容在总输入中的预算上限。模型支持工具调用 (tool_calling: true),可以与外部工具集成,扩展其功能。不支持图片输入 (image_input: false),在多模态场景下需要额外处理。单次最大输出未标注,但在实际应用中通常会有一个隐式或显式的限制,需要通过实验确定。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 连接 openGauss 数据库实例的统一资源定位符 |
ef_construction | 100 | 影响索引构建时的图连接数,越大召回质量越高,构建时间越长 |
ef_search | 64 | 影响查询时的图遍历深度,越大召回质量越高,查询延迟越高 |
m | 32 | 影响 HNSW 图的层间连接数,是 HNSW 算法的核心参数之一,通常取 16 到 64 |
top_k | 5 | 向量检索返回的条目数量,需要与模型 quoteMaxToken 协同 |
chunk_size | 800 字符 | 单个文本块的建议长度,影响召回效率与模型理解度 |
这两者互相约束的地方
模型的 maxContext 为 256000,这意味着召回条数与每段长度的乘积,加上查询本身和其他系统提示词,必须控制在这个总预算之内。quoteMaxToken 192000 是专门用于引用内容的 token 预算。向量库返回的是固定数量的段落条数,而模型的引用上限是 token 预算,两者不是直接的等价关系。当每段文本较长时,即使返回条数不多,也可能迅速触及 quoteMaxToken 上限;反之,如果每段文本较短,则可以召回更多条目。openGauss 的 ef_construction 和 ef_search 参数调大后,向量检索的召回质量会提高,为模型提供更相关的上下文,这对于充分利用 Hunyuan 256K 模型的长上下文能力至关重要,但同时也会增加索引构建和查询的资源消耗。
容易做错的三处
- 日志显示
context window exceeded:召回的文本段落总长度加上用户输入,超出了模型的maxContext。 - 模型返回的回答内容简短,且未包含关键信息:
quoteMaxToken预算不足,导致有效引用内容被截断。 - 向量检索结果质量不高,模型回答出现事实性错误:openGauss 的
ef_search或m参数设置过小,导致检索准确性下降。
怎么确认配好了
- 通过 FastGPT 界面发送一个长文本查询,观察模型是否能正确理解并引用所有相关信息。
- 逐步增加检索的
top_k值,同时监测模型返回的引用内容是否充分,并避免context window exceeded错误。 - 在 openGauss 数据库中,通过
pg_stat_statements观察向量查询的延迟,并与业务可接受的响应时间进行对比。 - 使用不同长度的文本进行向量嵌入和查询,确认 openGauss 的索引性能在多种场景下均符合预期。