这一档模型的参数意味着什么
Hunyuan 32K 上下文模型提供了 32000 token 的上下文长度,这意味着在单次对话中可以处理大量的输入信息。模型单次最大输出未标注,通常表示其在生成回答时没有明确的长度限制。引用上限 quoteMaxToken 限定了引用内容的总 token 预算,模型会在此预算内整合来自知识库的召回信息。段落条数由检索侧的返回数量决定,这与引用内容的 token 预算是两个独立的衡量维度。模型不支持图片输入和工具调用,因此在应用设计时需避免依赖这些功能。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | FastGPT 连接 openGauss 数据库的标准连接字符串格式。 |
ef_construction | 64 | 构建 HNSW 索引时,控制邻居节点搜索的宽度。更大的值可以提高召回质量,但会增加索引构建时间。 |
ef_search | 32 | 查询 HNSW 索引时,控制搜索的宽度。更大的值可以提高查询召回率,但会增加查询耗时。 |
m = 32 | 32 | HNSW 索引中每个节点的最大邻居数量。影响索引的构建速度、查询性能和存储空间,32 是一个平衡的选择。 |
max_connections | 100 | openGauss 数据库的最大并发连接数,需根据 FastGPT 实例的并发量进行调整。 |
work_mem | 128MB | openGauss 查询操作在内存中使用的最大工作空间,影响排序和哈希操作的性能。 |
这两者互相约束的地方
Hunyuan 32K 上下文模型与 openGauss 向量库的配合需要关注召回内容的整合。模型的上下文预算为 32000 token,这意味着从 openGauss 召回的文档段落总长度(条数乘以每段平均 token 数)不应超过此限制,以确保所有召回内容都能被模型有效处理。引用上限 quoteMaxToken 是一个独立的 token 预算,它限定了最终呈现给模型作为引用的内容总 token 量。向量库返回的是固定数量的段落条数,当每段文档的 token 数较长时,引用上限可能在召回条数达到最大值之前就已经触顶。反之,若每段文档较短,则可能在引用上限触顶前,召回条数已达到预设限制。openGauss 索引参数 ef_construction 和 ef_search 的调大,意味着向量检索的精度可能提升,从而为模型提供更相关的上下文信息。
容易做错的三处
- 模型返回“上下文长度超出限制”错误:原因在于从 openGauss 召回的文档总 token 数,加上用户查询和系统提示词,超过了 32000 token 的上下文长度限制。
- 引用内容不完整或缺失关键信息:原因可能是
quoteMaxToken设置过小,导致在将 openGauss 召回的段落整合为引用时,部分内容被截断。 - 向量搜索响应时间过长:原因可能是
ef_search设置过大,导致 openGauss 在进行向量检索时计算量增加,影响了查询效率。
怎么确认配好了
- 部署后,在 FastGPT 界面发起测试对话,观察模型返回的引用内容是否完整、相关,并检查日志中是否有上下文超限的警告。
- 针对不同长度的查询和知识库内容,调整
quoteMaxToken参数,确保在模型上下文预算内,引用内容能充分利用。 - 通过 FastGPT 的监控指标或 openGauss 的性能视图,检查向量搜索的平均响应时间是否在可接受范围内。