这一档模型的参数意味着什么
Qwen 1024K 上下文模型档位提供了 1024000 token 的上下文长度,这决定了单次请求中可以输入给模型的所有文本内容总量。引用上限为 1000000 token,这意味着模型在生成回复时,可以从知识库中引用内容的总预算。工具调用能力的开启允许模型执行预设的外部函数,以获取实时信息或执行特定操作。图片输入为 false 则表明此档模型不支持直接处理图像数据。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 连接 openGauss 数据库实例的必要信息,需与实际部署匹配。 |
ef_construction | 100 | 影响索引构建时的精度与速度,此值在性能与召回率之间提供平衡。 |
ef_search | 64 | 影响查询时的召回精度,适当提高可提升召回质量,但会增加查询耗时。 |
m | 32 | HNSW 索引的图层连接数,影响索引结构和查询性能。 |
| 检索条数 | 前 15 条 | 根据引用上限和单段平均长度估算,确保能充分利用模型上下文。 |
| 单段最大长度 | 800–1200 字符 | 兼顾信息密度与模型处理能力,避免过长或过短的段落。 |
这两者互相约束的地方
模型的上下文长度限制了单次交互中所有输入文本的总量,包括用户查询、系统指令以及从向量库中检索到的内容。当 openGauss 返回多条知识段落时,这些段落的文本总长度加上其他输入,必须在 1024000 token 的上下文预算之内。引用上限 1000000 token 是模型可以用于引用的内容预算,以 token 计量。向量库返回的是知识段落的条数,每条段落的长度不同。当每段内容较短时,可能通过返回更多条目来达到引用上限;当每段内容较长时,较少的条目数就可能触及引用上限。因此,在配置向量检索的 检索条数 和 单段最大长度 时,需要综合考虑,以确保在引用上限内提供足够的信息。将 ef_construction 或 ef_search 等索引参数调大,通常意味着 openGauss 在索引构建或查询时会投入更多计算资源,以期获得更高的召回率或精度。这对于需要模型从大量文档中精准定位关键信息的场景是有益的。
容易做错的三处
- 日志中出现
Context window exceeded错误:原因在于向量库返回的内容加上用户输入超出了模型的上下文长度限制。 - 模型回答中引用的内容不完整或缺失:原因是向量库配置的
检索条数或单段最大长度过小,导致有效信息未能被检索或模型引用上限先于关键信息触顶。 - 检索结果返回缓慢,响应时间过长:原因是
ef_search参数设置过高,导致 openGauss 在查询时计算量过大。
怎么确认配好了
- 在 FastGPT 知识库中上传测试文档,包含不同长度和密度的段落,观察模型回答中引用内容的完整性。
- 通过 FastGPT 的调试界面,检查每次交互中模型接收到的
maxContext实际使用量与quoteMaxToken的消耗情况,确保在预期范围内。 - 进行多轮对话测试,观察模型在不同查询下对知识库内容的引用准确性和流畅性,判断
ef_search的实际效果。 - 监控 openGauss 数据库的查询日志和性能指标,确保
ef_construction和ef_search的设置没有导致不合理的资源消耗。