这一档模型的参数意味着什么
glm-5.3-flash 模型具备 1000000 的上下文长度,这意味着在单次交互中,模型能够处理极其庞大的输入信息量,为复杂的 RAG 应用提供了充足的文本空间。模型支持图片输入和工具调用,这拓展了其在多模态理解和自动化任务执行方面的能力。引用上限为 900000 token,这限定了模型在生成回复时,可以从检索结果中引用的内容总量。引用上限是引用内容的总 token 预算。段落条数则由检索系统返回,两者是不同的衡量维度。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 连接 openGauss 数据库实例的唯一标识 |
ef_construction | 100–200 | 索引构建时控制邻居数量,影响检索质量与构建时间 |
ef_search | 60–120 | 检索时控制邻居数量,影响查询速度与召回精度 |
m = 32 | 32 | HNSW 图结构中每个节点的最大邻居数,影响索引效率与存储 |
recall_chunk_size | 500–800 字符 | 单个召回文本块的理想字符长度,兼顾内容完整性与模型处理效率 |
k_neighbors | 前 5–10 条 | 向量检索系统返回的 Top-K 结果条数,平衡相关性与引用预算 |
这两者互相约束的地方
模型的 1000000 上下文预算是总容量,召回条数与每段长度的乘积必须小于此值。引用上限 900000 token 限制了从向量库召回内容中,最终被模型引用的部分的总量。向量库返回的是固定条数的段落,而引用上限是按 token 计算的,最终是哪一个先达到上限,取决于每个召回段落的实际 token 长度。例如,如果召回段落很短,可能返回很多条才能达到引用上限;如果段落很长,则少量段落就可能触及上限。将 openGauss 的索引参数 ef_construction 和 ef_search 调大,通常会提高向量检索的精度和召回率。对于 glm-5.3-flash 这样上下文预算充裕的模型,更高的召回精度意味着可以从更相关的文档中挑选信息,从而更好地利用其巨大的上下文处理能力,生成更准确、更丰富的回答。
容易做错的三处
- 错误现象:模型返回的回答中,引用内容与问题相关性差或为空。原因:openGauss 的
ef_search参数设置过低,导致检索召回的向量结果质量不高,未能匹配到相关内容。 - 错误现象:RAG 链路处理速度慢,甚至出现超时错误。原因:openGauss 的
ef_construction或m参数设置过高,导致索引构建时间过长或查询时计算量过大。 - 错误现象:FastGPT 界面显示“引用内容超限”的提示。原因:单次检索返回的
k_neighbors条数过多,且每段recall_chunk_size过长,导致所有召回内容合计 token 量超过了模型的 900000 引用上限。
怎么确认配好了
- 进行端到端测试,观察模型在面对复杂问题时的引用内容是否准确且充分,并评估回答质量。
- 通过 FastGPT 的日志系统,检查每次 RAG 调用的 token 使用情况,确认引用 token 总量未超过 900000 限制。
- 在 openGauss 数据库中,通过执行 SQL 命令
EXPLAIN ANALYZE验证向量查询的执行计划和耗时,确保检索效率符合预期。 - 定期监控 openGauss 数据库的资源使用情况,如 CPU、内存和磁盘 I/O,确保在负载下系统运行稳定。