模型指南官方文档4 分钟阅读模型组合页

Siliconflow 128K 上下文 这一档模型配 openGauss 的配置口径

Siliconflow 提供的这档模型,其 `上下文长度` 达到 128000 tokens,意味着单次请求中可以承载的海量输入信息,为复杂场景下的推理提供了充足空间。`引用上限` 为 50000 tokens,限定了引入外部知识的 Token 预算,确保模型在生成回复时能有效地利用这些信息。`工具

这一档模型的参数意味着什么

Siliconflow 提供的这档模型,其 上下文长度 达到 128000 tokens,意味着单次请求中可以承载的海量输入信息,为复杂场景下的推理提供了充足空间。引用上限 为 50000 tokens,限定了引入外部知识的 Token 预算,确保模型在生成回复时能有效地利用这些信息。工具调用 为 true,表明模型具备与外部工具交互的能力,能够执行更复杂的任务流程。图片输入 为 false,则说明当前模型不支持直接处理图像输入。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/databaseFastGPT 连接 openGauss 数据库的连接字符串规范。
ef_construction100–200影响索引构建时的图拓扑密度,值越大召回质量越高,但构建时间更长。
ef_search60–120影响查询时的邻居搜索范围,值越大召回率越高,但查询耗时越长。
m32HNSW 索引中每个节点的最大邻居数,影响索引结构与查询性能。
chunk_size800–1200 字符文本切片大小,需与模型单次处理能力及引用上限匹配。
recall_count10–20 条向量库单次检索返回的文档条数,需综合考虑引用上限与每段长度。

这两者互相约束的地方

模型上下文长度和 openGauss 召回结果之间存在紧密关联。向量库返回的 recall_count 条文档,每条文档的 chunk_size 字符长度,共同决定了最终进入模型上下文的总 Token 数。这个总 Token 数必须在模型的 上下文长度 预算之内。引用上限 按 Token 计数,而向量库返回的是按条数计。当每段文本较长时,即使返回条数不多,也可能率先触及 引用上限。当每段文本较短时,则可能在达到 引用上限 前,已经返回了大量条目。openGauss 的 ef_construction 和 ef_search 参数调大,意味着向量索引的召回精度更高,能够为模型提供更相关的上下文信息,从而提升模型生成回答的质量。

容易做错的三处

  • 日志显示 openGauss connection refused:OPENGAUSS_URL 中的主机或端口配置不正确,或者数据库未启动。
  • 查询结果相关性差,模型回答不准确:ef_search 或 ef_construction 参数设置过低,导致向量检索未能找到足够相关的文档。
  • 模型返回的回答内容过短或不完整:引用上限 设置过低,或者 recall_count 过少,导致模型可利用的上下文信息不足。

怎么确认配好了

  • 通过 FastGPT 界面,观察 RAG 链路的召回结果,检查召回文档的相关性。
  • 在 openGauss 数据库中,执行 EXPLAIN ANALYZE 命令,分析向量检索查询的性能,确保 ef_search 和 ef_construction 参数设置合理。
  • 部署一个测试用例,输入一段长文本并提问,观察模型是否能充分利用召回内容,生成高质量的长回答,并核对实际消耗的 Token 数是否在 引用上限 内。
  • 监控 FastGPT 的日志输出,确保 OPENGAUSS_URL 连接稳定,没有出现连接超时或认证失败的错误信息。

参考资料