模型指南官方文档4 分钟阅读模型组合页

Moonshot 8K 上下文 这一档模型配 openGauss 的配置口径

`moonshot-v1-8k-vision-preview` 模型具备 8000 token 的上下文长度,决定了单次请求中模型能处理的输入与输出总量。引用上限为 6000 token,用于限定检索到的引用内容在整个上下文中的预算。因此,即使检索系统返回了多条内容,实际被模型引用的部分也需在此预算

这一档模型的参数意味着什么

moonshot-v1-8k-vision-preview 模型具备 8000 token 的上下文长度,决定了单次请求中模型能处理的输入与输出总量。引用上限为 6000 token,用于限定检索到的引用内容在整个上下文中的预算。因此,即使检索系统返回了多条内容,实际被模型引用的部分也需在此预算之内。单次最大输出未明确标注,通常由模型自主控制。图片输入能力支持处理视觉信息,工具调用能力则允许模型执行预设的外部操作,拓展了交互范畴。

配 openGauss 要定哪些

配置项建议取法这样取的依据
OPENGAUSS_URLpostgresql://user:password@host:port/database连接 FastGPT 与 openGauss 实例的入口,确保网络可达性与认证正确性。
ef_construction800影响 HNSW 索引构建时的图层连接度,数值越大,索引质量越高,但构建时间增加。
ef_search200影响 HNSW 索引查询时的邻居搜索范围,数值越大,召回精度越高,但查询延迟增加。
m = 3232HNSW 索引中每个节点的最大连接数,平衡索引大小与查询效率。
vector_dimension按嵌入模型输出维度标定向量维度需与所使用的嵌入模型输出维度严格匹配,确保向量存储与比较的正确性。
chunk_size500–800 字符单个文本块的合理长度,平衡检索粒度与模型上下文利用率。

这两者互相约束的地方

模型的 8000 token 上下文预算,对 openGauss 检索出的内容总量构成了直接约束。这意味着,即使 openGauss 检索出大量文本块,其总长度(按 token 计)加上模型提示词、历史对话以及模型自身的输出,都必须落在 8000 token 范围内。引用上限 6000 token 专门用于约束检索内容的 token 消耗,这是模型在生成回答时可以参考的引用文本的预算。openGauss 向量库返回的是固定数量的文本段落,而引用上限是按 token 计数,因此,每段文本的平均长度会决定在达到 6000 token 预算时能引用多少个段落。当 openGauss 的 ef_construction 和 ef_search 参数调大时,向量检索的召回准确率通常会提高,意味着模型能够获得更相关的引用内容。

容易做错的三处

  • 现象:模型返回内容出现截断或不完整。原因:chunk_size 过大导致单个检索段落的 token 数超出引用上限分配,或总召回内容超出模型上下文限制。
  • 现象:检索结果相关性差,模型回答质量不佳。原因:openGauss 的 ef_search 参数设置过小,导致查询时未能充分探索邻近向量,影响召回精度。
  • 现象:FastGPT 日志显示 openGauss 连接失败。原因:OPENGAUSS_URL 配置错误,如端口不匹配、认证信息有误或网络不通。

怎么确认配好了

  • 针对典型问题进行多轮对话测试,观察模型回答内容中引用的事实是否准确、完整,并核对是否超出 6000 token 的引用上限。
  • 检查 FastGPT 后台日志,确认 openGauss 查询请求的响应时间是否在可接受范围内,以评估 ef_search 参数对性能的影响。
  • 尝试上传多种类型和长度的文档,观察分段效果,并验证检索出的文本块 chunk_size 是否符合预期,避免过长或过短。
  • 模拟高并发场景,监控 openGauss 实例的 CPU、内存和 I/O 使用情况,确保 ef_construction 和 m 参数在当前硬件资源下稳定运行。

参考资料