这一档模型的参数意味着什么
moonshot-v1-8k-vision-preview 模型具备 8000 token 的上下文长度,决定了单次请求中模型能处理的输入与输出总量。引用上限为 6000 token,用于限定检索到的引用内容在整个上下文中的预算。因此,即使检索系统返回了多条内容,实际被模型引用的部分也需在此预算之内。单次最大输出未明确标注,通常由模型自主控制。图片输入能力支持处理视觉信息,工具调用能力则允许模型执行预设的外部操作,拓展了交互范畴。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 连接 FastGPT 与 openGauss 实例的入口,确保网络可达性与认证正确性。 |
ef_construction | 800 | 影响 HNSW 索引构建时的图层连接度,数值越大,索引质量越高,但构建时间增加。 |
ef_search | 200 | 影响 HNSW 索引查询时的邻居搜索范围,数值越大,召回精度越高,但查询延迟增加。 |
m = 32 | 32 | HNSW 索引中每个节点的最大连接数,平衡索引大小与查询效率。 |
vector_dimension | 按嵌入模型输出维度标定 | 向量维度需与所使用的嵌入模型输出维度严格匹配,确保向量存储与比较的正确性。 |
chunk_size | 500–800 字符 | 单个文本块的合理长度,平衡检索粒度与模型上下文利用率。 |
这两者互相约束的地方
模型的 8000 token 上下文预算,对 openGauss 检索出的内容总量构成了直接约束。这意味着,即使 openGauss 检索出大量文本块,其总长度(按 token 计)加上模型提示词、历史对话以及模型自身的输出,都必须落在 8000 token 范围内。引用上限 6000 token 专门用于约束检索内容的 token 消耗,这是模型在生成回答时可以参考的引用文本的预算。openGauss 向量库返回的是固定数量的文本段落,而引用上限是按 token 计数,因此,每段文本的平均长度会决定在达到 6000 token 预算时能引用多少个段落。当 openGauss 的 ef_construction 和 ef_search 参数调大时,向量检索的召回准确率通常会提高,意味着模型能够获得更相关的引用内容。
容易做错的三处
- 现象:模型返回内容出现截断或不完整。原因:
chunk_size过大导致单个检索段落的 token 数超出引用上限分配,或总召回内容超出模型上下文限制。 - 现象:检索结果相关性差,模型回答质量不佳。原因:openGauss 的
ef_search参数设置过小,导致查询时未能充分探索邻近向量,影响召回精度。 - 现象:FastGPT 日志显示 openGauss 连接失败。原因:
OPENGAUSS_URL配置错误,如端口不匹配、认证信息有误或网络不通。
怎么确认配好了
- 针对典型问题进行多轮对话测试,观察模型回答内容中引用的事实是否准确、完整,并核对是否超出 6000 token 的引用上限。
- 检查 FastGPT 后台日志,确认 openGauss 查询请求的响应时间是否在可接受范围内,以评估
ef_search参数对性能的影响。 - 尝试上传多种类型和长度的文档,观察分段效果,并验证检索出的文本块
chunk_size是否符合预期,避免过长或过短。 - 模拟高并发场景,监控 openGauss 实例的 CPU、内存和 I/O 使用情况,确保
ef_construction和m参数在当前硬件资源下稳定运行。