这一档模型的参数意味着什么
moonshot-v1-32k-vision-preview 模型具备 32000 token 的上下文长度,决定了单次交互中可处理的输入与输出总和。单次最大输出长度未明确标注,通常由模型本身动态调整。引用上限为 32000 token,这限制了召回内容可以占据的 token 总量。引用内容段落数量由检索侧配置决定,与引用上限是两个独立维度。图片输入能力允许模型处理图像数据,扩展了输入类型。工具调用能力则支持模型与外部工具进行交互,实现更复杂的任务流程。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | mysql://user:password@host:port/database | 连接 OceanBase 数据库的必要参数,遵循 MySQL 协议格式 |
ef_construction | 64 | HNSW 索引构建时的邻居数量,影响索引质量与构建速度,64 是常见优化起点 |
m | 16 | HNSW 索引中每个节点的最大连接数,影响检索性能与内存占用,16 是平衡设置 |
quoteMaxTokens | 8000 | 预留给引用内容的 token 预算,确保模型有足够空间处理指令与生成回复 |
maxRetrieveCount | 5 | 向量库单次检索返回的最大段落数量,平衡召回质量与上下文预算 |
chunkOverlap | 64 | 分段时相邻文本块的重叠字符数,有助于保持上下文连贯性 |
这两者互相约束的地方
召回条数与每段文本长度的乘积必须小于或等于模型的上下文预算 32000 token。引用上限按 token 计费,而向量库返回的是按条数计量的文本段落。当单段文本较短时,引用上限可能先达到,限制了可引用的总文本量。当单段文本较长时,向量库返回的条数可能先达到限制。索引参数 ef_construction 和 m 调大,通常意味着向量索引的精度提升,检索到的内容与查询更相关。这对于模型来说,意味着能获得更高质量的召回内容,从而提升回答的准确性与相关性,但同时也会增加索引构建和查询的资源消耗。
容易做错的三处
- 日志显示“上下文长度超出限制,请缩短输入或调整配置”:原因是对模型可接受的总 token 数估计不足,召回内容与用户输入总和超过 32000。
- 检索结果为空或不相关:原因可能是
ef_construction或m配置过小,导致 HNSW 索引质量不佳,无法有效召回相关向量。 - 模型回答缺乏细节,未能充分利用知识库信息:原因是
quoteMaxTokens配置过低,限制了模型可以引用的知识库内容总量。
怎么确认配好了
- 上传文档后,检查 OceanBase 数据库中是否有新增的向量数据,并确认
ef_construction和m参数是否已按预期生效。 - 在 FastGPT 界面进行一次包含知识库的提问,观察模型回答中是否正确引用了知识库内容,并检查引用的文本段落数量。
- 执行一系列长文本查询,查看模型是否能处理全部输入,并返回完整回答,以此评估
quoteMaxTokens和maxRetrieveCount的配置是否合理。 - 通过 FastGPT 的调试工具,检查每次请求的 token 消耗情况,确认输入、输出和引用部分的 token 使用量是否在预期范围内。