模型指南官方文档4 分钟阅读模型组合页

SparkDesk 8K 上下文 这一档模型配 Milvus 的配置口径

SparkDesk `generalv3`、`generalv3.5`、`4.0Ultra` 这一档模型,其上下文长度 `maxContext` 为 8000 token,这决定了单次请求中可包含的系统指令、用户输入与召回内容的总量。引用上限 `quoteMaxToken` 同为 8000 toke

这一档模型的参数意味着什么

SparkDesk generalv3、generalv3.5、4.0Ultra 这一档模型,其上下文长度 maxContext 为 8000 token,这决定了单次请求中可包含的系统指令、用户输入与召回内容的总量。引用上限 quoteMaxToken 同为 8000 token,这限定了引入知识库内容的 token 预算。引用内容的总 token 量将受此约束。单次最大输出未明确标注,通常会根据上下文长度进行动态调整。此档模型不具备图片输入与工具调用能力,这意味着在构建 RAG 应用时,需专注于文本内容的检索与生成,不涉及多模态或外部工具集成。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSlocalhost:19530 或 your_milvus_host:19530Milvus 服务默认监听端口。
MILVUS_TOKENyour_milvus_token用于访问 Milvus 服务的认证令牌。
index_typeHNSWHNSW 索引在稠密向量搜索中表现出良好的查询性能与召回率。
metric_typeIPIP(内积)距离度量适用于多数文本嵌入模型,能有效反映语义相似度。
top_k5综合考虑 SparkDesk 的引用上限与常见文本段落长度,5 条召回内容通常能提供足够的信息密度。
segment_length800-1200 字符适当的段落长度能保证单段内容语义完整,且不至于过长导致引用 token 溢出。

这两者互相约束的地方

SparkDesk 8K 上下文的这一档模型,其 8000 token 的上下文长度与 8000 token 的引用上限对 Milvus 的检索结果提出了具体要求。召回条数与每段长度的乘积,其 token 总量不能超过模型的总上下文预算。引用上限 quoteMaxToken 限定的是引用内容合计的 token 预算,而向量库返回的是按条数计的段落。当每段文本较长时,即使召回条数不多,也可能率先触及引用上限。反之,如果每段文本较短,则可能会因召回条数过多而超出引用上限。Milvus 的索引参数如 HNSW 的 M 和 efConstruction 值调大后,通常能提升召回的准确性,这意味着模型能够获得更高质量的引用内容,从而在有限的引用预算内获得更有效的输入。

容易做错的三处

  • 检索结果 data 字段为空: Milvus 服务未启动或 MILVUS_ADDRESS 配置错误,导致连接失败。
  • 模型返回 Context window exceeded 错误: 向量库返回的召回内容条数过多,或每段内容过长,导致引用内容总 token 超出模型的 quoteMaxToken 限制。
  • 回答内容与检索结果不相关: Milvus 索引参数如 metric_type 或 index_type 未根据嵌入模型特性正确配置,导致召回的向量语义相关性不高。

怎么确认配好了

  • 通过 FastGPT 界面测试,观察每次查询后 引用内容 区域是否正确显示来自 Milvus 的召回文本。
  • 检查 FastGPT 后端服务日志,确认是否存在 Milvus 相关的连接错误信息或查询超时提示。
  • 针对一组已知答案的测试问题,观察模型回答中是否有效利用了召回内容,并评估回答的准确性与相关性,以此反推 top_k 和 segment_length 的合理性。
  • 在 Milvus 客户端中执行 describe_collection 命令,确认 index_type 和 metric_type 与预期配置一致。

参考资料