模型指南官方文档6 分钟阅读模型组合页

SparkDesk 128K 上下文 这一档模型配 Milvus 的配置口径

`pro-128k` 模型具备 128000 token 的上下文长度,这意味着单次请求可以处理相当大规模的输入信息。引用上限 128000 token 规定了模型在生成回复时,可以从知识库中引用的内容总量。模型会根据这个预算,在检索到的多条内容中进行筛选和截断,以确保引用的内容总量不超过此限制。模

这一档模型的参数意味着什么

pro-128k 模型具备 128000 token 的上下文长度,这意味着单次请求可以处理相当大规模的输入信息。引用上限 128000 token 规定了模型在生成回复时,可以从知识库中引用的内容总量。模型会根据这个预算,在检索到的多条内容中进行筛选和截断,以确保引用的内容总量不超过此限制。模型的单次最大输出未明确标注,通常由系统默认值或平台配置决定。该模型不支持图片输入和工具调用功能,因此在设计 RAG 流程时,需要将重点放在纯文本检索和生成上,且不依赖外部工具能力。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSmilvus.example.com:19530Milvus 服务部署地址,确保 FastGPT 能够访问。
MILVUS_TOKENyour_milvus_api_keyMilvus 认证凭证,保障连接安全。若无认证,可为空。
HNSWef = 128, M = 16, efConstruction = 128HNSW 索引参数,平衡搜索性能与索引构建时间。ef 影响召回率,M 影响内存与查询效率。
IP相似度度量内积距离。适用于归一化向量,与 FastGPT 嵌入模型输出特征匹配。
检索条数 (topK)5 - 10 条兼顾召回效率与模型上下文预算,避免单次检索返回过多冗余信息。
单段文本长度500 - 800 字符确保每段内容具有足够的信息密度,同时控制总长度,便于模型处理。

这两者互相约束的地方

pro-128k 模型的 128000 token 上下文长度与 Milvus 检索返回的条数和每段长度紧密相关。向量库检索返回的是若干条文本段落,每条段落包含一定数量的字符。当这些段落被送入模型时,会被转换为 token。若“召回条数 × 每段平均 token 长度”超过了模型的上下文预算,模型将无法处理全部内容,导致信息丢失。引用上限 128000 token 明确了模型用于引用的 token 总量。Milvus 返回的是固定条数的段落,其总 token 数取决于每段的实际长度。当每段文本较长时,即使返回较少条数,也可能迅速触及引用上限;反之,若每段文本较短,则可以引用更多条段落。索引参数 HNSW 中的 ef 和 M 值调大,通常会提高 Milvus 的检索准确率,但也可能增加查询延迟。对于 pro-128k 模型,更精准的召回意味着模型能获得更高质量的输入,从而可能生成更准确的回复,但需在查询速度与召回质量之间取得平衡。

容易做错的三处

  • 日志显示 Milvus connection failed: [ErrCode: 0, ErrMsg: fail to connect to server]:MILVUS_ADDRESS 配置错误或 Milvus 服务未启动。
  • 模型回复内容质量低下,且引用内容为空:检索侧 topK 值过小,或 Milvus 索引参数 ef 值设置过低,导致相关度高的文档未能被召回。
  • 部署后模型响应缓慢,甚至超时:MILVUS_ADDRESS 网络延迟高,或 Milvus 实例资源不足,导致向量检索耗时过长。

怎么确认配好了

  • 通过 FastGPT 界面执行一次知识库问答,观察模型是否能引用到知识库内容,并生成合理回复。
  • 检查 FastGPT 后端日志,确认与 Milvus 的连接状态无异常报错,且检索请求能够正常发出并收到响应。
  • 调整知识库中的文档内容和查询语句,测试不同场景下的召回条数和引用内容,确保引用内容总量在 128000 token 预算内。
  • 监控 Milvus 实例的查询 QPS 和延迟,确保在预期负载下,查询响应时间符合系统性能要求。
  • 验证 Milvus 索引参数(如 HNSW 的 ef 和 M)调整后,检索结果的准确性和相关性是否有所提升。

参考资料