模型指南官方文档4 分钟阅读模型组合页

AntLing 64K 上下文 这一档模型配 Milvus 的配置口径

AntLing 64K 上下文模型提供了高达 64000 token 的上下文长度,这意味着在一次对话中可以输入大量的历史信息或召回内容。引用上限 `quoteMaxToken` 设定了引用内容所能消耗的 token 预算,这一预算独立于上下文总长度,专门用于控制模型在生成回答时所引用的外部知识片段

这一档模型的参数意味着什么

AntLing 64K 上下文模型提供了高达 64000 token 的上下文长度,这意味着在一次对话中可以输入大量的历史信息或召回内容。引用上限 quoteMaxToken 设定了引用内容所能消耗的 token 预算,这一预算独立于上下文总长度,专门用于控制模型在生成回答时所引用的外部知识片段的规模。图片输入功能 true 表明模型支持多模态输入,能够处理图像信息。工具调用功能 false 提示当前模型版本不直接支持通过工具接口执行外部操作。

配 Milvus 要定哪些

配置项建议取法这样取的依据
MILVUS_ADDRESSlocalhost:19530默认的 Milvus 服务端地址,可根据实际部署调整。
MILVUS_TOKEN按实测标定Milvus 身份验证凭据,确保连接安全。
HNSWM=16, efConstruction=200HNSW 索引类型,提供高效的近邻搜索性能,适用于大规模数据集。
IPL2距离度量方式,L2 欧氏距离在多种场景下表现稳定,可根据向量特征选择。
召回条数8–12 条根据模型的上下文长度和引用上限,平衡召回质量与 token 消耗。
每段长度800–1200 字符兼顾信息完整性和模型处理效率,避免单段过长或过短。

这两者互相约束的地方

AntLing 64K 上下文模型与 Milvus 的组合,其核心在于如何有效管理召回内容。Milvus 返回的向量段落数量乘以每段的平均 token 长度,必须控制在模型 64000 token 的总上下文预算之内。同时,模型存在一个独立的引用上限 quoteMaxToken,用于限制实际被模型引用的知识片段所占用的 token 总量。这意味着,即使召回条数很多,但如果每段内容较短,可能引用上限先触及;反之,如果每段内容很长,可能在召回条数不多时就触及引用上限。Milvus 的索引参数,例如 HNSW 中的 efConstruction 值调高,能够提升召回精度,这对于模型理解复杂查询、减少“幻觉”现象至关重要。高精度的召回结果能更有效地利用模型的上下文能力,确保输入给模型的知识片段质量上乘。

容易做错的三处

  • 日志显示 Milvus connection failed: [Error: 13, details: "Failed to connect to Milvus"]:MILVUS_ADDRESS 配置错误或 Milvus 服务未启动。
  • 模型输出内容缺少关键信息,但已召回相关段落:quoteMaxToken 设置过低,导致模型无法引用足够的召回内容。
  • 检索结果返回的条数与预期不符,例如仅返回 1 条:Milvus 查询参数 limit 或 top_k 配置有误,或数据集中符合条件的向量数量不足。

怎么确认配好了

  • 对 FastGPT 平台进行一次包含知识库检索的测试,并检查模型输出的引用内容是否包含来自 Milvus 的相关信息。
  • 通过 Milvus 客户端工具查询,验证 HNSW 索引的 efConstruction 和 M 参数是否已正确应用到集合。
  • 在 FastGPT 日志中观察每次检索的 quoteMaxToken 消耗情况,确认其在预期范围内且未提前触及上限。
  • 执行一系列复杂查询,测试在不同召回条数和每段长度配置下,模型能否稳定地生成高质量且引用充分的回答。

参考资料