这一档模型的参数意味着什么
pro-128k 模型具备 128000 token 的上下文长度,这意味着单次请求可以处理相当大规模的输入信息。引用上限 128000 token 规定了模型在生成回复时,可以从知识库中引用的内容总量。模型会根据这个预算,在检索到的多条内容中进行筛选和截断,以确保引用的内容总量不超过此限制。模型的单次最大输出未明确标注,通常由系统默认值或平台配置决定。该模型不支持图片输入和工具调用功能,因此在设计 RAG 流程时,需要将重点放在纯文本检索和生成上,且不依赖外部工具能力。
配 Milvus 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
MILVUS_ADDRESS | milvus.example.com:19530 | Milvus 服务部署地址,确保 FastGPT 能够访问。 |
MILVUS_TOKEN | your_milvus_api_key | Milvus 认证凭证,保障连接安全。若无认证,可为空。 |
HNSW | ef = 128, M = 16, efConstruction = 128 | HNSW 索引参数,平衡搜索性能与索引构建时间。ef 影响召回率,M 影响内存与查询效率。 |
IP | 相似度度量 | 内积距离。适用于归一化向量,与 FastGPT 嵌入模型输出特征匹配。 |
检索条数 (topK) | 5 - 10 条 | 兼顾召回效率与模型上下文预算,避免单次检索返回过多冗余信息。 |
| 单段文本长度 | 500 - 800 字符 | 确保每段内容具有足够的信息密度,同时控制总长度,便于模型处理。 |
这两者互相约束的地方
pro-128k 模型的 128000 token 上下文长度与 Milvus 检索返回的条数和每段长度紧密相关。向量库检索返回的是若干条文本段落,每条段落包含一定数量的字符。当这些段落被送入模型时,会被转换为 token。若“召回条数 × 每段平均 token 长度”超过了模型的上下文预算,模型将无法处理全部内容,导致信息丢失。引用上限 128000 token 明确了模型用于引用的 token 总量。Milvus 返回的是固定条数的段落,其总 token 数取决于每段的实际长度。当每段文本较长时,即使返回较少条数,也可能迅速触及引用上限;反之,若每段文本较短,则可以引用更多条段落。索引参数 HNSW 中的 ef 和 M 值调大,通常会提高 Milvus 的检索准确率,但也可能增加查询延迟。对于 pro-128k 模型,更精准的召回意味着模型能获得更高质量的输入,从而可能生成更准确的回复,但需在查询速度与召回质量之间取得平衡。
容易做错的三处
- 日志显示
Milvus connection failed: [ErrCode: 0, ErrMsg: fail to connect to server]:MILVUS_ADDRESS配置错误或 Milvus 服务未启动。 - 模型回复内容质量低下,且引用内容为空:检索侧
topK值过小,或 Milvus 索引参数ef值设置过低,导致相关度高的文档未能被召回。 - 部署后模型响应缓慢,甚至超时:
MILVUS_ADDRESS网络延迟高,或 Milvus 实例资源不足,导致向量检索耗时过长。
怎么确认配好了
- 通过 FastGPT 界面执行一次知识库问答,观察模型是否能引用到知识库内容,并生成合理回复。
- 检查 FastGPT 后端日志,确认与 Milvus 的连接状态无异常报错,且检索请求能够正常发出并收到响应。
- 调整知识库中的文档内容和查询语句,测试不同场景下的召回条数和引用内容,确保引用内容总量在 128000 token 预算内。
- 监控 Milvus 实例的查询 QPS 和延迟,确保在预期负载下,查询响应时间符合系统性能要求。
- 验证 Milvus 索引参数(如
HNSW的ef和M)调整后,检索结果的准确性和相关性是否有所提升。