这一档模型的参数意味着什么
AntLing 3.0-flash-VL 模型档位具备 256000 的上下文长度,这意味着在单次交互中可以处理极长的输入与历史信息。引用上限 240000 规定了知识库召回内容在模型输入中的最大令牌数量,直接影响了 FastGPT 系统能向模型投喂的参考信息体量。模型支持图片输入,允许在对话中融入视觉信息进行多模态理解。工具调用能力的提供,则为模型与外部系统或自定义功能的集成提供了基础,可用于执行特定操作或获取实时数据。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 数据库连接字符串,确保 FastGPT 能正确访问 openGauss 实例。 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量与构建速度。此值在保证召回效果和索引大小间取得平衡。 |
ef_search | 32 | HNSW 索引查询参数,影响查询召回精度与速度。适当的 ef_search 值可兼顾性能与准确性。 |
m = 32 | 32 | HNSW 索引层数参数,决定了图的连接度。此值有助于在不同层级上进行高效搜索。 |
| 召回条数 | 10–20 条 | 根据模型引用上限和单段平均长度,确保总令牌数不超限,并覆盖潜在相关内容。 |
| 单段长度 | 800–1200 字符 | 兼顾信息完整性和模型处理效率,避免过长或过短的片段。 |
这两者互相约束的地方
AntLing 3.0-flash-VL 模型的 256000 上下文长度是其处理能力的上限。当 FastGPT 从 openGauss 向量库中召回知识段落时,召回条数与每段长度的乘积必须严格控制在这一上限之内,以避免模型输入截断或性能下降。模型的引用上限 240000 令牌,是实际可用于知识引用的最大容量。这意味着即使 openGauss 返回了大量条目,最终送入模型的引用内容也不会超过此限制。通常情况下,向量库返回的召回条数会先于模型引用上限生效,FastGPT 会根据配置的召回策略和引用上限进行裁剪。openGauss 的索引参数 ef_construction 和 ef_search 调大,会增加向量搜索的精度,可能提升召回内容的质量,进而为 AntLing 模型提供更准确的上下文信息,但同时也会增加 openGauss 的计算开销。
容易做错的三处
- 日志显示
context window exceeded:召回内容总长度加上用户输入超出了模型的 256000 上下文长度。 - 搜索结果与预期不符:openGauss 的
ef_search参数设置过低,导致向量搜索精度不足。 - 知识库内容未被引用:FastGPT 配置的引用上限 240000 未能被合理利用,或召回条数过少未能触发引用。
怎么确认配好了
- 在 FastGPT 知识库测试界面,观察每次召回的实际令牌数,确保其远低于 240000 的引用上限,并有足够余量给用户输入。
- 使用 FastGPT 的调试模式,检查模型输入中的引用内容,确认 openGauss 返回的知识段落被正确识别并送入模型。
- 通过 openGauss 的性能监控工具,观察
ef_construction和ef_search参数调整后,查询响应时间与 CPU 使用率的变化,确保系统运行稳定。