这一档模型的参数意味着什么
AntLing 256K 上下文模型档位,其 上下文长度 256000 决定了模型在单次交互中能处理的总文本量上限,这直接影响知识库召回内容的总字数。引用上限 240000 规定了模型在生成回答时可以引用的知识库段落总token量,是实际RAG应用中知识召回的硬性约束。工具调用 true 表明模型具备与外部工具集成的能力,支持复杂任务流程编排。图片输入 false 则说明该档模型不直接处理图像数据,图像相关的多模态应用需通过其他链路实现。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 数据库连接字符串,确保 FastGPT 能正确连接 openGauss 实例。 |
ef_construction | 128 | 构建 HNSW 索引时的邻居数量参数,影响索引质量和构建速度。 |
ef_search | 64 | 搜索 HNSW 索引时的邻居数量参数,影响搜索召回率和速度。 |
m = 32 | 32 | HNSW 索引中每个节点的最大连接数,平衡索引大小与查询效率。 |
| 召回条数限制 | 前 5–10 条 | 结合模型引用上限和单条文档长度,避免超出模型上下文。 |
| 单条文档长度 | 800–1200 字符 | 根据业务内容特点和模型理解能力,平衡信息密度。 |
这两者互相约束的地方
AntLing 256K 上下文模型与 openGauss 向量库的结合,核心在于 召回条数 × 每段长度 必须严格控制在模型 上下文长度 256000 的预算之内。同时,模型 引用上限 240000 是一个更具体的Token限制,它与向量库返回的实际条数共同作用,两者中较低的那个限制将先生效。若 openGauss 的 ef_construction 和 ef_search 等索引参数调大,通常意味着向量搜索的精度和召回率可能提高,这将为模型提供更相关的上下文,但同时也可能增加向量检索的时间开销,需要在实际部署中进行性能测试以平衡。FastGPT 在将向量检索结果送入模型前,会根据模型上下文和引用上限进行裁剪,确保输入合规。
容易做错的三处
- 现象:模型输出回答过短或缺失关键信息。原因:向量库
ef_search参数设置过低,导致召回的向量不够全面,未能提供足够的上下文信息给模型。 - 现象:日志中出现
Context window exceeded错误。原因:向量库返回的文档总长度或总条数,在 FastGPT 聚合后超过了 AntLing 模型 256000 的上下文长度限制。 - 现象:检索结果不相关或返回空列表。原因:
OPENGAUSS_URL配置错误,导致 FastGPT 无法连接到 openGauss 实例,无法执行向量检索操作。
怎么确认配好了
- 执行一次 FastGPT 知识库问答,检查模型输出是否包含知识库引用,并核对引用内容是否来自 openGauss 检索结果。
- 在 FastGPT 后台查看模型输入日志,确认传递给 AntLing 模型的上下文 Token 数未超出 256000 限制,且引用 Token 数未超出 240000 限制。
- 监控 openGauss 数据库的查询日志和性能指标,确认向量检索请求能够正常响应,且查询延迟在可接受范围内,例如
EXPLAIN ANALYZE语句的执行时间。