这一档模型的参数意味着什么
AntLing 64K 上下文模型档位中的 Ling-mini-2.0 模型,其上下文长度为 64000 token,这意味着单次请求中模型可以处理的总输入量上限。引用上限 quoteMaxToken 为 60000 token,这明确了模型在生成回复时,从知识库召回内容中用于引用的 token 总量。召回的段落条数由检索逻辑决定,引用上限约束的是这些段落内容合并后的 token 预算。此模型支持工具调用 true,允许通过外部工具扩展其能力,但不支持图片输入 false。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/database | FastGPT 连接 PostgreSQL 数据库的标准格式,确保网络可达性与凭证正确。 |
ef_construction | 64–128 | HNSW 索引构建时的参数,影响索引质量与构建速度。高值能提升召回精度,但会增加索引时间。 |
ef_search | 32–64 | HNSW 搜索时的参数,影响召回速度与精度。高值能提升召回精度,但会增加查询耗时。 |
m = 32 | 保持默认或根据实测调整 | HNSW 索引中每个节点的最大连接数。较高值能提升召回精度,但会增加索引存储空间。 |
vector_ip_ops | true | 启用向量内积操作,与 AntLing 模型使用的嵌入向量相似度计算方式保持一致。 |
| 每段长度 | 800–1200 字符 | 经验值,旨在平衡单段信息密度与模型处理效率,避免单段过长或过短。 |
这两者互相约束的地方
AntLing 64K 上下文模型的上下文长度为 64000 token,这限制了传入模型的总信息量。当从 PostgreSQL(pgvector)召回知识时,召回条数与每段文本的长度共同决定了总的召回内容量。引用上限 quoteMaxToken 设定为 60000 token,这表示从召回内容中选取用于生成回复的文本,其总 token 数不能超过此值。向量库返回的是固定数量的段落,而模型引用的是这些段落的 token 总和。当索引参数 ef_construction 或 ef_search 调大时,pgvector 召回的精度会提升,这意味着模型有机会获得更相关、更高质量的引用内容,从而可能在引用上限内选择更有效的文本。
容易做错的三处
- 日志显示「数据库连接失败:
FATAL: password authentication failed for user "xxx"」。原因:PG_URL中的用户名或密码不正确。 - 召回结果为空,但知识库中明明有相关内容。原因:向量索引
ef_search设置过低,导致召回精度不足,或相似度阈值设置过高。 - 模型回复内容缺乏相关引用或引用不完整。原因:知识库分段策略不合理,导致单段信息过少,或引用上限
quoteMaxToken已触达,无法引用更多内容。
怎么确认配好了
- 通过 FastGPT 管理界面,在知识库中上传文档,查看向量化状态是否正常显示「已完成」。
- 在 FastGPT 聊天界面,针对知识库内容进行提问,观察模型回复中是否包含准确的引用来源。
- 监控 PostgreSQL 数据库的
pg_stat_statements,检查向量查询(vector_ip_ops)的执行效率,确保ef_search参数下的查询耗时在可接受范围内。 - 在 FastGPT 的调试模式下,观察每次对话中模型实际使用的上下文 token 数和引用 token 数,确保未超出 64000 和 60000 的限制。