这一档模型的参数意味着什么
AntLing 这一档模型,其上下文长度高达 256000 token,这决定了单次模型调用能够处理的输入信息总量。引用上限 quoteMaxToken 为 240000 token,这意味着模型在生成回答时,用于支撑回答的引用内容总和不能超过此预算。段落条数由检索系统返回,引用上限限制的是这些返回内容合计占用的 token 数量。模型支持图片输入 true 和工具调用 true,表明它能够处理多模态输入并与外部工具进行交互,为更复杂的应用场景提供支持。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/dbname | 连接到 PostgreSQL 数据库的必要信息 |
ef_construction | 32 | 控制 HNSW 索引构建时的图拓扑,影响写入性能和召回质量 |
ef_search | 16 | 控制 HNSW 索引查询时的搜索范围,影响查询速度和召回质量 |
vector_dimensions | 1536 | 向量维度,需与嵌入模型输出维度一致 |
hnsw.m | 32 | HNSW 索引中每个节点连接的邻居数量,影响内存占用和查询质量 |
max_connections | 100 | 数据库最大并发连接数,需根据并发请求量调整 |
这两者互相约束的地方
AntLing 这一档模型的 256K 上下文长度是其处理能力的上限。向量库召回的条数与每段内容的长度直接影响了总体的 token 消耗。例如,如果每段召回内容过长,即使召回条数不多,也可能迅速触及模型的上下文预算。引用上限 quoteMaxToken 是一个基于 token 的限制,而向量库返回的是固定条数的段落。究竟是引用上限先达到还是召回条数先达到,取决于每段内容的平均 token 长度。当 ef_construction 和 ef_search 等索引参数调大时,通常意味着向量搜索的召回质量会提升,能够为 AntLing 模型提供更相关的上下文,但也可能增加向量库的资源消耗。
容易做错的三处
- 日志显示“Context window exceeded”,原因是向量召回内容总 token 量超过了 AntLing 模型的上下文长度。
- 返回的回答与用户问题关联度低,原因是
ef_search参数设置过小,导致向量召回的质量不佳。 - 向量搜索请求超时,原因是
ef_construction设置过大,导致索引构建或查询过于耗时。
怎么确认配好了
- 在 FastGPT 界面测试,确保每次对话的引用内容能正常显示,并且与问题高度相关。
- 监控 PostgreSQL 数据库的 CPU、内存和磁盘 I/O 使用率,确保在负载下各项指标处于健康范围。
- 通过 FastGPT 的调试模式,检查每次模型调用的实际 token 消耗,确认未超出 AntLing 模型的
quoteMaxToken限制。 - 模拟高并发场景,观察向量搜索的响应时间,确保满足业务需求。