这一档模型的参数意味着什么
MistralAI 32K 上下文这一档模型,其 mistral-small-latest 模型具备 32000 token 的上下文长度,决定了单次交互中可以处理的输入文本总量。单次最大输出能力未明确标注,但通常足以支持正常的对话长度。32000 token 的引用上限,明确了模型在生成回复时,引用内容所能占用的 token 预算。引用内容的总 token 量受到此上限的约束。模型支持工具调用,意味着可以集成外部功能扩展其能力边界。不支持图片输入则表明其为纯文本处理模型。
配 PostgreSQL(pgvector) 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
PG_URL | postgresql://user:password@host:port/database | 数据库连接字符串,确保可访问性和权限 |
ef_construction | 64 | HNSW 索引构建参数,平衡索引质量与构建时间 |
ef_search | 32 | HNSW 索引查询参数,平衡查询召回率与查询速度 |
m | 16 | HNSW 索引图层边的最大数量,影响索引质量和存储开销 |
vector_ip_ops | true | 使用内积距离计算向量相似度,适用于特定嵌入模型 |
这两者互相约束的地方
模型 32000 token 的上下文预算是总容量,它需要容纳用户问题、系统指令以及从 PostgreSQL(pgvector) 召回的引用内容。召回的文档片段总长度与召回条数直接相关,必须确保召回内容的总 token 量不超过模型上下文预算的可用部分。引用上限 32000 token 是对引用内容本身的预算,它按 token 计数。而向量库返回的是独立的文档片段(条数),每条文档片段的长度不同。实际使用中,引用内容的 token 总量或召回条数,两者中先达到限制的一方将决定最终提供给模型的信息量。PostgreSQL(pgvector) 的 ef_construction 和 ef_search 参数调大,可以提高召回的准确性和全面性,有助于为模型提供更相关的信息,但也可能增加查询延迟。
容易做错的三处
- 日志中出现
connection refused错误,原因是PG_URL配置的数据库地址或端口不正确。 - 检索结果返回的文档片段数量远低于预期,原因是
ef_search参数设置过小,导致 HNSW 索引查询未能充分探索。 - 模型回复中未引用任何外部知识,但数据库中存在相关内容,原因是召回的文档片段总 token 量超过了模型的引用上限。
怎么确认配好了
- 执行一次包含向量检索的 RAG 流程,检查日志中 PostgreSQL 连接是否成功建立,并确认没有报错信息。
- 在 FastGPT 界面查看模型返回的引用内容,确保引用内容与向量库中的原始文档片段一致。
- 通过 FastGPT 的调试功能,观察上下文窗口中召回内容的总 token 数,判断其是否在模型和引用上限的预算范围内。