模型指南官方文档4 分钟阅读模型组合页

MistralAI 32K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

MistralAI 32K 上下文这一档模型,其 `mistral-small-latest` 模型具备 32000 token 的上下文长度,决定了单次交互中可以处理的输入文本总量。单次最大输出能力未明确标注,但通常足以支持正常的对话长度。32000 token 的引用上限,明确了模型在生成回复时

这一档模型的参数意味着什么

MistralAI 32K 上下文这一档模型,其 mistral-small-latest 模型具备 32000 token 的上下文长度,决定了单次交互中可以处理的输入文本总量。单次最大输出能力未明确标注,但通常足以支持正常的对话长度。32000 token 的引用上限,明确了模型在生成回复时,引用内容所能占用的 token 预算。引用内容的总 token 量受到此上限的约束。模型支持工具调用,意味着可以集成外部功能扩展其能力边界。不支持图片输入则表明其为纯文本处理模型。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/database数据库连接字符串,确保可访问性和权限
ef_construction64HNSW 索引构建参数,平衡索引质量与构建时间
ef_search32HNSW 索引查询参数,平衡查询召回率与查询速度
m16HNSW 索引图层边的最大数量,影响索引质量和存储开销
vector_ip_opstrue使用内积距离计算向量相似度,适用于特定嵌入模型

这两者互相约束的地方

模型 32000 token 的上下文预算是总容量,它需要容纳用户问题、系统指令以及从 PostgreSQL(pgvector) 召回的引用内容。召回的文档片段总长度与召回条数直接相关,必须确保召回内容的总 token 量不超过模型上下文预算的可用部分。引用上限 32000 token 是对引用内容本身的预算,它按 token 计数。而向量库返回的是独立的文档片段(条数),每条文档片段的长度不同。实际使用中,引用内容的 token 总量或召回条数,两者中先达到限制的一方将决定最终提供给模型的信息量。PostgreSQL(pgvector) 的 ef_construction 和 ef_search 参数调大,可以提高召回的准确性和全面性,有助于为模型提供更相关的信息,但也可能增加查询延迟。

容易做错的三处

  • 日志中出现 connection refused 错误,原因是 PG_URL 配置的数据库地址或端口不正确。
  • 检索结果返回的文档片段数量远低于预期,原因是 ef_search 参数设置过小,导致 HNSW 索引查询未能充分探索。
  • 模型回复中未引用任何外部知识,但数据库中存在相关内容,原因是召回的文档片段总 token 量超过了模型的引用上限。

怎么确认配好了

  • 执行一次包含向量检索的 RAG 流程,检查日志中 PostgreSQL 连接是否成功建立,并确认没有报错信息。
  • 在 FastGPT 界面查看模型返回的引用内容,确保引用内容与向量库中的原始文档片段一致。
  • 通过 FastGPT 的调试功能,观察上下文窗口中召回内容的总 token 数,判断其是否在模型和引用上限的预算范围内。

参考资料