模型指南官方文档4 分钟阅读模型组合页

Hunyuan 224K 上下文 这一档模型配 PostgreSQL(pgvector) 的配置口径

Hunyuan 这一档模型,其上下文长度为 224000,这意味着在单次对话中,模型可以处理包含历史对话和召回知识在内的总计 224000 个 token。单次最大输出未标注,但通常建议控制在合理范围内以避免过长响应。引用上限 224000 决定了模型在生成回复时可以引用的知识库段落总 token

这一档模型的参数意味着什么

Hunyuan 这一档模型,其上下文长度为 224000,这意味着在单次对话中,模型可以处理包含历史对话和召回知识在内的总计 224000 个 token。单次最大输出未标注,但通常建议控制在合理范围内以避免过长响应。引用上限 224000 决定了模型在生成回复时可以引用的知识库段落总 token 数上限。由于不支持图片输入,RAG 流程中无需考虑多模态数据的处理。工具调用功能同样缺失,因此在设计 Agent 行为时,需要将复杂任务分解为纯文本交互模式。

配 PostgreSQL(pgvector) 要定哪些

配置项建议取法这样取的依据
PG_URLpostgresql://user:password@host:port/databaseFastGPT 连接 PostgreSQL 数据库的必要参数,确保数据库可访问。
ef_construction64HNSW 索引构建时的搜索参数,影响索引质量和构建时间,过低可能导致召回率下降。
ef_search40HNSW 索引查询时的搜索参数,影响查询速度和召回率,过低可能漏掉相关结果。
m32HNSW 索引的邻居数量参数,影响索引大小和搜索效率,过高会增加内存占用。
vector_ip_opstruepgvector 向量距离计算方式,使用内积操作,适用于 FastGPT 默认的向量模型。
召回条数前 5-10 条经验值,旨在平衡召回质量与上下文长度限制,具体需结合引用上限调整。

这两者互相约束的地方

模型上下文长度 224000 是一个硬性上限,它直接制约了从 PostgreSQL(pgvector) 中召回的知识段落的总量。具体来说,召回的条数乘以每条知识段落的平均 token 长度,其总和不能超过模型的上下文预算。如果单条召回内容过长,即使召回条数较少也可能迅速触及上限。FastGPT 的引用上限 224000 token 与 pgvector 返回的条数协同作用。当 pgvector 返回的条数过多,导致总 token 数超过引用上限时,FastGPT 会根据策略截断。反之,若 pgvector 返回的条数少于引用上限所能承载的条数,则以 pgvector 的实际返回为准。调整 pgvector 的索引参数 ef_construction 和 ef_search 会影响召回的准确性和速度。参数调大通常意味着更精确的召回,但也可能增加查询延迟,进而影响 FastGPT 整体的响应时间,尤其是在高并发场景下。

容易做错的三处

  • 日志中出现 PG::ConnectionBad 错误,原因是 PG_URL 配置不正确或数据库未启动。
  • 知识库召回结果不准确或缺失,表现为模型回答中未提及相关信息,原因可能是 ef_search 参数设置过低,导致 HNSW 索引查询时召回不全面。
  • 查询响应时间过长,甚至出现超时,可能是由于 ef_construction 或 m 参数设置过高,导致索引过大或构建过于耗时,影响了查询性能。

怎么确认配好了

  • 检查 FastGPT 容器启动日志,确认没有与 PostgreSQL 相关的连接错误。
  • 针对知识库中的特定问题进行提问,观察模型回答中是否准确引用了相关知识段落,并检查引用的段落内容是否完整。
  • 在 PostgreSQL 数据库中,通过 EXPLAIN ANALYZE 命令对 pgvector 索引查询进行性能分析,确认查询计划合理且执行时间在可接受范围内。
  • 调整知识库中的召回条数和单段长度,观察 FastGPT 的实际引用 token 数量,确保其在模型上下文和引用上限内。

参考资料