这一档模型的参数意味着什么
glm-4.1v-thinking-flashx 和 glm-4.1v-thinking-flash 模型提供高达 64000 token 的上下文长度,这意味着在单次交互中可以处理大量输入信息。模型支持图片输入,可用于处理多模态检索与生成任务。引用上限为 60000 token,这是模型用于生成回答时,从检索结果中引用的内容总量限制。段落条数由向量检索返回的数量决定,引用上限与段落条数是两个独立的量。工具调用功能在此档模型中未开放,因此无法通过模型直接集成外部工具进行复杂任务处理。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | 数据库连接字符串,确保可达性 |
ef_construction | 64 | 控制 HNSW 索引构建时的邻居数量,影响索引质量和构建时间 |
ef_search | 32 | 控制 HNSW 索引查询时的邻居数量,影响查询召回率和速度 |
m = 32 | 32 | HNSW 索引中每个节点的最大连接数,影响索引大小和查询性能 |
recall_max_docs | 前 10 条 | 向量检索返回的最大文档条数,影响模型可引用的内容量 |
chunk_size | 800–1200 字符 | 单个文档块的字符长度,影响模型理解和引用粒度 |
这两者互相约束的地方
模型的上下文预算为 64000 token,而引用上限为 60000 token。向量库返回的召回条数与每段内容的长度共同决定了最终输入模型的内容总量。当召回条数乘以每段的 token 长度超过 60000 token 的引用上限时,模型将只截取前 60000 token 进行引用。如果召回内容的总 token 量未达到引用上限,但已触及 64000 token 的上下文长度限制,则其余输入内容(如用户提问)会被截断。openGauss 的 ef_construction 和 ef_search 参数调大,通常能提升检索的召回率和准确性,这对于需要高质量引用的模型而言至关重要。更高的召回质量意味着模型有更精准的信息源,从而在引用上限允许的范围内生成更相关的回答。
容易做错的三处
- 向量检索结果为空,模型无法生成有效回答。原因在于向量库索引未正确构建,或查询条件与数据不匹配。
- 模型返回的回答长度异常短,且提示引用内容不足。原因在于
recall_max_docs配置过小,或chunk_size过大导致单次检索内容量不足以支撑回答。 - 数据库连接超时或认证失败。原因在于
OPENGAUSS_URL中主机、端口、用户或密码配置错误,导致无法连接 openGauss 实例。
怎么确认配好了
- 通过 FastGPT 平台界面,查看知识库检索日志,确认 openGauss 返回的文档条数符合预期
recall_max_docs配置。 - 在知识库中上传不同长度的文档,观察分段后的
chunk_size是否在预期范围内。 - 针对特定查询,检查模型生成的回答中引用的内容,评估引用内容的相关性和完整性,并根据需要调整
ef_construction和ef_search参数。