这一档模型的参数意味着什么
这一档模型(glm-4.6v、glm-4.6v-flashx、glm-4.6v-flash)的上下文长度为 128000 Token,决定了单次模型调用能够处理的输入信息总量,包括系统指令、用户查询和召回的知识内容。引用上限 120000 Token 约束了知识库召回内容在上下文中的最大占比。单次最大输出未标注,意味着其输出长度主要受限于整体上下文长度和模型自身生成能力。图片输入为 true,使得模型能够处理多模态输入,支持图文混合的问答场景。工具调用为 true,则允许模型通过外部工具扩展其能力,实现更复杂的任务。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:password@host:port/database | 连接 OceanBase 实例的必要信息,包含认证与地址。SEEKDB 也遵循此协议。 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量与构建速度。过小影响召回质量,过大增加索引时间。 |
m=16 | 16 | HNSW 索引图的每个节点连接的最大邻居数,影响召回精度与查询耗时。 |
召回条数 top_k | 5 至 10 条 | 结合模型引用上限与单段平均长度,避免上下文溢出。 |
| 单段最大字符数 | 800 至 1200 字符 | 经验值,确保每段信息完整且不过长。 |
向量维度 vector_dim | 1536 | 与所选嵌入模型输出维度保持一致。 |
这两者互相约束的地方
模型上下文长度是核心约束。召回条数与每段长度的乘积,加上系统指令和用户查询的 Token 数量,必须小于或等于模型的上下文长度 128000 Token。如果超出,模型会截断输入,导致信息丢失。引用上限 120000 Token 进一步限制了知识库内容在整个上下文中的最大可用空间。向量库的 top_k 参数(召回条数)应与此引用上限协同设置,确保召回的段落总数和总长度在模型处理范围内。当 OceanBase 的 ef_construction 和 m 等索引参数调大时,向量搜索的精度会提高,可能带来更相关的召回结果。这意味着模型能获得更高质量的输入,但同时索引构建和查询的资源消耗也会增加。
容易做错的三处
- 日志中出现
Context window exceeded错误码:原因在于召回内容总长度加上用户输入超过了 128000 Token 的上下文限制。 - 模型返回的答案缺乏关键信息:原因可能是向量库的
top_k设置过小,导致相关信息未能被召回。 - 向量搜索请求超时或延迟过高:原因可能是
ef_construction或m参数设置过大,导致索引查询计算量剧增。
怎么确认配好了
- 在 FastGPT 知识库测试界面,上传文档并进行问答,观察召回条数是否符合预期,以及回答是否准确。
- 通过 FastGPT 的调试模式,查看每次模型调用实际传入的 Token 数量,确保其在 128000 Token 范围内。
- 检查 OceanBase 的日志,确认向量查询响应时间符合业务要求,没有出现大量慢查询。
- 在 FastGPT 管理后台,检查 OceanBase 连接状态,确认
OCEANBASE_URL配置正确且可达。