这一档模型的参数意味着什么
DeepSeek 64K 上下文模型,其 maxContext 达 64000 token,意味着单次请求中可输入大量文本,为 RAG 场景提供了充足的上下文窗口。quoteMaxToken 引用上限为 60000 token,这是 FastGPT 在生成回答时,从召回内容中实际用于模型推理的 token 预算。它不直接限制召回的段落数量,而是限定了所有引用内容合计的 token 总量。单次最大输出未明确标注,通常由模型自身决定,但 FastGPT 平台会施加限制以避免资源耗尽。图片输入和工具调用功能均为 false,表明该模型不支持视觉输入和通过工具进行外部交互,RAG 应用需纯文本处理。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:password@host:port/database | OceanBase 连接协议与凭证,确保 FastGPT 能连接到数据库。 |
ef_construction | 64 | HNSW 索引构建参数,影响索引质量与构建速度,64 是一个兼顾性能与召回率的平衡点。 |
m | 16 | HNSW 索引图的邻居数量参数,影响召回精度与查询效率,16 为常用设置。 |
| 召回条数 | 10–20 条 | 结合 quoteMaxToken 和平均段落长度,避免超出引用预算。 |
| 单段最大字符数 | 800–1000 字符 | 确保每段内容足够完整,同时控制总 token 消耗。 |
| 向量维度 | 1024 | 需与 DeepSeek 模型使用的 embedding 向量维度一致。 |
这两者互相约束的地方
DeepSeek 64K 上下文模型与 OceanBase 向量库的配合,核心在于 quoteMaxToken 与召回条数、每段长度之间的平衡。模型的 quoteMaxToken 是一个固定的 token 预算,而 OceanBase 返回的是具体条数的文本段落。当每段文本较短时,可以在 quoteMaxToken 预算内召回更多条目;反之,若每段文本较长,则召回条数会相应减少。如果召回条数乘以每段文本的 token 数超出 quoteMaxToken,FastGPT 会截断召回内容以适应预算。OceanBase 的 ef_construction 和 m 等索引参数调大,通常能提高召回精度,但也可能增加索引构建时间和查询延时,需要权衡。
容易做错的三处
- 日志显示 "Quote token budget exceeded",原因是召回的文本段落总 token 数超过了
quoteMaxToken。 - 搜索结果相关性不佳,原因是 OceanBase 的
ef_construction或m参数设置过小,导致 HNSW 索引召回精度不足。 - 向量搜索请求超时,原因是 OceanBase 实例资源不足或索引参数设置过大,导致查询计算量过高。
怎么确认配好了
- 在 FastGPT 知识库测试界面,上传文档并进行问答测试,观察召回内容是否完整且相关。
- 检查 FastGPT 后台日志,确认没有出现与
quoteMaxToken超出相关的警告或错误信息。 - 通过 FastGPT 的调试功能,查看实际召回的段落数量和它们所占用的 token 数,确保在
quoteMaxToken限制内。 - 监控 OceanBase 的 CPU、内存和 I/O 使用率,确保在进行向量搜索时资源消耗在合理范围内。