这一档模型的参数意味着什么
DeepSeek 64K 上下文模型,其 maxContext 达 64000 token,表示模型单次处理的输入信息总量上限。这意味着在 RAG 场景中,可以容纳更多的召回内容,从而提升模型对复杂问题的理解能力。quoteMaxToken 引用上限为 60000 token,这是模型在生成回答时,用于引用检索内容的 token 预算。它不直接决定引用的段落数量,而是限制了所有引用内容加起来的总大小。图片输入 false 表明该模型不支持直接处理图像信息,因此在构建多模态应用时需额外处理。工具调用 true 则表示模型支持 Function Calling 能力,可以与外部工具或 API 进行交互,实现更复杂的业务逻辑。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | mysql://user:pass@host:port/db | 连接 OceanBase 数据库的唯一标识,遵循 MySQL 协议格式。 |
ef_construction | 64 | HNSW 索引构建时控制邻居数量的参数,影响索引质量与构建速度的平衡。 |
m | 16 | HNSW 索引中每个节点的最大出边数量,影响召回精度和存储开销。 |
chunk_size | 800–1200 字符 | 文本切块的理想长度,兼顾上下文完整性与召回粒度。 |
overlap_size | 100–200 字符 | 文本切块间的重叠部分,有助于保留上下文连贯性。 |
recall_count | 前 5–10 条 | 向量检索时返回的相似度最高的文档块数量。 |
这两者互相约束的地方
模型 64K 的上下文长度允许输入大量信息,但 quoteMaxToken 60000 token 明确了引用内容的预算。向量库 OceanBase 返回的是检索到的文档块数量,而每个文档块的长度由 chunk_size 决定。因此,recall_count × chunk_size 的总和必须在 quoteMaxToken 预算之内。如果 chunk_size 较大,即使 recall_count 不高,也可能迅速触及引用上限;反之,chunk_size 较小则可以检索更多文档块。OceanBase 的 ef_construction 和 m 参数调大可以提升检索精度,但也可能增加索引构建时间和存储空间。对于上下文预算充裕的 DeepSeek 模型,高精度的召回能更好地利用其理解能力,但需要权衡资源消耗。
容易做错的三处
- 日志显示
Input token limit exceeded, max_tokens=64000:模型总输入 token 超出上限,通常是召回内容与提示词合计过长。 - 界面返回的回答缺乏关键信息,但检索出的段落中包含:
quoteMaxToken设置过低,导致部分关键引用内容被截断。 - 向量检索耗时过长,导致整个请求超时:OceanBase 的
ef_construction或m设置过高,索引构建或查询效率下降。
怎么确认配好了
- 通过 FastGPT 调试界面观察每次请求的
input_tokens和quote_tokens,确认其数值在预期范围内。 - 在 OceanBase 数据库中执行
SHOW INDEX FROM your_table;命令,检查 HNSW 索引的ef_construction和m参数是否与配置一致。 - 使用 FastGPT 的检索测试功能,调整
recall_count参数,观察不同召回条数下,模型回答的完整性和相关性变化,以此确定合适的召回数量。 - 监控 OceanBase 的查询日志,分析平均查询延迟和索引命中率,确保检索性能符合要求。