这一档模型的参数意味着什么
claude-sonnet-4-5-20250929 模型具备 1000000 tokens 的上下文长度,这意味着在单次交互中可以处理大量的输入信息,包括历史对话和检索到的知识片段。虽然单次最大输出未明确标注,但其引用上限为 100000 tokens,这为知识库的引用内容提供了充足的空间。支持图片输入使得模型能够理解并处理视觉信息,为多模态应用提供了可能性。工具调用能力的集成,则允许模型与外部系统进行交互,执行复杂任务,拓展了其应用边界。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | mysql://user:password@host:port/database | 连接 OceanBase 数据库实例的必需参数,遵循 MySQL 协议 |
ef_construction | 128 | 控制 HNSW 索引构建的质量和速度,高值通常带来更好的召回,但构建时间增加 |
m | 16 | HNSW 索引中每个节点的最大连接数,影响召回性能和索引大小 |
| 召回条数 | 20–40 | 经验值,旨在平衡召回全面性和模型上下文负担 |
| 单段文本长度 | 200–500 字符 | 考虑模型上下文长度与信息密度,避免过长或过短的片段 |
QUERY_TIMEOUT | 30000ms | 查询 OceanBase 的超时时间,防止长时间等待导致请求失败 |
这两者互相约束的地方
模型上下文长度是核心约束,召回条数与每段长度的乘积不能超过 1000000 tokens 的上下文预算。如果召回内容过多,超出模型处理能力,可能导致截断或理解偏差。引用上限 100000 tokens 决定了模型在生成回复时可以引用的知识段落总长度,这意味着即使 OceanBase 返回了大量匹配结果,最终模型引用的内容也会受此限制。向量库的返回条数设置,应结合模型的引用上限来确定,通常向量库返回的条数会略高于模型实际引用的条数,以便模型有选择空间。当 OceanBase 的索引参数 ef_construction 或 m 调大时,通常会提高召回的准确性,但也可能增加查询延迟,这需要与模型的响应时间要求进行权衡。
容易做错的三处
- 日志显示
Connection refused或Authentication failed:通常是OCEANBASE_URL中的主机、端口、用户名或密码配置不正确。 - 模型返回的回答中知识引用为空或不准确:可能是向量库召回条数过少,或者文本分段粒度不合理,导致相关信息未能有效检索。
- 查询响应时间过长,甚至超时:可能是 OceanBase 的索引参数
ef_construction或m设置过高,或者数据库负载过大。
怎么确认配好了
- 检查 FastGPT 平台日志,确认
OCEANBASE_URL连接成功,没有出现连接错误或认证失败信息。 - 在 FastGPT 知识库中上传文档,观察 OceanBase 数据库中是否有对应的向量数据生成,并检查
ef_construction和m参数是否按预期生效。 - 进行多次问答测试,观察模型返回的引用内容是否准确、完整,并与知识库原文进行比对,评估引用上限与向量库召回条数的配合效果。
- 模拟高并发场景,测试 OceanBase 的查询响应时间是否在可接受范围内,避免因索引参数设置不当导致的性能瓶颈。