这一档模型的参数意味着什么
Qwen 1000K 上下文档位模型,具备高达 1000000 token 的上下文长度,意味着单次请求中可输入大量前序对话历史、指令和召回内容。引用上限同样为 1000000 token,对知识库召回段落的总量提供了充足的支持。模型支持工具调用,可以在工作流中集成外部功能,实现更复杂的任务处理。此档模型不支持图片输入,专注于文本处理能力。单次最大输出未标注,实际输出长度会受限于模型自身的生成能力和系统配置。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:password@host:port/database | 连接 OceanBase 数据库的完整 JDBC 兼容 URL |
ef_construction | 128 | 构建 HNSW 索引时,控制邻居数量的参数,影响索引质量和构建时间 |
m=16 | 16 | HNSW 索引中每个节点的最大连接数,影响召回效率和内存占用 |
recall_limit | 200000 | 向量库单次召回的最大 token 数,需小于模型引用上限 |
chunk_overlap | 50 | 文本切片时相邻块的重叠字数,用于保持上下文连贯性 |
这两者互相约束的地方
Qwen 1000K 上下文模型与 OceanBase 向量库的集成,核心在于合理分配模型的上下文预算。召回条数与每段文本长度的乘积,必须严格控制在模型 1000000 token 的上下文长度之内,以避免截断或因超出限制导致报错。引用上限 1000000 token 决定了知识库召回段落总量的理论上限,而向量库返回条数则受限于 OceanBase 的查询配置。两者中实际生效的是限制更严格的一方。当 OceanBase 的 ef_construction 或 m 等索引参数调大时,通常会提升向量召回的准确性,但可能增加索引构建时间和查询延迟,这会间接影响到模型获取知识的速度与效率,尤其是在对实时性要求较高的场景中。
容易做错的三处
- 知识库检索时返回空结果:可能是 OceanBase 索引未正确构建,或查询语句与数据不匹配。
- 模型回答内容与召回知识关联性低:
ef_construction或m参数设置过低,导致向量检索质量不佳。 - 模型生成内容被截断:召回段落总 token 数超过了模型 1000000 token 的上下文长度。
怎么确认配好了
- 在 FastGPT 界面上传测试文档,观察 OceanBase 数据库中是否有新增的向量数据。
- 通过 FastGPT 的调试功能,输入包含知识库内容的查询,检查召回的 OceanBase 向量段落是否相关。
- 调整 FastGPT 中单次召回的知识段落数量,观察模型回答的完整性和长度变化,以确定上下文预算的合理利用。