这一档模型的参数意味着什么
step-1-128k 模型提供了 128000 的上下文长度,这意味着一次请求中可以处理大量的文本信息,为复杂的 RAG 场景提供了充足的空间。引用上限同样是 128000 token,这是引用内容的总 token 预算。段落的返回条数由检索侧的配置决定,引用上限限制的是这些引用内容的合计 token 量。模型不提供图片输入能力,因此在处理多模态数据时需要进行预处理。同时,该模型不具备工具调用能力,这意味着复杂的外部系统交互需要通过其他方式实现。
配 OceanBase 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OCEANBASE_URL | ob://user:password@host:port/database | 遵循 OceanBase 官方连接协议,确保应用能正确连接数据库。 |
ef_construction | 64 | ef_construction 影响索引构建的质量和速度,建议从 64 开始,根据实际查询性能和构建时间进行调整。 |
m | 16 | m 参数决定了 HNSW 索引中每个节点的最大连接数,m=16 在大多数场景下提供了较好的查询效率与索引大小平衡。 |
recall_top_k | 5 | 结合模型引用上限与单段平均 token 数,初始设定为返回前 5 条相关段落,避免不必要的 token 浪费。 |
chunk_size | 512 | 单个文本块的理想长度,兼顾了模型上下文处理能力和语义完整性,避免过长或过短的片段。 |
这两者互相约束的地方
step-1-128k 模型的 128000 上下文长度是总预算,其中包含系统提示词、用户查询、历史对话以及召回内容。召回条数与每段长度共同决定了召回内容占用的 token 量,这个总量不能超过模型的上下文预算。引用上限 128000 token 限制了所有引用内容的总 token 预算,而向量库返回的是固定条数的段落。每段内容的实际 token 数量决定了是引用上限先触顶,还是召回条数先达到上限。当 OceanBase 的索引参数 ef_construction 或 m 调大时,索引构建时间可能增加,但查询召回的准确性和效率会提高,这有助于模型在有限的引用上限内获得更相关的上下文。
容易做错的三处
- 日志显示
Connection refused或Authentication failed:OCEANBASE_URL中的连接信息(IP、端口、用户名、密码)配置错误。 - 模型回复内容缺乏相关性或回答不完整:
recall_top_k设置过低或chunk_size过大,导致模型获得的有效信息不足。 - 向量检索耗时过长,导致整个 RAG 流程响应慢:
ef_construction或m参数设置不当,未能充分优化索引结构。
怎么确认配好了
- 执行 FastGPT 知识库测试,观察召回内容是否准确且相关,并检查返回的 token 数量是否在预期范围内。
- 在 OceanBase 监控平台查看连接数和查询延迟,确保数据库在高并发下仍能稳定运行。
- 通过 FastGPT 的调试接口,检查模型输入中的引用内容是否符合
quoteMaxToken的限制,并评估召回条数是否合理。 - 模拟高负载场景,观察端到端响应时间,确保整个 RAG 流程在业务需求下保持流畅。