模型指南官方文档5 分钟阅读模型组合页

Ernie 128K 上下文 这一档模型配 OceanBase 的配置口径

`ernie-4.5-turbo-128k` 模型参数提供了 128000 的上下文长度,这意味着在单次交互中,模型能够处理的输入信息总量较大,为复杂问题和多轮对话提供了空间。模型未标注单次最大输出,通常意味着输出长度由模型自身生成能力决定,但仍受限于总上下文长度。123000 的引用上限,则直接约

这一档模型的参数意味着什么

ernie-4.5-turbo-128k 模型参数提供了 128000 的上下文长度,这意味着在单次交互中,模型能够处理的输入信息总量较大,为复杂问题和多轮对话提供了空间。模型未标注单次最大输出,通常意味着输出长度由模型自身生成能力决定,但仍受限于总上下文长度。123000 的引用上限,则直接约束了知识库召回内容被模型引用的最大长度,这影响了知识库段落的切分策略和召回条数。图片输入 false 和 工具调用 false 表明该模型不直接支持多模态输入和外部工具的集成,应用构建时需考虑这些功能的实现方式。

配 OceanBase 要定哪些

配置项建议取法这样取的依据
OCEANBASE_URLjdbc:mysql://<host>:<port>/<database>指定 OceanBase 的连接地址,兼容 MySQL 协议。
ef_construction64–128影响 HNSW 索引构建质量与查询速度的平衡,建议从较低值开始测试。
m16HNSW 索引中每个节点的最大连接数,影响索引结构与召回精度。
召回条数上限10–20 条结合模型引用上限与单段内容长度,避免超出模型处理能力。
向量维度1536需与模型嵌入向量维度保持一致,否则无法进行有效相似度计算。
索引类型HNSWHNSW 索引在召回性能和精度之间有较好的平衡。

这两者互相约束的地方

ernie-4.5-turbo-128k 的 128000 上下文长度是总输入预算,它包含提示词、历史对话、以及知识库召回内容。当知识库与模型结合时,召回条数与每段内容的平均长度直接影响了上下文的占用。例如,如果召回 20 条,每条平均 5000 字符,总计 100000 字符,加上提示词和历史对话,很容易触及模型上下文上限。模型 123000 的引用上限意味着即使向量库返回了更多内容,模型也只会引用其中的一部分。OceanBase 的 ef_construction 和 m 等索引参数调大通常会提高召回精度,但可能增加索引构建时间和查询延迟。对于 ernie-4.5-turbo-128k 这种高上下文模型,高质量的召回能更充分利用其处理能力,但过高的 ef_construction 也可能导致查询耗时增加,影响实时性。

容易做错的三处

  • 现象:模型返回的回答内容不完整或被截断。原因:知识库召回内容过长,与提示词、历史对话共同超出了 128000 的上下文长度。
  • 现象:RAG 召回结果与问题相关性差,但 OceanBase 查询返回了大量结果。原因:ef_construction 或 m 参数设置过低,导致 HNSW 索引构建质量不足,未能有效捕获向量间的相似性。
  • 现象:FastGPT 界面显示“向量数据库连接失败”或“索引创建失败”。原因:OCEANBASE_URL 配置错误或 OceanBase 实例未正确启动,或者 SEEKDB 与 OceanBase 使用的控制器版本不兼容。

怎么确认配好了

  • 在 FastGPT 后台知识库管理页面,尝试导入一批数据,观察日志中是否出现 Vector insertion success 提示。
  • 使用 FastGPT 的测试对话功能,输入包含知识库内容的查询,观察模型回答中是否引用了知识库内容,并检查引用的内容是否准确。
  • 针对某个特定查询,在 OceanBase 数据库中直接执行向量相似度查询,比对返回结果与 FastGPT 实际召回内容的一致性。
  • 监控 OceanBase 实例的 CPU、内存和磁盘 I/O 使用情况,在进行知识库导入和查询时,确保资源消耗在预期范围内,避免过载。

参考资料