这一档模型的参数意味着什么
Ernie 8K 上下文模型系列,包括 ERNIE-4.0-8K 和 ERNIE-4.0-Turbo-8K,其 8000 token 的上下文长度直接限定了单次交互中模型能够处理的输入信息总量。这意味着在进行 RAG(检索增强生成)时,召回的知识段落总长度必须严格控制在此范围内,否则将导致截断或错误。引用上限 5000 意味着在构建响应时, FastGPT 最多可以引用 5000 字的知识内容作为佐证。此档模型不支持图片输入,因此无法处理视觉信息,所有输入必须是纯文本。同时,不支持工具调用,限制了其在复杂任务编排和外部系统集成方面的能力,必须依赖外部逻辑或 FastGPT 本身的功能来提供工具支持。
配 openGauss 要定哪些
| 配置项 | 建议取法 | 这样取的依据 |
|---|---|---|
OPENGAUSS_URL | postgresql://user:password@host:port/database | FastGPT 连接 openGauss 数据库的连接字符串,确保可访问性和权限。 |
ef_construction | 80 | 构建 HNSW 索引时的邻居数量。影响索引质量与构建速度,80 是一个平衡点,可提供较好的召回效果。 |
ef_search | 60 | 查询 HNSW 索引时遍历的邻居数量。影响查询召回率和速度,60 在保证召回率的同时控制查询延时。 |
m | 32 | HNSW 索引中每个节点的最大出边数。影响索引结构和查询性能,32 是常见且有效的配置。 |
| 召回条数 | 前 5 条 | 结合模型上下文长度和引用上限,有效控制输入 token 量,避免超出模型限制。 |
| 单段文本长度 | 800-1200 字符 | 确保每段召回内容信息密度适中,减少 token 浪费,提高有效信息比例。 |
这两者互相约束的地方
模型 8000 token 的上下文长度是核心约束。这意味着召回条数与每段文本长度的乘积,加上系统指令和用户查询的 token 数,不得超过 8000。如果向量库配置的召回条数过多,或者单段文本长度过长,将会导致模型输入超限。引用上限 5000 字则限制了最终呈现给用户的引用内容总量,即使向量库返回了大量相关段落,最终被引用的也只能是其中的一部分。在 FastGPT 中,向量库的返回条数会先于引用上限生效,即先从向量库获取指定数量的段落,再根据这些段落计算是否超出模型的上下文限制,最后再根据引用上限筛选最终用于展示的引用内容。openGauss 索引参数 ef_construction 和 ef_search 的调大,意味着向量检索的准确度可能提升,从而为模型提供更相关的知识段落,但同时也会增加索引构建和查询的计算开销,可能影响整体响应时间。
容易做错的三处
- 日志中出现
Context window exceeded错误,原因是向量库召回的段落总长度加上其他输入超出了 8000 token 上下文限制。 - 模型输出内容与预期不符,且引用的知识点不全面,原因是 openGauss 的
ef_search参数设置过低,导致召回的向量不够精准或数量不足。 - FastGPT 界面显示知识库引用为空或过少,但模型回答仍有知识点,原因是引用上限 5000 字的限制导致部分知识点未能被引用展示。
怎么确认配好了
- 在 FastGPT 控制台,通过调试模式观察模型输入中的
prompt字段,确认召回的知识段落数量和总长度未超出 8000 token 限制。 - 执行一系列具有代表性的用户查询,检查模型返回的回答是否准确且包含预期的知识点,同时观察引用的知识内容是否完整且与回答相关。
- 使用 openGauss 数据库的监控工具,检查向量检索的查询延迟和资源占用情况,确保在满足召回需求的同时,系统性能保持在可接受范围内。