故障排查GitHub issue3 分钟阅读排错/错误码

配置FastGPT Agent Sandbox的出网控制与内容安全审查能力

使用FastGPT的Agent通过Sandbox联网搜索、访问网页、调用第三方API或检索公开代码仓库时,第三方返回数据可能包含政治、色情、暴力等高风险内容。这类内容未经过滤,会直接显示在工具卡片、运行详情或流式界面中,还可能进入模型上下文、对话记录、Redis、MongoDB或日志。

现象

使用FastGPT的Agent通过Sandbox联网搜索、访问网页、调用第三方API或检索公开代码仓库时,第三方返回数据可能包含政治、色情、暴力等高风险内容。这类内容未经过滤,会直接显示在工具卡片、运行详情或流式界面中,还可能进入模型上下文、对话记录、Redis、MongoDB或日志。即使大模型识别风险拒答,用户仍可能看到原始返回内容。

可能原因

当前FastGPT未内置Sandbox出网控制和返回内容安全审查能力,外部工具返回内容未经过滤就进入展示、模型上下文及持久化存储环节。

排查步骤

  1. 确认当前Agent是否使用Sandbox执行联网搜索、访问网页或调用第三方API操作。
  2. 检查第三方返回的原始数据是否包含高风险文本。
  3. 查看前端展示的工具卡片、运行详情,以及Redis、MongoDB、日志等持久化存储中是否留存原始返回内容。
  4. 确认大模型是否因识别风险拒答,但原始违规内容未被清理。

解决与验证

可通过配置Sandbox安全策略实现需求:

  1. 配置出网控制:支持完全禁止联网、默认允许/拒绝联网,添加白名单/黑名单域名(支持通配符),限制HTTP/HTTPS协议及端口,按团队、应用、Agent、Skill设置策略,动态创建的Sandbox自动继承策略,配置异常时的放行或阻断行为,覆盖DNS解析、重定向、CDN、IP地址等场景,并提供访问审计。
  2. 配置返回内容安全审查:在第三方返回进入FastGPT前统一审查,覆盖Sandbox输出、HTTP响应、搜索结果、各类格式内容及下载文件解析文本,审查通过后再进行流式展示、工具卡片展示、模型请求、持久化存储等操作。
  3. 配置命中处理方式:支持放行、脱敏、阻断三种动作,命中后原始内容不进入模型上下文,不展示在前端及持久化存储中。
  4. 配置流式返回安全:先缓存工具返回,审查通过后再展示,或按安全窗口分段缓存,命中后立即停止输出。
  5. 配置自定义安全审查服务:可接入现有敏感校验或自定义安全校验URL,支持企业本地部署的审查服务。

参考配置示例:

sandboxSecurity:
  # 具体配置项需按实际环境确认

验证时可发起包含高风险内容的工具调用,确认违规内容被拦截或脱敏,未出现在前端及持久化存储中。

来源:FastGPT GitHub issue