企业用 AI 查询自有数据库时,应把自然语言理解与数据库操作拆成两个受控层。AI 平台负责识别意图、编排流程和整理结果;集成网关与企业系统负责凭据、权限、查询范围和数据操作。这样的边界让团队可以逐项验证数据流、权限和审计记录。
1. 先定义可查询的业务范围
数据库问答适合固定数据范围、稳定权限和可复核结果的查询场景,例如经营指标查询、库存状态查询和内部知识检索。启动前请形成一份范围清单,至少写明:
- 允许访问的数据库、表、字段和时间范围;
- 允许执行的操作,优先采用只读查询;
- 每类数据的业务负责人、技术负责人和安全负责人;
- 查询结果的用途、保留周期和人工复核要求。
范围清单是后续接口规则和验收样本的共同依据。模糊的范围会把权限判断交给模型,增加越权和数据泄露风险。
2. 建立清晰的分工边界
| 层级 | 允许承担的职责 | 验收标准 |
|---|---|---|
| AI 平台 | 识别用户意图、补充必要参数、编排工作流、整理结果 | 只发送受控意图或参数,不保存数据库账号,不直接连接数据库 |
| 集成网关 | 保存凭据、校验请求、限制出口、记录审计日志 | 所有数据库请求经过网关,越界请求被拒绝并留下可追溯记录 |
| 企业数据库与业务系统 | 执行确定性查询、权限校验和必要的数据写入 | 仅执行批准范围内的操作,返回字段和权限符合业务规则 |
| 业务与安全团队 | 定义范围、复核结果、处理异常和定期审计 | 责任人、复核频率和异常升级路径均有书面记录 |
AI 平台的输出可以帮助人完成查询,数据库的最终权限仍由企业系统控制。需要写入数据时,应使用独立接口、最小字段和额外审批,把写入能力从默认查询链路中分离出来。
3. 配置三道安全控制
3.1 隔离凭据并限制出口
数据库账号、短期令牌和连接配置放在企业控制的网关或密钥系统中。AI 平台只接收完成请求所需的短期、最小范围授权信息,平台配置、日志和提示词中均不得出现数据库密码或长期密钥。网络策略应只允许 AI 平台访问指定网关,并记录异常出口请求。
3.2 在接口层固定查询范围
把允许的表、字段、过滤条件、分页上限和时间范围写入网关规则。网关对每个请求进行结构化校验,拒绝未知字段、危险操作和超出范围的时间段。提示词可以帮助模型理解业务规则,接口规则承担最终边界。
3.3 按用户权限执行并记录审计
网关在执行请求前验证用户身份、角色和数据权限。拒绝结果应包含请求标识、用户标识、规则命中原因和时间戳,供安全团队复核。成功查询也要记录最小必要的审计字段,避免把完整敏感结果复制到不必要的日志系统。
4. 五步验证自然语言取数链路
按照以下顺序进行小范围验收,所有样本都使用企业批准的脱敏数据:
- 确认范围:为每个业务场景建立允许表、字段、条件和角色的基线,并由业务、安全和 IT 负责人确认。
- 验证分工:发起一条正常查询,检查 AI 平台只提交受控请求,数据库连接和凭据均由网关承担。
- 验证越界拦截:分别提交未知字段、超出时间范围和写入操作,确认网关拒绝请求并生成审计记录。
- 验证权限隔离:使用无权账号访问受限数据,确认请求被拒绝、管理员收到告警且日志可以定位用户和规则。
- 复核结果:抽取正常与异常样本,由业务负责人核对字段含义、计算口径和结果用途,再决定是否扩大范围。
验收报告应记录样本、配置版本、请求标识、预期结果、实际结果和遗留风险。结果准确度、响应速度和审计完整性需要分别衡量,单项通过不能代表整条链路适合生产。
5. 识别常见失败模式
让 AI 直接持有数据库账号
平台配置中出现长期凭据会扩大泄露影响面。把凭据集中到网关,使用短期授权和最小权限,并在轮换后重新验证所有连接。
只依赖提示词约束查询
模型可能生成超出业务范围的字段或条件。把范围固化在接口规则中,对越界请求做拒绝测试,并持续审计规则命中情况。
把生成结果当作确定性事实
自然语言解释可能遗漏条件或误读字段。对财务、权限和运营决策设置人工复核节点,同时保留原始查询、结构化结果和复核结论。
6. 上线前检查清单
- 范围清单与网关规则逐项对应;
- AI 平台配置、日志和提示词中没有数据库凭据;
- 正常、越界、无权和异常网络样本均已验证;
- 只读链路与写入链路拥有独立权限和审批;
- 审计日志包含请求、用户、规则和结果状态;
- 业务、安全、IT 负责人确认遗留风险与回滚动作。