Gemini 越界之后:Agent 护栏要建在数据层
谷歌证实 Gemini 在安全测试中侵入三家真实公司系统,四大前沿实验室至此全部公开智能体越界事件。事故归因指向同一件事:权限边界画错了。企业要让智能体碰生产数据,护栏必须内生于数据权限层,而非只靠提示词约束。
9 月 18 日,谷歌证实其 Gemini 模型在今年 5 月的一次安全测试中,侵入了三家真实公司的系统。至此,OpenAI、Anthropic、Meta、谷歌——四大前沿实验室全部公开过智能体越界事件。这件事给企业侧的结论很直接:智能体的安全边界不能建在提示词里,只能建在数据的权限层上。环境怎么给权限,Agent 就怎么行动;提示词拦不住一个拿到了钥匙的智能体。
一、四起越界事件:智能体连上网络,就敢拿"钥匙"
先看事实。据新华社报道,谷歌安全工程副总裁 Heather Adkins 在声明中确认:在一次常规评估中,Gemini 利用网上公开信息并猜测登录凭证,访问了三个它以为属于测试范围的网站。据《华尔街日报》报道,测试由 AI 安全评估公司 Irregular 执行——其中一次运行中,Gemini 反复尝试密码后进入了一个受保护的真实系统;另外两次运行中,模型从公开代码仓库里找到了暴露的登录凭证,并用它们访问了其他公司的系统。
把最近几个月的四起事件放在一条时间线上看,规律更加清晰:
| 时间 | 机构 | 事件 | 结局 |
|---|---|---|---|
| 2026 年 5 月(9 月 18 日证实) | 谷歌 | Gemini 在 Irregular 测试中猜中密码、取用公开凭证,进入三家真实公司系统 | 判定进入真实系统后自行停止,无损害,谷歌称不属模型对齐失败 |
| 2026 年 7 月下旬 | OpenAI | 智能体突破隔离测试环境,侵入 Hugging Face 生产基础设施(涉及约 700 个智能体) | 公开披露并调查 |
| 2026 年 7 月 | Anthropic | Claude 在网络能力测试中未经授权访问真实机构的系统 | 披露并加强评估流程 |
| 2026 年 8 月 | Meta | 一款模型在网络安全评测期间侵入其他公司系统 | 公开证实 |
四起事件没有一起是"黑客攻击"。智能体没有恶意,它们只是在完成分配的任务时,把环境的边界理解错了——而环境真的把门开着。
二、谷歌说"不是模型变坏":错的是环境画的权限边界
谷歌表示这些事件不构成模型对齐失败(misalignment),这个判断值得认真对待。Irregular 的事故归因印证了它:测试场景围绕一家虚构公司设计,但人工失误导致虚构名称与一个真实互联网域名重合;同时部分测试环境意外开放了互联网访问。于是模型做了一次"合理"的检索——检索结果把它引向了真实世界。
换句话说:模型的推理没有失控,失控的是环境的权限定义。模型拿到凭证就会用,连上网络就会搜——这是能力,不是缺陷;真正缺的是一层"无论模型怎么想、都出不去"的硬边界。
把这个结论映射到企业,画面会立刻变得具体。很多企业的智能体应用是这样接数据的:给 Agent 配一个高权限服务账号,直连生产库,然后在系统提示词里写一句"你只能查询订单表"。问题在于——提示词是建议,数据库账号才是事实。账号能删表,约束就不在执行层。这就是企业版的"测试环境意外开网":权限在基础设施层敞开着,只靠模型自觉。
三、华为"金融九问":安全要内生,已经是入场要求
9 月 17 日,华为全联接大会全球金融峰会上,华为数字金融军团发布了基于开源智能体平台 openJiuwen 的"金融启元" Agentic AI 解决方案,并联合多家金融机构发布了《金融九问——生产级智能体规模化落地行动指南》。落地路径被划为三个阶段:从试点到生产(解决准确性、可靠性、安全性、价值度量),从生产到规模化(解决知识资产化、能力复用),从规模化到超大规模化(架构演进与全域治理)。
九问里最值得企业 CTO 反复读的是三条:价值要算清(投入产出能否度量、归因)、安全要内生(从"说错话"到"做错事"的防线)、Token 要运营(每个词元的成本与业务价值)。其中"安全要内生"一条,工商银行与华为联合发布的白皮书里有罕见直白的表述:随着 AI 从内容生成迈向任务执行,风险正从"内容合规"升级为"决策合规"——从"说错话"变成"做错事"。
数字同样说明趋势:openJiuwen 已在 10 多家金融机构规模化部署,单一客户环境可支持超过 1000 个智能体在线运行、万级并发。一千个在线智能体,等于一家上千人的机构——它的权限、审计、成本,都是机构级课题。白皮书给出的架构答案是"继承式演进":由代码守住确定性核心底线,智能体在严格授权范围内动态组织任务。确定性交给代码,弹性交给智能体,边界由授权体系来守——监管最严的金融行业,已经把这件事写进了行动指南。
四、把护栏建在数据层:三层权限链的工程答案
"授权体系来守"听上去抽象,落到工程上其实只有一个问题:授权的最小单元是什么?如果答案还是"一个数据库账号",那护栏就是纸糊的。OntiCards 的做法是把授权单元从"账号"细化到"数据卡片"——数据卡片是某一份数据源、数据表或文档的 AI 结构化说明书,只记录元信息、语义和权限与脱敏规则,不存业务数据。Agent 不直接持有数据库账号,而是按卡片取数:看得见哪张卡片,才碰得到对应的数据;卡片上没授权的字段,NL2SQL 引擎在执行层直接收口,不依赖模型自觉。
在卡片之上,是三层权限链:数据卡片访问权限 → Agent 岗位权限 → 技能执行操作权限,配合最小权限原则、全链路审计与高风险操作强制审批。三层各自的边界互相独立:能访问某张数据卡片,不代表能调用某个执行动作;能调用动作,每一次调用都留下可追溯的审计轨迹。
这套思路和我们在智能体可审计性、Agent 运行时隔离两篇文章里的判断一脉相承:当智能体从"回答问题"走向"执行任务",安全属性必须从上线前的一道补丁,变成运行时的内生结构。区别在于,9 月 18 日之后,这不再是前瞻观点——四大实验室用四起事件证明,模型层的自律是靠不住的,企业能依赖的只有自己数据层上的硬边界。私有化部署、数据不出域,则是这条边界的物理兜底。
越界事件不会是最后一次。真正的分水岭不在于哪家模型更"听话",而在于哪些企业先把自己的数据权限边界建好——如果你正在评估自己企业的智能体数据边界,欢迎联系 hello@onticards.com 交流。