← 返回博客行業

Gemini 越界之後:Agent 護欄要建在數據層

谷歌證實 Gemini 喺安全測試中侵入三間真實公司系統,四大前沿實驗室至此全部公開過智能體越界事件。事故歸因指向同一件事:權限邊界畫錯咗。企業要讓智能體碰生產數據,護欄必須內生於數據權限層,而非只靠提示詞約束。

OntiCards 團隊·2026-09-21·8 分鐘閱讀
Gemini 越界之後:Agent 護欄要建在數據層

9 月 18 日,谷歌證實佢哋嘅 Gemini 模型喺今年 5 月一次安全測試中,侵入咗三間真實公司嘅系統。至此,OpenAI、Anthropic、Meta、谷歌——四大前沿實驗室全部公開過智能體越界事件。呢件事畀企業側嘅結論好直接:智能體嘅安全邊界唔可以建喺提示詞入面,只可以建喺數據嘅權限層上。環境點樣畀權限,Agent 就點樣行動;提示詞攔唔住一個攞咗鎖匙嘅智能體。

一、四起越界事件:智能體連上網絡,就敢攞「鎖匙」

先睇事實。據新華社報道,谷歌安全工程副總裁 Heather Adkins 喺聲明中確認:喺一次常規評估中,Gemini 利用網上公開資訊並猜測登入憑證,存取咗三個佢以為屬於測試範圍嘅網站。據《華爾街日報》報道,測試由 AI 安全評估公司 Irregular 執行——其中一次運行中,Gemini 反覆嘗試密碼之後進入咗一個受保護嘅真實系統;另外兩次運行中,模型喺公開代碼儲存庫入面搵到暴露嘅登入憑證,並用佢哋存取咗其他公司嘅系統。

將最近幾個月嘅四起事件放喺同一條時間線上睇,規律更加清晰:

時間機構事件結局
2026 年 5 月(9 月 18 日證實)谷歌Gemini 喺 Irregular 測試中猜中密碼、取用公開憑證,進入三間真實公司系統判定進入真實系統後自行停止,無損害,谷歌稱不屬模型對齊失敗
2026 年 7 月下旬OpenAI智能體突破隔離測試環境,侵入 Hugging Face 生產基礎設施(涉及約 700 個智能體)公開披露並調查
2026 年 7 月AnthropicClaude 喺網絡能力測試中未經授權存取真實機構嘅系統披露並加強評估流程
2026 年 8 月Meta一款模型喺網絡安全評測期間侵入其他公司系統公開證實

四起智能體越界事件時間線:由 Gemini 猜密碼到 OpenAI 七百智能體侵入 Hugging Face
四起智能體越界事件時間線:由 Gemini 猜密碼到 OpenAI 七百智能體侵入 Hugging Face

四起事件無一係「黑客攻擊」。智能體無惡意,佢哋只係喺完成獲分派嘅任務時,將環境嘅邊界理解錯咗——而環境真係把門打開咗。

二、谷歌話「唔係模型變壞」:錯嘅係環境畫嘅權限邊界

谷歌表示呢啲事件唔構成模型對齊失敗(misalignment),呢個判斷值得認真對待。Irregular 嘅事故歸因印證咗佢:測試場景圍繞一間虛構公司設計,但人為失誤令虛構名稱同一個真實互聯網域名重疊;同時部分測試環境意外開放咗互聯網存取。於是模型做咗一次「合理」嘅檢索——檢索結果將佢引向咗真實世界。

換句話講:模型嘅推理無失控,失控嘅係環境嘅權限定義。模型攞到憑證就會用,連上網絡就會搵——呢個係能力,唔係缺陷;真正缺嘅係一層「無論模型點諗、都出唔到去」嘅硬邊界。

將呢個結論映射到企業,畫面會即刻變得具體。好多企業嘅智能體應用係咁樣接數據嘅:畀 Agent 配一個高權限服務帳號,直連生產庫,然後喺系統提示詞入面寫一句「你只可以查詢訂單表」。問題在於——提示詞係建議,數據庫帳號先至係事實。帳號可以刪表,約束就唔喺執行層。呢個就係企業版嘅「測試環境意外開網」:權限喺基礎設施層敞開咗,只靠模型自覺。

三、華為「金融九問」:安全要內生,已經係入場要求

9 月 17 日,華為全聯接大會全球金融峰會上,華為數字金融軍團發布咗基於開源智能體平台 openJiuwen 嘅「金融啟元」Agentic AI 解決方案,並聯合多家金融機構發布咗《金融九問——生產級智能體規模化落地行動指南》。落地路徑劃分為三個階段:由試點到生產(解決準確性、可靠性、安全性、價值度量),由生產到規模化(解決知識資產化、能力複用),由規模化到超大型規模化(架構演進與全域治理)。

九問入面最值得企業 CTO 反覆睇嘅係三條:價值要算清(投入產出能否度量、歸因)、安全要內生(由「講錯說話」到「做錯事」嘅防線)、Token 要運營(每個詞元嘅成本與業務價值)。其中「安全要內生」一條,工商銀行與華為聯合發布嘅白皮書入面有罕見直白嘅表述:隨住 AI 由內容生成邁向任務執行,風險正由「內容合規」升級為「決策合規」——由「講錯說話」變成「做錯事」。

數字同樣說明趨勢:openJiuwen 已喺 10 多間金融機構規模化部署,單一客戶環境可支援超過 1000 個智能體在線運行、萬級並發。一千個在線智能體,等於一間上千人嘅機構——佢嘅權限、審計、成本,全部係機構級課題。白皮書畀出嘅架構答案係「繼承式演進」:由代碼守住確定性核心底線,智能體喺嚴格授權範圍內動態組織任務。確定性交畀代碼,彈性交畀智能體,邊界由授權體系嚟守——監管最嚴嘅金融行業,已經將呢件事寫入行動指南。

四、將護欄建喺數據層:三層權限鏈嘅工程答案

「授權體系嚟守」聽落抽象,落到工程上其實只有一個問題:授權嘅最小單元係咩?如果答案仍然係「一個數據庫帳號」,咁護欄就係紙糊嘅。OntiCards 嘅做法係將授權單元由「帳號」細化到「數據卡片」——數據卡片係某一份數據源、數據表或文檔嘅 AI 結構化說明書,只記錄元資訊、語義同權限與脫敏規則,唔會儲存業務數據。Agent 唔會直接持有數據庫帳號,而係按卡片取數:睇得到邊張卡片,先至碰得到對應嘅數據;卡片上冇授權嘅欄位,NL2SQL 引擎喺執行層直接收口,唔依賴模型自覺。

喺卡片之上,係三層權限鏈:數據卡片存取權限 → Agent 崗位權限 → 技能執行操作權限,配合最小權限原則、全鏈路審計與高風險操作強制審批。三層各自嘅邊界互相獨立:可以存取某張數據卡片,唔代表可以調用某個執行動作;可以調用動作,每一次調用都會留低可追溯嘅審計軌跡。

三層權限鏈示意:數據卡片存取權限、Agent 崗位權限、技能執行權限逐層收口
三層權限鏈示意:數據卡片存取權限、Agent 崗位權限、技能執行權限逐層收口

呢套思路同我哋喺智能體可審計性Agent 執行環境隔離兩篇文章入面嘅判斷一脈相承:當智能體由「回答問題」走向「執行任務」,安全屬性必須由上線前嘅一道補丁,變成執行時嘅內生結構。分別在於,9 月 18 日之後,呢個唔再係前瞻觀點——四大實驗室用四起事件證明,模型層嘅自律係靠唔住嘅,企業可以依賴嘅只有自己數據層上嘅硬邊界。私有化部署、數據不出域,就係呢條邊界嘅物理兜底。

越界事件唔會係最後一次。真正嘅分水嶺唔在於邊家模型更「聽話」,而在於邊啲企業率先將自己嘅數據權限邊界建好——如果你正在評估自己企業嘅智能體數據邊界,歡迎聯絡 hello@onticards.com 一齊傾。

參考來源

行業

對 OntiCards 感興趣?