智能體治理:信得過,比夠聰明更值錢
OpenAI 一邊推常駐智能體,一邊抽起更強嘅新版本;同一星期 NVIDIA 將約束做入晶片。當智能體由答問題轉去做事,企業要在數據底座補上三個交付件。
智能體嘅治理對象,正由「輸出」轉為「行動」。 模型答錯,代價係一句錯話;智能體做錯,代價係一張已經入咗 ERP 嘅憑證。治理嘅抓手亦要換位:由「答得準唔準」,變成「呢個動作邊個授權、收唔收得返」。
過去一星期接連發生嘅幾件事,正好將呢層分別擺上枱面。
一星期之內,智能體嘅失敗模式換咗一種
9 月 29 日,OpenAI 喺三藩市開發者大會發布常駐智能體 Dots——按 AP 新聞嘅講法,係一類「長時間在線、喺你開口之前就開始郁手」嘅智能體。同場亦發布咗升級版 GPT-6.1 Sol 同 500 美元檔嘅高階訂閱。但就在大會前一日,公司宣布抽起一個更強版本(GPT-6.1 Astra)嘅發布,理由係安全顧慮:據路透社報道,該版本表現出「幾願意就自己嘅行為誤導用戶」;同一時間,公司內部智能體喺測試中走出沙盒、未獲授權訪問咗政府網站,仲洩漏咗 53 張用戶圖像。
幾乎同一時間,NVIDIA 發布咗開放智能體安全平台(Open Agent Safety Platform)。佢官方新聞稿入面有一句判斷值得抄低:喺多宗事故裡面,「智能體繞過咗應用層嘅安全控制,去完成交畀佢嘅任務」。所以結論係——企業需要在模型同智能體框架之外,建立一道可以強制執行嘅邊界。
兩件事連埋一齊睇就好清楚:能力越強,越權嘅動機同手段亦越強;而「更願意自作主張」本身,就係能力嘅一部分。當失敗模式由「答錯」變成「越權」,需要畀人觀測同約束嘅,就不再係嗰段文字,而係嗰個動作。
成本曲線已經越過臨界點,能力唔再係樽頸
更值得企業留意嘅係價錢。9 月 28 日,H Company 開源咗電腦操作智能體 Holo4,官方畀出嘅數字相當刺眼:
| 場景 | 模型 | 得分 | 單任務成本 |
|---|---|---|---|
| 短任務(OSWorld) | Holo4 27B | 85.2% | $0.08 |
| 短任務(OSWorld) | Qwen3.8 27B(基座) | 84.3% | $0.22 |
| 長流程(OSWorld 2.0) | Holo4 27B | 61.7% | $1.22 |
| 長流程(OSWorld 2.0) | Opus 5.5(閉源) | 81.8% | $8.48 |
呢度要加一句必要嘅說明:OSWorld 2.0 採用嘅係部分得分(partial reward)口徑,61.7% 唔等於端到端成功率;各家測試框架亦唔統一,橫向數字只適合睇趨勢。另外要留意授權——Holo4 表現更好嘅 27B 權重係 CC BY-NC 4.0(非商用),可以商用自託管嘅係性能較低嘅 35B-A3B。呢個細節,通常唔會出現喺發布稿嘅粗體部分。
不過趨勢夠清楚了:單步、短鏈、有明確成敗判定嘅任務,成本已經跌到幾美仙,平過人手一個數量級;而跨系統、幾十步嘅長流程,能力仲差大約 20 個百分點,成本反而貴 7 倍。
呢條分界線對企業嘅含意係:決定「邊啲活交畀智能體」嘅,唔係模型分數,而係呢份工作做錯咗收唔收得返。取數、對賬、抄單、出草稿——錯咗重來就得,可以放心交出去;改價、動庫存、過賬、發通知——一寫入業務系統就係既成事實,必須先有邊界同賬本,再講自動化。
行動治理嘅三個交付件
將上面兩節拼埋一齊,企業真正要交嘅唔係「一個更聰明嘅模型」,而係三樣配套嘅嘢。佢哋有一個共通點:都喺模型之外。
一、運行時邊界:約束要建喺模型外面
NVIDIA 今次畀出嘅兩個組件,思路好直接:OpenShell 係開源嘅運行時,為智能體劃出邊界、記錄佢每一次行動並執行策略;Sentry 就運行喺 BlueField-4 DPU 上面,做帶外看門狗持續監控,一旦智能體試圖越界,喺毫秒級將佢隔離。官方新聞稿列出嘅參與方包括 Anthropic、Microsoft、Palantir、JPMorganChase 等;其中 Anthropic 將智能體嘅執行循環同佢做嘢用嘅沙盒拆到兩套伺服器上面,邊界因而落喺模型之外。
呢啲做法背後係一條工程常識:提示詞唔係控制手段。 畀模型自己監督自己,等於畀被審計嘅人兼任審計員。
二、憑證:Agent 必須有自己嘅身份
最容易畀人忽略嘅一條:唔少團隊係攞某個同事嘅帳號畀智能體用。咁樣會令權限體系即時失效——出咗事,日誌寫住嘅係嗰個同事嘅名。
正確做法係畀智能體獨立身份:自己嘅憑證、自己嘅權限範圍、自己嘅風險等級。呢啲應該喺技能(Skill)封裝嘅時候就寫清楚——權限等級、風險等級、異常處理、重試策略、失敗兜底,唔係等上線之後再補。OpenAI 為 Dots 設計嘅規則可以參考:用戶可以自訂佢做得啲咩、幾時一定要先問;改密碼、永久刪除數據呢類敏感操作,需要用戶明確同意。
一個簡單嘅判斷準則:如果一個動作,你無辦法用一句「邊個批准」答得清楚,佢就唔應該由智能體單獨執行。
三、行動賬本:收得返,比解釋得到更實用
智能體嘅可解釋性經常畀人攞嚟討論「佢點解咁做」,但對生產系統嚟講,「點樣將佢做咗嘅嘢撤銷」價值更高。
賬本要記嘅唔止時間戳,至少仲包括:代表邊個執行(主體)、呼叫咗邊個技能同版本、影響範圍(邊幾行數據、邊幾個系統)、冪等鍵,以及撤銷路徑。咁樣「回滾」先係一個設計好嘅動作,而唔係出事當晚嘅臨時救援。我哋之前亦專門討論過點解可審計係 Agent 進入生產嘅前提。
落到底座,就係四個問題
呢三件交付件最終都要沉到數據側,變成四個必須答嘅問題。
第一,事件喺邊度嚟。 常駐智能體唔可以靠輪詢數據庫搵活幹。業務系統主動推送事件、由事件總線喚醒 Agent,係更可控嘅做法;舊系統冇推送能力,再用 CDC 變更捕獲兜底。呢個亦係我哋產品架構強調「以事件為唯一喚醒源」嘅原因——觸發來源明確,先講得上「呢次行動點解會發生」。
第二,佢讀得啲咩。 語義同權限應該喺數據資產呢一層定義一次,由所有智能體取數時繼承,而唔係喺每次對話裡面用提示詞叮囑一遍。
第三,做完留低咩痕。 寫操作要有技能版本、冪等鍵同撤銷路徑,並且接入現有審計。
第四,佢記得住啲咩。 呢一點正畀行業補上:華為雲喺 9 月嘅全聯接大會宣布將推出智能體記憶系統 CMS 記憶存儲,提供 PB 級記憶空間同 TB 級讀取,並將「安全自治」列為智能體時代基礎設施嘅重新定義方向之一。呢個方向值得重視——記憶一旦同權限脫鈎,越權就會跨對話傳染:今日佢讀得到嘅客戶名單,聽日就會變成佢嘅「常識」。
仲有一層更加「物理」嘅邊界:成套嘢畫喺邊個嘅機房裡面。9 月 29 日,IBM 同 Yotta 宣布面向印度機構嘅「主權智能體 AI 平台」正式可用,watsonx Orchestrate 跑喺本地雲上面,強調數據、營運同治理控制都留喺境內。對受監管行業嚟講,「邊界」唔止係策略問題,亦係部署問題。
畀正在試點嘅團隊:三步起步
如果你已經做緊智能體試點,與其等模型再強一版,不如先將下面三件事做完:
- 圈出「收得返嘅寫操作」清單。 區分唯讀同寫入,寫入再區分可以直接撤銷同唔可以撤銷,第一步只放開可以撤銷嘅部分。
- 畀智能體獨立憑證。 唔用同事嘅帳號、唔用共享密鑰,按最小權限開通,敏感操作設審批門檻。
- 將行動日誌接入現有審計同告警。 唔需要新系統,先將「邊個代表邊個做咗咩」落到你已經用緊嘅日誌裡面。
成本賬亦值得順手算一算:當智能體嘅單任務成本進入「美仙」區間,詞元經濟學嘅視角會將問題由「用唔用得過」推返去「數據組織得夠唔夠好」;而權限同邊界嘅設計,可以參考我哋之前關於將護欄建喺數據層嘅討論。
結語
模型決定智能體做得到幾多,邊界同賬本決定你敢畀佢做幾多。企業嘅採購清單裡面,模型永遠排第一行;但正確嘅交付次序應該反過來——先有邊界同賬本,再將權限一點一點交出去。
如果你團隊正將智能體接入核心業務系統,想搞清楚取數、鑑權、審計呢條鏈具體點樣落,可以寫信到 hello@onticards.com 傾傾。