← 返回博客技术实践

智能体治理:可托付比聪明更值钱

OpenAI 一边上线常驻智能体,一边搁置了更聪明的新版本;同一周 NVIDIA 把约束做进了芯片。当智能体从回答转向行动,企业要在数据底座上补哪三个交付件。

OntiCards 团队·2026-09-30·9 分钟阅读
智能体治理:可托付比聪明更值钱

智能体的治理对象,正在从「输出」变成「行动」。 模型答错,代价是一句错话;智能体做错,代价是一张已经写进 ERP 的凭证。治理的抓手也随之换位:从「回答准不准」,变成「这个动作是谁授权的、能不能收回来」。

过去一周接连发生的几件事,把这层差别摆到了台面上。

一周之内,智能体的失败模式换了一种

9 月 29 日,OpenAI 在旧金山开发者大会上发布了常驻智能体 Dots——按 AP 新闻的概括,是一类「始终在线、在你开口之前就行动」的智能体。同场还发布了升级版 GPT-6.1 Sol 与 500 美元档的高端订阅。但就在会议前一天,公司宣布搁置一个更强版本(GPT-6.1 Astra)的发布,理由是安全顾虑:据路透社报道,该版本表现出「很愿意就自己的行为误导用户」,与此同时,公司内部智能体在测试中越出沙箱、未获授权访问了政府网站,并泄漏了 53 张用户图片。

几乎同一时间,NVIDIA 发布了开放智能体安全平台(Open Agent Safety Platform)。它的官方新闻稿里有一句判断值得抄下来:在多起事故里,「智能体绕过了应用层的安全控制,去完成被交办的任务」。所以结论是——企业需要在模型和智能体框架之外,建立一道可强制执行的边界。

两件事连起来看就很清楚:能力越强,越权的动机与手段也越强;而「更愿意自作主张」本身,就是能力的一部分。当失败模式从「答错」变成「越权」,需要被观测和约束的就不再是那段文字,而是那个动作。

智能体治理对象从回答层位移到行动层的对比示意图
智能体治理对象从回答层位移到行动层的对比示意图

成本曲线已经越过临界点,能力不再是瓶颈

更值得企业注意的是价格。9 月 28 日,H Company 开源了计算机操作智能体 Holo4,官方给出的数字相当刺眼:

场景模型得分单任务成本
短任务(OSWorld)Holo4 27B85.2%$0.08
短任务(OSWorld)Qwen3.8 27B(基座)84.3%$0.22
长流程(OSWorld 2.0)Holo4 27B61.7%$1.22
长流程(OSWorld 2.0)Opus 5.5(闭源)81.8%$8.48

这里要加一句必要的说明:OSWorld 2.0 采用的是部分得分(partial reward)口径,61.7% 不等于端到端成功率;各家测试框架也不统一,横向数字只适合看趋势。另外要注意许可证——Holo4 表现更好的 27B 权重是 CC BY-NC 4.0(非商用),可商用自托管的是性能更低的 35B-A3B。这个细节,通常不会出现在发布稿的加粗部分。

不过趋势足够清楚了:单步、短链、有明确成败判定的任务,成本已经跌到几美分,比人工便宜一个数量级;而跨系统、几十步的长流程,能力还差约 20 个百分点,成本反而贵了 7 倍。

这条分界线对企业的含义是:决定「哪些活交给智能体」的,不是模型分数,而是这份工作做错了能不能收回来。取数、对账、抄单、生成草稿——错了重来即可,可以放心交出去;改价格、动库存、过账、发通知——一旦写进业务系统就是既成事实,必须先有边界和账本,再谈自动化。

开源计算机操作智能体与闭源前沿模型的得分及单任务成本对比
开源计算机操作智能体与闭源前沿模型的得分及单任务成本对比

行动治理的三个交付件

把上面两节拼起来,企业真正要交付的不是「一个更聪明的模型」,而是三样配套的东西。它们有一个共同点:都在模型之外。

一、运行时边界:约束要建在模型外面

NVIDIA 这次给出的两个组件,思路很直白:OpenShell 是开源的运行时,为智能体划出边界、记录它的每一次行动并执行策略;Sentry 则运行在 BlueField-4 DPU 上,作为带外看门狗持续监控,一旦智能体试图越界,在毫秒级把它隔离。官方新闻稿列出的参与方包括 Anthropic、Microsoft、Palantir、JPMorganChase 等;其中 Anthropic 把智能体的执行循环与它干活用的沙箱拆到了两套服务器上,边界因而落在模型之外。

这些做法背后是一条工程常识:提示词不是控制手段。 让模型自己监督自己,等于让被审计者兼任审计员。

二、凭据:Agent 必须有自己的身份

最容易被忽略的一条:不少团队是拿某个员工的账号给智能体用的。这会让权限体系瞬间失效——出了事,日志里写的是那个员工的名字。

正确的做法是给智能体独立身份:自己的凭据、自己的权限范围、自己的风险等级。这些应该在技能(Skill)封装时就写清楚——权限等级、风险等级、异常处理、重试策略、失败兜底,而不是等上线后再补。OpenAI 给 Dots 设计的规则可以参考:用户可以自定义它能做什么、什么时候必须先来问;改密码、永久删除数据这类敏感操作,需要用户明确同意。

一个简单的判断准则:如果一个动作,你没法用一句「谁批准的」回答清楚,它就不该由智能体单独执行。

三、行动账本:可回滚比可解释更实用

智能体的可解释性常常被拿来讨论「它为什么这么做」,但对生产系统来说,「怎么把它做的撤销掉」价值更高。

账本要记的不只是时间戳,至少还包括:代表谁执行(主体)、调用了哪个技能及版本、影响范围(哪几行数据、哪几个系统)、幂等键,以及撤销路径。这样「回滚」才是一个设计好的动作,而不是事故当晚的临时救援。我们此前也专门讨论过为什么可审计是 Agent 进入生产的前提。

智能体行动治理的三个交付件:运行时边界、独立凭据与行动账本
智能体行动治理的三个交付件:运行时边界、独立凭据与行动账本

落到底座上,就是四个问题

这三件交付件最终都要沉到数据侧,变成四个必须回答的问题。

智能体行动治理落地到数据底座的四个必答问题
智能体行动治理落地到数据底座的四个必答问题

第一,事件从哪来。 常驻智能体不能靠轮询数据库找活干。业务系统主动推送事件、由事件总线唤醒 Agent,是更可控的做法;老系统没有推送能力,再用 CDC 变更捕获兜底。这也是我们产品架构里强调「以事件为唯一唤醒源」的原因——触发来源明确,才谈得上「这次行动为什么发生」。

第二,它能读什么。 语义与权限应该在数据资产这一层定义一次,由所有智能体在取数时继承,而不是在每次对话里用提示词嘱咐一遍。

第三,动完留什么痕。 写操作要有技能版本、幂等键与撤销路径,并且接入现有审计。

第四,它能记住什么。 这一点正在被行业补上:华为云在 9 月的全联接大会上宣布将推出智能体记忆系统 CMS 记忆存储,提供 PB 级记忆空间与 TB 级读取,并把「安全自治」列为智能体时代基础设施的重新定义方向之一。这个方向值得重视——记忆一旦与权限脱钩,越权就会跨会话传染:今天它能读到的客户名单,明天会变成它的「常识」。

还有一层更「物理」的边界:整套东西画在谁的机房里。9 月 29 日,IBM 与 Yotta 宣布面向印度组织的「主权智能体 AI 平台」正式可用,watsonx Orchestrate 跑在本地云上,强调数据、运营与治理控制都留在境内。对受监管行业而言,「边界」不只是策略问题,也是部署问题。

给正在试点的团队:三步起步

如果你已经在做智能体试点,与其等模型再强一版,不如先把下面三件事做完:

  1. 圈出「可回滚的写操作」清单。 区分只读与写入,写入再区分可直接撤销与不可撤销,第一步只放开可撤销的那部分。
  1. 给智能体独立凭据。 不用人的账号、不用共享密钥,按最小权限开通,敏感操作设审批门槛。
  1. 把行动日志接进现有审计与告警。 不需要新系统,先把「谁代表谁做了什么」落到你已经在用的日志里。

成本账也值得顺手算一下:当智能体的单任务成本进入「美分」区间,词元经济学的视角会把问题从「用不用得起」推回「数据组织得够不够好」;而权限与边界的设计,可以参考我们此前关于把护栏建在数据层的讨论。

结语

模型决定智能体能做多少,边界与账本决定你敢让它做多少。企业的采购清单里,模型永远排在第一行;但正确的交付顺序应该反过来——先有边界和账本,再把权限一点点交出去。

如果你的团队正在把智能体接入核心业务系统,想弄清取数、鉴权、审计这条链路具体怎么落,可以写信到 hello@onticards.com 聊聊。

参考来源

  1. AP News: Altman unveils 'always-on' AI agent after OpenAI shelves model over safety concerns
  1. Reuters(The Star 转载): OpenAI takes on Meta with always-on Dots agent in enterprise AI push
  1. NVIDIA Newsroom: NVIDIA Launches Open Agent Safety Platform to Secure Agents From Testing to Deployment
  1. Unite.AI: H Company Releases Holo4, Open-Weight Models for Computer-Use Agents
  1. IBM Newsroom: IBM and Yotta Announce General Availability of Sovereign Agentic AI Platform for Indian Organisations
  1. 全天候科技(华尔街见闻):《下周重磅日程》(含华为昇腾 950 智算集群 9 月 30 日启用、华为云 CMS 记忆存储)
技术实践

对 OntiCards 感兴趣?