模型疲勞時代:企業 AI 底座嘅抗迭代設計
一星期之內 Anthropic、Meta、Google、OpenAI 齊發新模型,CNBC 造咗個新詞「模型疲勞」。本文拆解企業評測選型嘅真實負擔,並提出四條抗迭代設計原則,等數據資產穿越模型迭代週期。
啱啱過去嘅一星期,可能係大模型史上最擠迫嘅一星期:Anthropic、Meta、Google、OpenAI 喺三日之內接連發布新一代模型,CNBC 為呢種連軸轉起咗個名——模型疲勞(model fatigue)。我哋嘅結論好直接:企業唔需要追上每一次模型發布,需要嘅係一個換引擎唔換地基嘅底座——數據卡片、本體語義、知識圖譜同審計日誌呢啲資產建喺模型之外,先至穿越到模型迭代週期。
一星期四個前沿模型,「模型疲勞」成為行業新詞
先回顧呢輪「迭代潮」。據 Silicon Report 同財聯社報道,9 月 1 日(上週二)Anthropic 發布 Claude Fable 5.1 與 Claude Mythos 5.1;翌日 Meta 推出 Muse Spark 1.3、Google 推出 Gemini 3.8 Flash;9 月 3 日 OpenAI 發布 GPT-6 Astra。四間實驗室、一星期之內、全部大版本更新——呢種節奏此前從未出現過。
| 模型 | 發布方 | 主打方向 | 關鍵數字 |
|---|---|---|---|
| Claude Fable 5.1 / Mythos 5.1 | Anthropic | 編程與知識工作 | 快取輸入 token 減價 75%,典型負載成本大約降 25% |
| Muse Spark 1.3 | Meta | 編程與智能體任務 | 工具調用減少約 20%,token 消耗減少約 25% |
| Gemini 3.8 Flash | 編碼與智能體 | 主打性價比同響應速度 | |
| GPT-6 Astra | OpenAI | 網絡安全與電腦操作 | ARC-AGI-3 得分 99.9%;每百萬輸入/輸出 token 收費 $10/$50 |
呢輪密集發布並非巧合。Sam Altman 對 CNBC 嘅解釋一半係玩笑——「大家都放完暑假返嚟」;更真實嘅動因係 Anthropic 同 OpenAI 都喺度衝刺 IPO(私募估值都接近 1 萬億美元),每一次發布都係對企業預算嘅卡位。Gartner 預測 2026 年全球 AI 支出將達 2.59 萬億美元,按年增長 47%——所有廠商都想喺呢個盤度多切一嚿。
評測負擔,落喺企業買家度
發布潮嘅熱鬧係實驗室嘅,成本就係企業嘅。兩間受訪企業嘅處境好有代表性:
- Clockwork Systems CEO Suresh Vasudevan:每跟蹤一次增量模型更新都要消耗大量算力,有啲任務十個候選模型只可以評測五個。
- Runpod CEO Zhen Lu:「模型疲勞係真實存在嘅,我哋身處一個泡沫經濟盛行嘅環境,你必須發出自己嘅聲音。」
評測負擔唔只係算力,仲有基線嘅快速失效。以 WANDR 研究型智能體基準為例:GPT-6 Astra 以 0.682 分、每任務 11.98 美元拿下已測模型最高分,比 Fable 5.1 高 13.5% 而且成本低 6.1%。呢類數字風光一星期,下一輪發布就可能改寫。企業按廠商榜單做技術選型,本質上係將採購決策建立喺一份不斷過期嘅報價單度。
會過時嘅係乜嘢,唔會過時嘅又係乜嘢
將視角拉長,9 月仲有兩單新聞值得對照住睇。
其一,OpenAI 喺 9 月 6 日宣布達成舊年定落嘅「自動化研究實習生」目標:佢哋研究組織入面,每 1 個人類工作日對應 3.1 個智能體工作日嘅算力投入;按使用量排名嘅中位數研究員,8 月中旬嘅日均推理開銷已經超過 600 美元(按 API 價格折算)。其二,Spotify 喺工程博客披露內部工具 Portal 透過強制路由,將 Claude Code 嘅 token 消耗砍走 90%——機械性檔案讀取交畀平價小模型,推理同安全關鍵上下文就留畀前沿模型。
呢兩單新聞指向同一個事實:智能體正在成為企業運行時嘅常駐負載,而「平價模型做粗活、前沿模型做推理」已經由提示詞技巧變成架構設計模式。當模型成為可插拔嘅組件,模型本身嘅迭代就唔再恐怖——應該恐怖嘅,係嗰啲將業務邏輯、數據語義、權限規則全部寫死喺某一個模型身上嘅系統。
所以分界線好清晰:會過時嘅係模型本身(能力、價格、榜單),唔會過時嘅係企業嘅數據資產與知識資產——真實業務數據嘅結構化語義、由業務事實萃取嘅知識圖譜、跨模型一致嘅審計記錄。呢啲資產唔會隨模型更換而貶值,反而隨住使用時間複利增值。
抗迭代底座嘅四條設計原則
結合今個星期嘅訊號同我哋喺企業項目入面嘅實踐,我哋將「換引擎唔換地基」拆做四條可以執行嘅設計原則:
- 模型無關接入:喺路由層隔離各廠商模型 API,數據存取、工具調用、編排邏輯唔感知具體模型。新嘅模型發布對系統只係「多一個可選項」,而唔係「一次遷移工程」。
- 任務級評測基線:唔用廠商榜單做選型,用自己企業嘅真實任務集(例如 50 個高頻問數場景)建立固定評測集,每個新模型上線前跑一次,得出「對我哋業務」嘅性價比結論。
- 語義層承載業務知識:業務概念、指標口徑、表間關係沉澱喺數據卡片與本體度,而唔係寫喺某個模型嘅提示詞入面。模型可以一星期換一個,語義層三年都唔使重寫。
- 審計與權限獨立於模型:邊個喺幾時用邊個模型存取咗邊啲數據,呢類審計與權限記錄必須沉澱喺平台層。模型會退役,合規記錄要留十年。
呢四條原則共同構成 OntiCards 嘅架構底座:數據卡片作為 Agent 嘅數據字典同導航,本體統一業務語言,Agent 生態與技能庫承載執行邏輯——全部同具體模型解耦。對我哋服務嘅製造、金融、能源客戶嚟講,即係話每星期嘅模型發布會唔再係焦慮來源,而係一個可以低成本試用嘅增量選項。
模型疲勞唔會完結,IPO 節奏決定咗發布只會更快。但企業真正需要回答嘅問題,從來都唔係「應該揀邊個模型」,而係「當模型換到第五個嘅時候,我嘅數據同知識仲剩低啲乜嘢」。將答案建喺模型之外,迭代潮就由威脅變成順風。