Jev 洗版背後:System One 模型點解唔做聊天
Jev 唔寫一個字,只回是/否、選項同分數,卻成為 Vercel AI Gateway 史上獲採納最快嘅模型。System One 路線憑咩?技術原理、真實收益、官方自認嘅局限同開源挑戰者。
9 月 15 日,TypeSafe AI 放出第一個「系統一模型」(System One Model)Jev,開放早期存取。佢唔寫一個字:你畀佢一段程式狀態同幾條帶類型嘅問題,佢只回選項、分數同是/否,每條答案附帶 0 到 1 嘅校準置信度。上線 24 小時內,佢成為 Vercel AI Gateway 史上獲採納最快嘅模型——近 13% 付費團隊接入;72 小時內 Cloudflare Workers AI、LangChain、Langfuse 全部完成對接;官方輪候名單喺 36 小時內清走 14 萬人。
呢件事真正嘅信號唔係「又多一個模型」,而係 Agent 入面嗰啲睇唔見嘅判斷調用——路由、分類、打分、驗證、攔截——第一次有咗專門嘅供應商,而且比通用大模型便宜兩個數量級。Jev 作者 Diogo Almeida 係 ChatGPT 背後 RLHF 方法嘅研究者之一,佢為今次發布定嘅問題係:「模型喺聊天上超越人類好幾年,自動化喺邊?」
一、佢到底做咩:三種問題,一個介面
Jev 嘅 API 只有一個端點,一個請求包含兩部分:state(一段非結構化嘅程式狀態)同 questions(一組帶類型嘅問題)。問題分三類:
| 問題類型 | 作用 | 返回 |
|---|---|---|
| Choice | 由候選清單入面揀一個 | 揀中嘅選項 + 各項概率 + 置信度 |
| Score | 按有序等級打分 | 分值 + 各項概率 + 置信度 |
| Noul | 判斷陳述是否成立(布林) | 0–1 嘅概率 |
from typesafe_sdk import Choice, Noul, TypeSafeClient
client = TypeSafeClient() # 讀取 TYPESAFE_API_KEY
r = client.system_one(
state=ticket,
questions={
"department": Choice(
instructions="應該由邊個團隊處理",
criteria={"billing": "付款問題", "technical": "系統故障"},
),
"is_urgent": Noul(instructions="呢段訊息有無表達出迫切性"),
},
)
print(r.answers["department"].choice, r.answers["is_urgent"].noul)
三個設計細節值得留意。第一,同一個請求入面所有問題對同一段狀態並行評估,加問題幾乎唔會增加響應時間。第二,Choice 最多支援 255 個選項,高基數選擇(例如由過千條連結入面揀下一步)唔需要靠語言描述去繞。第三,亦都係最實用嘅一點:每條答案都帶置信度。
官方文檔嘅例子好典型——分類結果入面 billing 嘅概率係 0.84,但置信度只有 0.596,因為 technical 仍然佔 0.159。文檔建議三條路:高置信直接執行、中間地帶人手覆核、低置信轉交真人。佢將「我知自己可能唔知」做成咗返回值,而呢樣嘢正正係軟件敢於自動化嘅前提。
二、兩個數量級嘅差距由邊度嚟:並行取樣 + RLCD
現有大模型嘅推理係順序嘅:一次生成一個 token,每個 token 依賴上一個。Jev 換成並行取樣——所有可能嘅輸出喺一次查詢入面同時取樣,官方形容呢種方式「極之高效,而且對硬件友好」。
訓練方法方面,TypeSafe 將呢一代技術命名為 RLCD(Reinforcement Learning for Calibrated Decisions,面向校準決策嘅強化學習),對標之前嘅 RLHF(人類反饋強化學習,優化人類偏好嘅回答)同 RLVR(可驗證獎勵強化學習,優化可程式化驗證嘅輸出)。RLCD 優化嘅係「認識論上誠實嘅概率」:模型講 95%,就應該真係喺 95% 嘅情況下正確。
放棄字串生成換嚟兩個硬保證。因為輸出結構同取值範圍都由開發者事先定義,模型唔可能產生類型錯誤——官方強調呢點係數學上唔可能,可以用任何一個反例去證偽,而唔係經驗統計;同時因為唔做自由文本生成,亦就冇傳統意義上嘅幻覺。代價同樣明確:佢唔會寫電郵、唔會寫文章,只會做判斷。
| 維度 | 通用 LLM | System One 模型(Jev) |
|---|---|---|
| 優化目標 | 人類偏好 / 可驗證獎勵 | 校準後嘅決策概率 |
| 輸入側重 | 順序訊息(對話) | 結構化程式狀態 |
| 輸出 | 字串,需解析與校驗 | 事先定義嘅類型化結構 |
| 取樣方式 | 順序,逐 token | 並行,單次查詢出全部結果 |
| 延遲 | 端到端 3–329 秒 | 70–500 毫秒 |
| 價格 | 輸入 0.2–10 美元/百萬 token,輸出約為輸入嘅 5 倍 | 輸入 0.042 美元/百萬 token,輸出免費 |
| 置信度 | 口頭估計,經常過度自信 | 每條輸出都帶校準概率 |
命名亦值得一記:模型類名借自丹尼爾·卡尼曼「快思考與慢思考」嘅系統一,模型名 Jev 取自 19 世紀經濟學家傑文斯——蒸汽機效率提升冇減少煤炭消耗,反而推高咗總需求。TypeSafe 嘅推論係:單位智能嘅成本每跌一個數量級,被解鎖嘅用例就多一個數量級。
三、真實數字,以及官方自己承認嘅局限
先睇可以交叉驗證嘅部分。Vercel CEO Guillermo Rauch 畀出嘅獨立口徑係:喺軟件命令安全審查任務上,Jev 喺第 95 百分位上比 GPT 級模型快最多 18 倍,準確率更高——Vercel 正用佢替換原本喺生產環境跑安全審查嘅 GPT-5.6-Luna。Vercel 嘅數據亦顯示,上線第 24 小時 Jev 已覆蓋近 13% 付費團隊,係此前任何模型首發速度嘅兩倍以上。Forbes 報道則稱,計入真實生產用量之後,降本幅度接近 100 倍,而唔係 TypeSafe 自己宣稱嘅 400 倍以上。
再睇官方嘅自我披露——呢部分我認為比任何營銷數字都更有資訊量。TypeSafe 喺博客入面逐條標注咗自己結論嘅邊界:
- 193.6 倍更快、444.6 倍更便宜,來自自家嘅 workflow evals,而且工作流由自家能力團隊編寫,官方承認「可能存在偏差」;
- 評測嘅參考答案係 GPT-6 Astra 同 Fable 5.1 嘅平均值,官方承認呢個做法偏向 OpenAI 同 Anthropic 嘅模型,「很可能低估咗我哋自己同 DeepSeek 嘅相對表現」;
- 價格有無補貼無法自證,需要用長期營運去驗證;
- 「0% 幻覺」係 schema 匹配嘅數學保證,唔係經驗數據;
- 對比 LLM 嘅幻覺率來自 OpenRouter 嘅路由統計,存在「複雜查詢畀路由到更強模型」嘅選擇偏差。
社區嘅側寫亦指向同一個方向:Bryo AI 嘅 CTO 反饋係 Gemini 略準少少但貴 10–20 倍;Browser Use 用 Jev 跑蘇黎世去倫敦嘅航班檢索用咗 7.1 秒。
將呢啲放埋一齊,我嘅判斷係:Jev 並唔解決「答得對唔對」,佢解決嘅係「錯咗會唔會以不可控嘅方式錯」。對實驗室嚟講,準確率係主線;對生產系統嚟講,可控性往往比準確率更致命——一個埋喺三層依賴入面嘅類型錯誤,代價遠大於一次答得唔夠聰明。
四、48 小時內嘅開源答案:護城河喺邊
Jev 係閉源 API,冇權重、冇參數量、唔可以自部署。但呢套方法畀人複現嘅速度快得驚人。
Bespoke Labs 喺兩日內用 Qwen3.5-9B 做 LoRA 微調,只用咗 2,676 條合成樣本,就交出 Bespoke Nimble:喺自家 324 條留出測試樣本上,基座 Qwen 66.36%,參數三倍於佢嘅 Qwen3.8-27B 84.88%,Nimble 90.12%,Jev 93.21%。佢哋嘅關鍵手法叫對比式數據策展——將樣本入面一個關鍵事實輕微改寫,令正確答案翻轉,逼模型學識分辨真正決定結果嘅證據;冇用概率標注,亦冇蒸餾 Jev(Jev 只用於評測)。H100 上約 106 毫秒延遲,權重同配方以 Apache 2.0 開源。
Jared Palmer 嘅 Kev 走另一個極端:基於 Qwen2.5-0.5B,只訓練 9.3M 參數,MacBook 上 1 小時 45 分跑完,提供 0.5B 到 8B 四種規格。代價係域外表現下滑——kev-4b 域外得分 0.79、kev-8b 0.80,Jev 係 0.86,差距主要集中在知識密集任務(MMLU 0.69–0.75 對 0.90)同日期計算上。此外仲有將普通 Hugging Face 模型改造成類型化決策服務嘅 Simple Jev。
三日追到 3 個百分點,說明「方法」本身唔難複現;難複現嘅係介面約定、校準質素同網關生態。對使用方嚟講呢個係好消息:決策模型會好似數據庫咁商品化,而真正稀缺嘅仍然係「邊啲判斷值得自動化」呢件事嘅判斷力。
五、畀做 Agent 嘅人:將決策層同生成層拆開
呢類模型最直接嘅價值,係將 Agent 嘅成本結構分成兩層:面向人嘅生成層(寫、講、總結)繼續用大模型,而喺佢背後高頻發生嘅判斷層(路由、分類、打分、驗偽、護欄)換成專門嘅決策模型。一個客服 Agent 喺講出一句說話之前,可能已經做咗十幾次分類判斷——呢啲調用唔會出現喺任何一張帳單嘅顯眼位置,但按大模型嘅單價計費。
落地時三個經驗值得先記住。其一,將置信度當閾值用,而閾值應該隨錯誤代價調整:路由錯一次冇所謂,放行一次付款操作就唔可以接受。其二,唔好將知識密集嘅判斷題交畀細決策模型,Kev 喺 MMLU 上嘅下滑已經畫出咗邊界。其三,留意評測口徑——目前冇統一嘅決策模型基準,各家數字都來自自家留出集,Bespoke 自己都承認換一套指標相對表現可能唔同。
呢波討論入面,模型換代同數據底座嘅關係亦值得一併回看:我哋喺模型疲勞時代嘅企業 AI 底座入面討論過底座抗迭代嘅設計,喺介面層戰爭入面討論過點解上下文比模型更稀缺。Jev 提供咗一個新註腳:當「判斷」便宜到可以忽略不計,值得重估嘅唔係模型排行榜,而係你嘅工作流入面有幾多判斷根本唔需要語言能力,卻畀寫成咗提示詞。