Jev 刷屏背后:System One 模型为何不做聊天
Jev 不写一个字,只回是/否、选项与分数,却成了 Vercel AI Gateway 史上采纳最快的模型。System One 路线凭什么?技术原理、真实收益、官方自曝的局限与开源挑战者。
9 月 15 日,TypeSafe AI 放出第一个「系统一模型」(System One Model)Jev,早期访问。它不写一个字:你给它一段程序状态和若干带类型的问题,它只回选项、分数和是/否,每条答案附带 0 到 1 的校准置信度。上线 24 小时内,它成为 Vercel AI Gateway 历史上采纳最快的模型——近 13% 的付费团队接入;72 小时内 Cloudflare Workers AI、LangChain、Langfuse 全部完成对接;官方等待名单在 36 小时里清掉了 14 万人。
这件事真正的信号不是"又一个模型",而是 Agent 里那些看不见的判断调用——路由、分类、打分、验证、拦截——第一次有了专门的供应商,且比通用大模型便宜两个数量级。Jev 的作者 Diogo Almeida 是 ChatGPT 背后 RLHF 方法的研究者之一,他给这次发布的定调问题是:"模型在聊天上超越人类好几年了,自动化在哪?"
一、它到底做什么:三种问题,一个接口
Jev 的 API 只有一个端点,一个请求里包含两部分:state(一段非结构化的程序状态)和 questions(一组带类型的问题)。问题分三类:
| 问题类型 | 作用 | 返回 |
|---|---|---|
| Choice | 从候选列表里选一个 | 选中的选项 + 各项概率 + 置信度 |
| Score | 按有序等级打分 | 分值 + 各项概率 + 置信度 |
| Noul | 判断陈述是否成立(布尔) | 0–1 的概率 |
from typesafe_sdk import Choice, Noul, TypeSafeClient
client = TypeSafeClient() # 读取 TYPESAFE_API_KEY
r = client.system_one(
state=ticket,
questions={
"department": Choice(
instructions="该由哪个团队处理",
criteria={"billing": "支付问题", "technical": "故障问题"},
),
"is_urgent": Noul(instructions="该消息是否表达出紧迫性"),
},
)
print(r.answers["department"].choice, r.answers["is_urgent"].noul)
三个设计细节值得注意。第一,同一个请求里的所有问题对同一段状态并行评估,加问题几乎不增加响应时间。第二,Choice 最多支持 255 个选项,高基数选择(比如从上千个链接里挑下一步)不需要靠语言描述来绕。第三,也是最有实用价值的一点:每条答案都带置信度。
官方文档里的例子很典型——分类结果中 billing 的概率是 0.84,但置信度只有 0.596,因为 technical 仍占 0.159。文档给出的用法是三条路:高置信直接执行、中间地带人工复核、低置信转人工。它把"我知道我可能不知道"做成了返回值,而这恰恰是让软件敢于自动化的前提。
二、两个数量级的差距从哪来:并行采样 + RLCD
现有大模型的推理是顺序的:一次生成一个 token,每个 token 依赖上一个。Jev 换成并行采样——所有可能的输出在一次查询里同时采样,官方称这种方式"极其高效且对硬件友好"。
训练方法上,TypeSafe 把这一代技术命名为 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习),对标此前的 RLHF(人类反馈强化学习,优化人类偏好的回答)与 RLVR(可验证奖励强化学习,优化可程序化验证的输出)。RLCD 优化的是"认识论上诚实的概率":模型说 95%,就应当真的在 95% 的情况下正确。
放弃字符串生成换来了两个硬保证。因为输出结构和取值范围都由开发者事先定义,模型不可能产生类型错误——官方强调这是数学上不可能,可以用任何一个反例来证伪,而不是经验统计;同时因为不做自由文本生成,也就没有传统意义上的幻觉。代价同样明确:它不会写邮件、不会写文章,只会做判断。
| 维度 | 通用 LLM | System One 模型(Jev) |
|---|---|---|
| 优化目标 | 人类偏好 / 可验证奖励 | 校准后的决策概率 |
| 输入侧重 | 顺序消息(对话) | 结构化程序状态 |
| 输出 | 字符串,需解析与校验 | 预先定义的类型化结构 |
| 采样方式 | 顺序,逐 token | 并行,单次查询出全部结果 |
| 时延 | 端到端 3–329 秒 | 70–500 毫秒 |
| 价格 | 输入 0.2–10 美元/百万 token,输出约为输入的 5 倍 | 输入 0.042 美元/百万 token,输出免费 |
| 置信度 | 口头估计,常过度自信 | 每条输出都带校准概率 |
命名也值得一记:模型类名借自丹尼尔·卡尼曼"快思考与慢思考"的系统一,模型名 Jev 取自 19 世纪经济学家杰文斯——蒸汽机效率提升没有减少煤炭消耗,反而推高了总需求。TypeSafe 的推论是:单位智能的成本每下降一个数量级,被解锁的用例就多一个数量级。
三、真实数字,以及官方自己承认的局限
先看可交叉验证的部分。Vercel CEO Guillermo Rauch 给出的独立口径是:在软件命令安全审查任务上,Jev 在第 95 百分位上比 GPT 级模型快最多 18 倍,准确率更高——Vercel 正在用它替换原本在生产环境里跑安全审查的 GPT-5.6-Luna。Vercel 的数据还显示,上线第 24 小时 Jev 已覆盖近 13% 的付费团队,是此前任何模型首发速度的两倍以上。Forbes 的报道则称,计入真实生产用量后,降本幅度接近 100 倍,而不是 TypeSafe 自己宣称的 400 倍以上。
再看官方的自我披露——这一部分我认为比任何营销数字都更有信息量。TypeSafe 在博客里逐条标注了自己结论的边界:
- 193.6 倍更快、444.6 倍更便宜,来自自家的 workflow evals,且工作流由自家能力团队编写,官方承认"可能存在偏差";
- 评测的参考答案是 GPT-6 Astra 与 Fable 5.1 的平均值,官方承认这偏向 OpenAI 与 Anthropic 的模型,"很可能低估了我们自己和 DeepSeek 的相对表现";
- 价格是否被补贴无法自证,需要用长期运营来验证;
- "0% 幻觉"是 schema 匹配的数学保证,不是经验数据;
- 对比 LLM 的幻觉率来自 OpenRouter 的路由统计,存在"复杂查询被路由到更强模型"的选择偏差。
社区的侧写也在同一个方向上:Bryo AI 的 CTO 反馈是 Gemini 略准一些但贵 10–20 倍;Browser Use 用 Jev 跑苏黎世到伦敦的航班检索用了 7.1 秒。
把这些放在一起,我的判断是:Jev 并不解决"答得对不对",它解决的是"错了会不会以不可控的方式错"。对实验室,准确率是主线;对生产系统,可控性常常比准确率更要命——一个埋在三层依赖里的类型错误,代价远大于一次回答得不够聪明。
四、48 小时内的开源答案:护城河在哪
Jev 是闭源 API,没有权重、没有参数量、不能自部署。但这套方法被复现的速度快得惊人。
Bespoke Labs 在两天内用 Qwen3.5-9B 做 LoRA 微调,只用了 2,676 条合成样本,就交出了 Bespoke Nimble:在自家 324 条留出集上,基座 Qwen 66.36%,参数三倍于它的 Qwen3.8-27B 84.88%,Nimble 90.12%,Jev 93.21%。他们的关键手法叫对比式数据策展——把样本里的一个关键事实轻微改写,让正确答案翻转,逼模型学会分辨真正决定结果的证据;没有使用概率标注,也没有蒸馏 Jev(Jev 只用于评测)。H100 上约 106 毫秒延迟,权重与配方以 Apache 2.0 开源。
Jared Palmer 的 Kev 走另一个极端:基于 Qwen2.5-0.5B,只训练 9.3M 参数,MacBook 上 1 小时 45 分跑完,提供 0.5B 到 8B 四种规格。代价是域外表现下滑——kev-4b 域外得分 0.79、kev-8b 0.80,Jev 是 0.86,差距主要集中在知识密集任务(MMLU 0.69–0.75 对 0.90)和日期计算上。此外还有把普通 Hugging Face 模型改造成类型化决策服务的 Simple Jev。
三天追到 3 个百分点,说明"方法"本身不难复现;难复现的是接口约定、校准质量与网关生态。对使用方而言这是好消息:决策模型会像数据库一样商品化,而真正稀缺的仍然是"哪些判断值得自动化"这件事的判断力。
五、给做 Agent 的人:把决策层和生成层拆开
这类模型最直接的价值是把 Agent 的成本结构分成两层:面向人的生成层(写、说、总结)继续用大模型,而在其背后高频发生的判断层(路由、分类、打分、验伪、护栏)换成专门的决策模型。一个客服 Agent 在说出一句话之前,可能已经做了十几次分类判断——这些调用不出现在任何一张账单的显眼位置,却按大模型的单价计费。
落地时三个经验值得先记住。其一,把置信度当阈值用,且阈值应随错误代价调整:路由错一次无所谓,放行一次支付操作则不可接受。其二,不要把知识密集的判断题交给小决策模型,Kev 在 MMLU 上的下滑已经给出了边界。其三,留意评测口径——目前没有统一的决策模型基准,各家数字都来自自家留出集,Bespoke 自己也承认换一套指标相对表现可能不同。
这波讨论里,模型换代与数据底座的关系也值得一并回看:我们在模型疲劳时代的企业 AI 底座里讨论过底座抗迭代的设计,在接口层战争里讨论过为什么上下文比模型更稀缺。Jev 提供了一个新的注脚:当"判断"便宜到可以忽略不计,值得重估的不是模型排行榜,而是你的工作流里有多少判断根本不需要语言能力,却被写成了提示词。