Jev · 决策模型 · 底层原理

爆火的 Jev:一个不说话的 AI,凭什么快 200 倍、便宜 400 倍?

它不聊天、不写代码、不回答"1+1 等于几",只干一件事:做判断。发布一周刷屏硅谷的 Jev,把"判断"从"生成"的架构里拆了出来

2026-09-20底层原理 · 深度科普约 15 分钟

00引言:一个"哑巴"AI,凭什么让硅谷吵翻了天?

热度超过 GPT 和 Claude 的日常更新,连 Gemini 4 Pro 的疑云都被它挤到一边。

2026 年 9 月 15 日,一家叫 TypeSafe AI 的公司发了款模型,叫 Jev。几天之内,它成了硅谷讨论度最高的 AI。

热度有数字为证。发布推文的浏览量超过 3000 万,点赞 6 万多。另一位开发者做的 45 秒解说视频,播放破了百万。Hacker News 榜首,评论区一天攒下几百条,一半人在兴奋,另一半人在拆台。发布当天,官方 API 一度被挤到瘫痪。坐拥 38 万粉丝的开发者博主 ThePrimeagen 说,想马上把它接进自己的服务器自动化工具。

但你要是真去用它,会发现一件怪事。

它不能聊天。不能写代码,不能生成图片。你问它"1+1 等于几",它不回答。任何让它"说点什么"的请求,一律拒绝。

一个连话都不说的 AI,凭什么让整个硅谷上头?

答案藏在它唯一会干的那件事里:做判断。这篇文章就把这件事拆开讲清楚——它是什么,凭什么快,凭什么可靠,边界在哪,以及为什么偏偏是现在。

01Jev 是什么:不生成,只选择

大模型负责想,Jev 负责断。

先把它的工作方式讲清楚。

主流大模型是生成式的:你给一段话进去,它一个字一个字往外吐,最后拼成一篇文章。Jev 反过来。不生成,只选择。你给它一段状态——一封邮件、一段日志、一局游戏的局面——再配一份预先定义好的问题清单,它直接返回答案,附一个校准过的概率。

来回就三种活:

操作干什么返回什么
Choice从你给的选项里挑一个选中项 + 概率
Score给某个东西打分分数 + 置信度
Noul回答是非题是 / 否 + 概率

没有第四种。想让它写篇文案?直接拒绝。

官方管这叫 System One 模型。名字取自心理学家卡尼曼的《思考,快与慢》:人脑有两套系统,System Two 慢、深思、耗能,负责复杂推理;System One 快、直觉、廉价,负责"要不要踩刹车"这类瞬间判断。现在的大语言模型全是 System Two——你让它答一道选择题,它也要把心路历程完整吟诵一遍。Jev 是第一个专门做 System One 的商用模型。

一句话定位:大模型负责想,Jev 负责断。

02让大模型答是非题,到底浪费在哪?

拿一个老学究当开关用,不是不行,是不划算。

有人会问:判断这件事,GPT 和 Claude 也能干,为什么需要专门一个模型?

还原一个后端工程师都经历过的场景。

用户刚提交一笔订单。系统要判断:这单是本人下的,还是盗刷?答案就两个选项,是,或者否。

以前的做法,是把订单信息打包,扔给一个上千亿参数的大模型,让它在 prompt 的叮嘱下把答案"吐"出来。你得写满两页纸:只输出 JSON,不要废话,不要解释。它大部分时候听话。偶尔一次抽风,在 JSON 前面多吐了半句"好的,以下是判断结果",解析代码就崩了,进程跟着挂。

问题出在哪?出在"生成"这个动作本身。

大模型的原理是自回归,四个字:单字接龙。吐第一个字之前,要把整段输入读完;吐完这个字,再回头看清全部历史,决定下一个字。你看到的流式输出,背后是几百次这样的循环。哪怕最终答案就一个"是"字,它也要走完一遍完整的接龙。

三重浪费由此而来。算力浪费:为一个二选一的答案,动用了能写程序、解微积分的完整大脑。延迟浪费:几百次接龙串行执行,首字延迟动辄数秒。计费浪费:推理按 token 收费,为一个"是"字,付了整段解释的钱。

这种错配以前没人较真。市场上钱多、token 多,拿老学究当开关用,账面上看不出来。直到有人把账算清了。

03快 200 倍、便宜 400 倍,原理是什么?

两刀:砍掉生成,砍掉串行。

Jev 的解法,是从架构上绕开接龙。

第一刀,砍掉生成。它的输出空间不再是"整本字典里的所有词",而是你预先定义好的那几个选项。一道三选一的题,输出就只有三个格子。模型不需要"想说什么",只需要"选哪个"。

第二刀,砍掉串行。所有问题并行评估。你一次抛给它五十个问题——这封邮件是不是退款请求?该分给销售还是客服?要不要升级人工?——不排队,一起算,一次返回。没有逐字推演那一步。

数字直接体现差距:

指标Jev前沿大模型
端到端延迟70–500 毫秒数秒起步
响应速度官方称快 40–200 倍基准
输入价格$0.042 / 百万 token高一至两个数量级
输出价格免费按生成 token 计费
单次决策成本约 $0.0004——
延迟为官方给出的端到端区间,独立实测的中位数在 300 毫秒上下;速度倍数随任务类型浮动,分类、路由类任务差距最大。

什么概念?每秒做十次判断的场景,它能实时撑住。TypeSafe 自己拿它打《DOOM》:第一人称射击,转角遇到敌人,转向、开枪、绕障,一气呵成。背后是每秒约 10 次的即时决策,整套推理成本一小时 7 美元左右,不到 50 块人民币。

这不是游戏特化版本,就是个通用 Jev。团队做的全部工作,是写程序把角色位置、附近敌人的情况整理成文字和数据喂进去。枪战游戏里"深度思考"一秒,人就没了。Jev 不思考,它反应。

04它凭什么"没法撒谎"?

格式锁定,置信度校准。但保证的是格式,不是内容对错。

快和便宜之外,让开发者真正上头的是第三点:它没法撒谎。

准确说,是没法格式出错。

生成式模型的输出是自由文本,理论上什么都吐得出来。所以工程师要写一堆解析、重试、兜底逻辑,防它突然在 JSON 里夹一句寒暄。Jev 的输出被预设格式死死锁住:你告诉它只有三个选项,它就只可能吐这三个。格式错误在结构上发生不了。公司名里的 TypeSafe,说的就是这个。

训练方法也换了一套。主流大模型用 RLHF:人类给两个回答排序,模型学着迎合人的偏好。Jev 用 RLCD——可校准决策的强化学习:模型同时输出答案和置信度,训练目标之一就是让这个置信度可信。它说八成把握的时候,长期看真的大约八成是对的。

这个置信度不是装饰,是能直接进代码的量:

if confidence > 0.8:
    auto_handle()
else:
    escalate_to_human()

高置信度自动放行,低置信度升级人工。判断题的答案,第一次变成了可编程的量。

但话得说全。官方自己承认:保证的是格式,不是内容对错。它不会给你格式错误的答案,但它选错的那个选项,照样是规规矩矩、格式完美的错误答案。控制得住的叫错误,控制不住的叫事故。Jev 把"事故"的概率压到结构上的零,"错误"本身,还得靠校准和阈值来管。

05名字即宣言:杰文斯悖论

机器越省煤,国家烧的煤越多。

回头看它的名字。Jev,三个字母,藏着一整套逻辑。

它来自 19 世纪的经济学家 William Stanley Jevons,中文译作杰文斯。1865 年,他写了本书,《煤炭问题》。

书里记了个反直觉的现象。当时瓦特改良了蒸汽机,新机器烧煤效率比老机器高出一大截。按理说,机器越省煤,煤该越省着用。结果全英国的煤炭消耗量,不降反升。

为什么?煤变便宜了。便宜到以前用不起煤的行业,现在也用得起了。单台机器省下的那点煤,被爆发式增长的总用量吃得一干二净,还倒贴不少。

这就是杰文斯悖论:效率提升,成本下降,需求爆炸,总消耗不降反升。黄仁勋推销 token 的时候,反复引用的就是它。

TypeSafe 拿这个悖论给模型命名,等于发了一篇宣言:当一次判断便宜到可以忽略不计,它就会被塞进互联网和软件的每一个角落。每次页面加载、每条消息、每笔交易背后,都挂一个判断。判断会变得像电一样——无处不在,没人会为单次使用心疼。

反过来,判断不便宜,这一切都不会发生。名字就是赌注。

06教 ChatGPT 说话的人,为什么转身做"哑巴"?

最懂"开口"成本的人,做了反共识的选择。

Jev 背后的人,来头有点特别。

创始人 Diogo Almeida,前 OpenAI 研究员。不是普通的前员工:RLHF 训练流程的早期核心贡献者,2022 年那篇 InstructGPT 论文的作者之一。他参与的那套研究,后来成了 ChatGPT 的地基。

换句话说:让 AI 学会"好好说话"这件事,他是奠基者之一。然后他转身做了个哑巴。

逻辑其实是顺的。正因为亲手搭过那套训练流程,他比谁都清楚"开口"的成本:每个 token 的生成都要走一遍完整接龙;而工业界真正需要的大量判断,根本用不着把话说出来。这个错配,外人看是行业惯例,他看是每天在烧钱的漏洞。

资本也认这个判断:TypeSafe 拿到 DCVC 领投的 4000 万美元种子轮,估值约 2 亿美元,9 月 15 日正式亮相。

创业方向千万条,选"反共识"最需要底气。Almeida 的底气,来自他恰好是最懂正面共识的那个人。

07开发者已经拿它干了什么活?

全是高频、结构化、机器对机器的判断,没有一个需要"说话"。

模型发布不到一周,开发者已经把它塞进了各种角落。

最出圈的是打游戏。除了官方的《DOOM》,有人把《马里奥》的实时状态喂进去,让它判断跳不跳、走不走、前方有没有威胁。居然真能跑通,还支持中途改指令——"停下来别动",或者"全力冲分"。

工具链上,有开发者做了 jgrep,语义版 grep。你描述"找没有设置超时的网络请求",它不匹配字符串,而是对每个代码块做语义判断,真正揪出漏掉超时的地方,也不硬编不存在的内容。三次搜索,成本 0.0003 美元。

金融方向,有人拿 Noul 做买卖决策,100 毫秒内给出校准过的信号,挂到终端全自动跑。做不了真正的高频交易——人家是微秒级——但日内和模拟盘,够用。

更主流的用法,是给 Agent 当门卫。Claude Build Day 现场,有人用 Jev 当"廉价队友":每次任务先问它该唤醒哪个 Claude 模型、投多少算力,再让主力上场,单次约 0.00002 美元。有开发者一口气写了五十多个决策 schema:客服分流、线索评分、反欺诈、大模型路由。

浏览器也能用。有人让 Jev 操控浏览器查苏黎世到伦敦的航班,全程 7.1 秒:它负责从页面上的按钮、输入框里挑下一步动作;碰到要填城市名,外包给一个小语言模型代笔。一个负责选,一个负责写,分工清楚。

还有个叫 Barrunto 的插件,刷 X 时在后台检查帖子有没有故意引战、骗互动,按设置打标签、淡化或隐藏。以前骂完、回复完,才发现给钓鱼帖贡献了流量。现在让 AI 先踩一脚,眼不见为净。

用例干的活成本
打《DOOM》每秒约 10 次即时决策约 $7 / 小时
jgrep 语义搜索代码块语义判断3 次 $0.0003
Agent 路由决定唤醒哪个主力模型单次约 $0.00002
邮件分类退款识别 + 部门分流并行一次返回

这些案例的共性很清楚:全是高频、结构化、机器对机器的判断。没有一个需要"说话"。

08边界在哪?拆台的那一半说了什么?

它是 AI 原生的 if 语句。但 if 语句,从来不是程序的全部。

热闹归热闹,Hacker News 评论区拆台的那一半,提的问题也不算刁难。

第一,它不聊天、不写代码、不做长链推理。它是决策模块,不是通用助手。指望一个模型包打天下的人,可以散了。

第二,内容层面的幻觉没有消失。格式保证不等于内容正确。它在陌生领域选错的概率,官方基准说了不算,要等第三方独立评测。

第三,置信度校准过,阈值还得自己设。它告诉你八成把握,但"八成要不要自动放行"是业务决策,它不替你兜底。

第四,架构细节没完全公开。训练数据全是合成的;底层是不是基于开源权重改造,外界只能猜。已经有开发者用 2B 的小模型模仿它的接口,在 Mac 上跑起了马里奥——"判断模型"这个范式可以复制,护城河还有待验证。

冷静下来看,有人给过一个挺准的形容:Jev 是 AI 原生的 if 语句,你用传统 if-else 写不出来的模糊判断,交给它。但 if 语句,从来不是程序的全部。

09为什么偏偏是现在?

Agent 把"判断"变成了刚需。

最后一个问题:这东西要是真这么好,为什么以前没人做,偏偏现在火?

因为需求方变了。

前两年,大模型的主业是替人写东西:文案、代码、总结。一个人一天问几十次,生成几万 token,成本扛得住。

现在的主角是 Agent。一个完整的 Agent 任务拆开看,是几十个微小的决定:这一步成没成?用工具 A 还是 B?继续还是停?要不要升级人工?每个决定,以前都得唤醒一个会写十四行诗的大脑,按字数收钱。任务越复杂,浪费越夸张。Agent 越普及,"判断"就越像一个独立的、海量的、对成本和延迟极度敏感的计算需求。

需求到了,供给才有意义。Jev 出现的时间点,恰好卡在 Agent 从演示走向生产、从单次调用走向持续运行的拐点上。

再深一层,这是架构的分工趋势:生成和判断,正在拆成两层。通用大模型占住"慢思考",负责复杂推理和开放生成;专用判断模型占住"快思考",负责高频实时的结构化决策。分工之后,成本、延迟、可靠性才能各自优化——像当年 CPU 把浮点运算外包给协处理器,把图形外包给显卡。

Dan Shipper 的团队测了大约一周,他给了个预测:再过 6 到 12 个月,人们会觉得这东西不可或缺。

10收尾:从"说得好"到"断得准"

判断的生意,才刚开始。

回到开头的问题:一个不说话的 AI,凭什么火?

因为它瞄准的不是人人盯着的"对话"市场,而是水面之下更大的那块:软件世界里每时每刻发生的、亿万个无人喝彩的小判断。这些判断以前要么靠人肉规则硬写,要么靠昂贵的大模型代劳。现在有了专门的引擎。

教 ChatGPT 说话的人做了个哑巴,这个反差是故事。故事之外,真正的变化是:AI 的价值锚点,第一次从"说得好不好",挪到了"断得准不准"。

至于这个范式能走多远,不妨盯一个朴素的指标:半年之后,你常用的软件里,有多少个"如果",是它替你判断的。