不写字的AI,
凭什么火成这样?
Jev:比大模型快 200 倍、便宜 400 倍,
全程不吐一个字
由抖音 @AI研习社 的热帖引出 · 综合全网公开资料整理 · 2026.09
前两天,一个叫 Jev 的模型突然刷屏。它不会陪聊,不会写作文,连一句完整的话都说不利索——但整个硅谷都为它上了头。
官方给的数据更吓人:做分类决策,它最快比前沿大模型快 193.6 倍,价格最低只要人家的约 四百分之一,输出 token 直接永久免费。
一个"哑巴 AI",凭什么火成这样?吹捧和质疑各占几分?这篇一次说清。
(先说清楚:本喵没抢到内测名额,所有数字都是官方口径与公开报道交叉核对的结果,逐处标了出处。)
它不生产文字,只负责拍板
Jev 背后的公司叫 TypeSafe AI,创始人 Diogo Almeida 来头不小:前 OpenAI 研究员、ChatGPT 联合发明人之一、RLHF 的核心贡献者。
他这次干的事相当反常识——把大模型最引以为傲的"能说会道"整个砍了。
Jev 不生成任何文字。你丢给它一段状态(一封邮件、一段代码、一条用户消息),再给它一组设好选项的问题,它几百毫秒内把所有答案一次性并行算完,每个答案都附带一个校准过的概率。
官方管这叫 System One 模型,概念借自《思考,快与慢》:系统一是"不过脑子"的直觉快判断,系统二是慢慢推演的深思。以前的大模型全在模拟系统二,Jev 是第一个专职做系统一的。
Noul / 是·否
问:这条消息是不是退款申请?
Jev 答:是 92% / 否 8%
Choice / 选项题
问:这封邮件该转给哪个团队?
Jev 答:账单 78% / 技术 15% / 销售 7%
Score / 打个分
问:这个用户现在有多生气?
Jev 答:愤怒指数 3.7 / 10
官方文档口径:Noul 返回 0–1 的概率;Choice 最多支持 255 个选项,附每个选项的概率与总置信度;Score 在 2–10 级量表上打分,可以落在两级之间(比如 1.4),不必硬贴到最近的一级。
快 200 倍,不是省出来的,是架构决定的
一个字一个字往外挤
每个新字都要等前面所有字生成完,串行流水线,越写越慢、越写越贵,生成的字还可能越长越跑偏。
逐 token 自回归生成
所有答案同时并行算
没有顺序依赖,一次吃满硬件并行能力。输出又只是一堆概率值,小到官方直接说"便宜到不值得计费"。
并行采样,一次性全给完
训练方式也换了:RLCD 取代 RLHF
以前 RLHF 奖励"人类看着爽",代价是模型学得过度自信——嘴上说八分把握,实际水分很大。Jev 改用 RLCD,奖励"报的概率和实际命中率咬合":它说 90% 有把握,长期看就得真有九成是对的。
数字有多夸张,就有多值得追问
官方自己那份评测里,还藏着一列"准确率"
同一批工作流里,Jev 与对照模型的准确率、每例成本、单例耗时(官方口径):
| 模型 | 准确率 | 每例成本 | 单例耗时 |
|---|---|---|---|
| Jev | 67.8% | $0.0004 | 0.4 秒 |
| GPT-5.6 Terra | 67.9% | $0.0304 | 10.1 秒 |
| Claude Opus 5 | 73.1% | $0.1761 | 37.8 秒 |
口径:TypeSafe 官方四个工作流评测(安全事件响应 / Agent 轨迹观测 / 发票处理 / 客服)的平均值,准确率=与"参考答案"(GPT-6 Astra 与 Fable 5.1 输出的平均)的一致率,未经独立复跑。
这张表比"快 200 倍"更值得看:速度与成本确实领先两个数量级,但"智能"只是跟中档模型打平——它不是更聪明,是更便宜。省下的是钱和时间,不是替你去做更难的判断。
定价:输出不要钱,输入白菜价
注:以上均为 TypeSafe 官方口径。第三方独立验证目前很少,到底掺了多少水分,见下方"争议"部分。
已经有人拿它干正事了
打《毁灭战士》
让 Jev 实时读游戏状态,每秒做 10 次决策控制角色走位和射击,连跑一小时成本约 7 美元。
换掉旧引擎
Vercel 用 Jev 替换 Gemini 2.5 Flash 做分类,速度提升 6 倍,准确率评测直接拉满。
批量审 PR
一次约 7/10000 美元,审 1000 个 PR 才花 7 美分;同样的活交给 Opus 5 得烧 14.5 美元。
给论文分类
1000 多篇 AI 论文按主题归档,每篇 256 毫秒,总成本 8 美分。
接入方的具名反馈:卖点被复现了,短板也被复现了
- Vercel 工程师 Pranit Sharma:把命令安全审查分类器从 OpenAI Luna 5.6 换成 Jev,速度快 5–18 倍,准确率还更高。
- Bryo AI 首席技术官 Nikhil Mudholkar:拿 Gemini 做商业邮件分类对照,Gemini 准确率略高,但成本贵 10–20 倍;他真正看重的是"Jev 是唯一一个给出真实概率的"。
- Earendil 首席技术官 Armin Ronacher(开源框架 Pi):拿它做模型路由和护栏,同时点出一个前提——Jev 把"怎么解读置信度"的责任交回给使用者:50% 就该当抛硬币,到了 95% 才敢自动执行。
以上为开发者公开发言,不是公司级正式案例;TypeSafe 至今没有公布具名企业客户和收入。
先看它好在哪里
快
毫秒级响应,高频、实时、要卡延迟的场景撑得住。
便宜
输出免费、输入白菜价,成本低到可以当"基础设施"随便用。
类型安全,编不出花
答案永远落在你预设的选项里,不会幻觉出 schema 之外的字段。
置信度能信
概率经过校准,说 90% 基本就是 90%,不像大模型那样盲目自信。
好集成、可组合
判断拆成小问题并行问,几行代码接进业务,还能拼成决策流水线。
再看它不行在哪里
只会"选",不会"写"
凡是需要生成文字的场合,它完全用不上。
推理能力一般
需要一步步推导的数学问题,水平大约停在 GPT-4 那一档。
原生看不了图
不支持图像输入,很多场景直接出局(谷歌的复刻版补上了这个能力)。
选项之外的世界看不见
判断上限取决于你怎么定义选项,问题没设计好等于白问。
中国大陆暂不可用
还处于邀请制内测,官方明说服务目前架在美国西海岸(连自家评测都是在西海岸的笔记本上跑的),大陆访问不方便,想上手得等名额或走开源复刻。
热闹背后,质疑也不少
成绩是自己人测的
官方公布的提速、降价数据,用的是自家团队写的 workflow 评测,参考答案是"别家模型的输出"(GPT-6 Astra 和 Fable 5.1 的平均),不是标准答案;公开 benchmark 成绩一直没跑。
第三方实测很拉胯
有人拿 10,984 条真实 A/B 数据去测,判断正确率只有 64.5%;换成没有真实差异的对照组,成绩直接掉回随机水平。
"零幻觉"被指偷换概念
它只是没法输出选项之外的东西,对输入的理解照样可能出错。RLCD 的训练细节、奖励函数、校准指标也都没公开。
商业故事还没闭环
至今是小范围内测,没有具名客户,也没披露收入;定价低到像拿了 4000 万美元融资在打价格战。
"新范式"还是"旧瓶子"?
Reddit 有人调侃"行业重新发明了分类模型",也有人拆穿它本质是"高质量小模型 + 分类排序 + 约束输出 + 校准"的漂亮包装。反驳的一方则认为:通用分类器不稀奇,但语义理解达到 LLM 水平、又快又便宜到这个程度的,确实是头一回。
谁是第一个?
开发者 Nandakishor M 称自己 2025 年 3 月就发布过类似概念(arXiv 上有论文为证),Jev 并非首创。这类"谁先做出来"的扯皮,在 AI 圈向来难有结论。
最认真的一次第三方实测:速度和成本站住了,准确率低一档
科技媒体 Every 的 Mike Taylor 做了目前唯一一份像样的独立测试:把 37 篇文档(27 篇真文章 + 10 篇故意写成 AI 腔的对照件)拿 21 个问题去问,777 次判断 0.7 秒内跑完,成本约四分之一美分。在更小的 12 段对照里,Jev 抓出了 7 个人为植入的行文缺陷中的 6 个,而对照的 Claude Fable 5.1 全抓到了——快约 25 倍、便宜约 580 倍,代价是漏了一个。Every 自己的结论是:速度和成本撑得住,但"上生产之前,我还想要一次彻底得多的准确率检查"。
它到底是不是新东西?
事实一:Jev 的官方用例,就是路由 / 门闸 / 排序
翻 TypeSafe 自己的文档和各家接入方的教程,Jev 的招牌场景就四类:意图路由(这条消息走哪个流程)、模型路由(这活儿派给便宜小模型还是贵的大模型)、置信度门闸(把握不够就打回人工)、候选排序(结果按相关性打分)。Flavio Copes 的深度拆解直接点破:早期实验最扎堆的用法就是 intent routing——让 Jev 当"便宜的快速分类器"决定谁来处理。LangChain 官方教程则直接把它做成 model-routing middleware(模型路由中间件)。
再看它支持的三种问题:Noul(是/否)就是二分类,Choice(从选项里挑)就是多分类,Score(打分)就是回归——全是机器学习教科书最底层的东西。
事实二:路由 / 门闸这套,大模型内部早就有
混合专家模型(MoE)靠 gate 网络把每个 token 路由到不同专家;条件深度路由(arXiv 上到现在还有论文在调 MLP gate 的辅助损失)用门控决定模型要不要提前退出;约束解码、分类头让模型只能输出预设集合里的答案;检索系统里的向量排序和重排模型,也都是同一个逻辑。
Jev 没有发明"给有限选项打分"这件事。它做的是把这件事从大模型内部拆出来,单独做成一个产品——拆的这一步是新的,零件全是旧的。
事实三:这套路,独立研究里更早就跑通了
在 g-CAT.cn 公开的论文与工程里,能找到几乎同构的对照:
- Cerebella 小脑引擎(2026 年 4–6 月,本地运行):内置"管家模型(路由脑)",用 0.5B 小模型做意图分类 + 指令压缩,输出契约就是 {"intent": "CHAT/WORK", "summary": "…"},CPU 零显存跑,还实现了 ClawRouter 和 route_intent()——功能上就是 Jev 的 intent routing 用例,但完全本地、免费、数据不出机。
- L4 Noah 认知架构:主张把记忆、推理、路由、技能从大模型的参数空间里解耦,大脑-小脑分工,小脑管快速自动反应——正是 Jev 口中"System One"干的活,而且覆盖范围更完整。
- 小脑发展理论 / 双系统论文:从神经科学论证"推理与记忆必须分离",多脑协作、技能内化、分级记忆——把"快判断"当作整个认知架构里的一个零件,而不是一个新范式。
以上为其公开论文与仓库中可核查的内容,见 g-CAT.cn 论文合集(Zenodo 存档)。
公道话:它也没那么一无是处
- ① 校准置信度:让概率"说 90% 就是 90%",这是经典路由器普遍缺的一环(虽然 RLCD 细节没公开、第三方实测也存疑,方向是对的);
- ② 并行采样把延迟压到毫秒级,配合"输出免费",确实把决策成本打到了可以随便调用的量级;
- ③ 参数量未公开,"只是个小模型"目前是推测不是实锤——它宣称的是"前沿级语义理解 + 受限输出",0.5B 的路由脑确实读不懂复杂的 PR 和客诉;
- ④ 工程生态是真的:Vercel、Cloudflare、LangChain 肯接入,说明"决策中间件"这层有真实需求,不是纯 PPT。
- ⑤ 第三方证据也不再是零:Every 的独立测试确认了速度与成本优势(约快 25 倍、便宜约 580 倍),只是准确率比前沿低一档——这比纯营销数字可信得多。
关于"蜂群":这个预测,正在发生
顺着"快判断"的叙事继续滚,下一步大概率就是吹"足够多的便宜判断单元并行,构成更强的整体智能"——开源侧已经有人先动手了:谷歌 6 月放出的文本扩散模型 DiffusionGemma,被 vLLM 的贡献者改成了"家里的开源 Jev",早期实测两者准确率大致打平,一台 DGX Spark 就能跑。而"多单元协作"这套逻辑,在 g-CAT.cn 的论文里(多脑协作、类脑脉冲网络)早就写过了。说白了:这不是新吹法,是"把决策拆成小单元"这个方向的必然延伸。
中立结论
功能层面,"它就是路由 / 门闸 / 分类器换了个马甲"这个判断,证据是站得住的——它所有招牌场景都能在经典 ML 和 LLM 内部机制里找到原型。但"新不新"和"有没有用"是两回事:就算全是旧零件,把决策从生成里拆出来、做成毫秒级免费 API,这件事本身确实在改变 Agent 的搭法。它到底值不值这个热度,等公开 benchmark 和具名客户出来再定论,不迟。
把"革命"的外衣扒下来:话术、换皮、以及它为什么非火不可
话术拆解:每一个营销词,背后都有一个旧概念
把 Jev 发布会上的关键词逐个拆开,对照它底层的真实技术,你会发现"新"字基本都长在包装上:
"System One 模型"——新物种?还是概念税?
借卡尼曼《思考,快与慢》的"系统一/系统二"给分类器套了个哲学外壳。系统一就是"不过脑子的快判断",这在认知科学里是老得不能再老的概念;把它安到一个给选项打分的模型头上,属于典型的借用学术词汇提升身价。
"零幻觉"——不是不会错,是只能在选项里错
"零幻觉"被指偷换概念,核心就在这:它只是把输出空间锁死在你预设的选项里,编不出选项之外的东西;但它对输入的理解照样可能错,判断照样可能偏。约束解码、分类头这些技术早就存在,"不会编造字段"不等于"判断是对的"。
"输出 token 永久免费"——不是慈善,是定价策略
输出就是几个概率值,本来就没几个 token,免费的成本极低。真正的效果是:"永久免费"四个字自带传播力,还能在竞争白热化的市场里当价格战武器——背后是刚融的 4000 万美元在撑。这是商业策略,不是技术奇迹。
"快 193.6 倍、便宜 444.6 倍"——怎么测的,比数字本身更重要
这是自家团队写的评测、自己选的任务,对比对象是市面上最贵的那一档(GPT-6 Astra、Fable 5.1 输出每百万 token 50 美元),参考答案用的还是别家模型的输出。拿最贵的当参照物,倍数当然吓人。换一个基准,数字立马缩水——Vercel 换掉 Gemini 2.5 Flash 只"快 6 倍",这才是同档次对比的真实水平。
"新范式"——产品形态的包装,不是架构革命
参数量没公开、训练细节没公开、公开 benchmark 没跑、具名客户没有、RLCD 细节没公开。能拿出来的"新",只有产品形态(把决策做成 API)和生态接入。产品创新值得肯定,但把它说成"AI 时代最重要的模型",是典型的叙事溢价。
换皮史:这不是第一次,RAG 就是这么火起来的
Jev 的套路,在 AI 圈早有先例,最典型的就是 RAG(检索增强生成)。拆开看:
1970 年代就有
知识库 / Wiki / 索引
正式定名 RAG
检索 + 生成
"范式革命"
每个大厂必讲
开发者一起涌入
人人都在做
Jev 走的是同一条流水线:
机器学习教科书
最底层的东西
决策模型"
卡尼曼概念税
"决策成本趋零"
"新范式"
3 天接入三大平台
全网围观
模式完全一致:旧零件 + 新名词 + 大叙事 = 热点。学会这一条"拆词法",再看到任何"革命性 AI",先问一句:它的零件,是不是早就存在?
过度包装 vs 实际应用:差距到底有多大
宣传里说的
- "AI 自动化的大爆发即将到来"
- "Jev 是 AI 时代最重要的模型"
- "决策成本趋近于零,智能会像大爆炸一样扩散"
- "零幻觉、数学级类型安全保证"
现实中能确认的
- 一个路由 / 分类 / 门闸 API,解决的是意图分发这类具体问题
- 第三方拿 10,984 条真实 A/B 数据实测,判断正确率只有 64.5%
- 无公开 benchmark、无具名客户、无收入披露,小范围邀请制内测
- "零幻觉"只是输出受限,理解照样会错(争议 03 已详述)
说句公道话:需求是真的——Agent 系统确实需要又快又便宜的路由判断,Vercel、Cloudflare、LangChain 的接入也是真的。但"真实需求"和"革命叙事"是两码事:前者值得用,后者需要打问号。
泡沫与杠杆:为什么它"非火不可"
要理解 Jev 为什么被推到风口浪尖,得看它爆火时整个市场处在什么状态。2026 年的 AI 资本市场,正处在一场没有定论的"泡沫之辩"里:
泡沫派担心的
- OpenAI、Anthropic 两家估值合计超 1.8 万亿美元,年化收入合计约 700 亿美元——20–25 倍市销率,明显高于微软、谷歌(约 10 倍)
- 高盛分析师警告:半导体和 AI 领域积聚了过高的金融杠杆,流行的 2 倍、3 倍杠杆半导体 ETF 的强制再平衡机制,可能把 3% 的正常回调放大成 10% 以上的剧烈抛售
- 英国《金融时报》报道:OpenAI 预计 2026–2030 年自由现金流为 负 2780 亿美元;甲骨文约 180 亿美元贷款承压
- 《大空头》原型史蒂夫·艾斯曼警告:任何一家巨头削减 AI 资本开支,美股都可能出现"直线下跌"级别调整
反驳派认为的
- 标普信息技术行业前向市盈率约 21 倍,明显低于 2000 年互联网泡沫时期约 55 倍
- 北美五大云厂商负债权益比约 43%,远低于互联网泡沫时期的约 124%,投资主要由企业自身现金流支持,并未形成全行业依赖高杠杆扩张的局面
- AI 盈利确实在增长,估值扩张有部分基本面支撑
泡沫与否,专家还在吵,我不下结论。但有一个事实很清晰:AI 叙事已经和资本市场深度绑定。在高估值、高杠杆、"谁都怕炸"的环境里,市场需要源源不断的新故事来维持信心——世界模型、Agent、具身智能、System One……"新概念制造机"必须一直转下去。搞不出真正的新东西时,最快的办法就是把老东西重新包装。Jev 的爆火,恰好踩在这个节骨眼上:一个分类器,被包装成新范式,再由资本和媒体接力放大成全球热点。
下次再看到"爆火 AI",先过这十关
先拆词:这概念是不是老东西的新名字?
检索 + 生成 = RAG;分类 + 路由 = System One。把新名词拆成零件,看每个零件是不是教科书里早就有的。
再问数字:谁测的?跟谁比?
"快 200 倍"这类数字,永远要问:评测是谁写的?任务是谁选的?对比对象是不是挑了最贵的那个?自己人测 + 挑对手 = 营销数字。
三看公开性:benchmark 敢不敢公开?
不跑公开 benchmark、只发自家评测的,先降一档信任。公开、可复现、有第三方验证的,才值得认真对待。
四看客户:有没有具名用户和收入?
"小范围邀请制""内测中""不便披露"听着神秘,实际上可能只是还没有拿得出手的成绩。具名客户 + 收入披露 = 真在落地。
五看开源:能不能本地跑、自己验?
开源可复现的(比如社区用 Gemma 系模型做的复刻、各种本地小模型),可以自己上手验真伪;纯闭源 API 只能听厂商说。能验证的比不能验证的可信。
六看细节:训练方法、参数量、评测方法公不公开?
RLCD 细节没公开、参数量没公开、评测方法自家写——三样占全,等于让你盲人摸象。
七记定价:免费/白菜价可能是获客策略
"输出永久免费"背后可能是融资烧钱、价格战、抢生态位。便宜是好事,但别把商业策略当技术慈善。
八记链条:热点新闻 ≠ 技术突破
36 小时 14 万开发者、全网 2400 万围观——这些是传播数据,不是技术验证。融资新闻 ≠ 产品验证,概念新颖 ≠ 能力革命。
九找历史:同一套话术,过去出现过几次?
RAG 这么吹过、Agent 这么吹过、世界模型也这么吹过。见到"旧瓶新酒"的流水线再次启动,心里就该有数。
十守心态:别被"革命""范式""颠覆"吓住
真正的变革通常安静地出现:可复现、可审计、有用户、有收入。越是喧嚣的,越要冷静。把神话拆成零件,就没人能忽悠你。
官方没开源,但复刻已经来了
browser-use/jev-ultrafast:把"判断"和"打字"拆开的那套玩法
Browser Use 的联合创始人 Gregor Žunič 做了最出圈的开源示范:把网页读成一张带编号的元素表,让 Jev 每步只干一件事——从固定动作集里挑动作(点击 / 输入 / 滚动 / 等待 / 结束)和目标元素;只有真要生成文本"打字"时,才叫一次小语言模型。它在真实 Google Flights 上跑完"苏黎世→伦敦"的搜索只用了 7.1 秒(含页面加载),成本约 0.39 美分,Apache 2.0 开源,发布当天冲上 Hacker News 首页。
同类的复刻还有一长串:openjev 用开源模型跑同一套输入输出契约、jevlike 自训"从候选里挑一个"的小模型、jev-trader 拿它做链上做市……有人一口气盘点了 287 个 Jev 相关开源项目。"复刻热"本身也是这波热度的一部分,而且它证明了一件事:这套"约束输出 + 快速判断"的玩法,你用开源模型也能自己搭。
它未必是下一个大模型,但可能是个新零件
Jev 这名字取自 19 世纪经济学家杰文斯的"杰文斯悖论":蒸汽机效率越高,烧掉的煤反而越多。Almeida 的赌注是——当 AI 决策的成本趋近于零、快到可以随便调用时,开发者对"智能判断"的需求会像大爆炸一样扩散到每一行代码。
看热闹可以,被忽悠不行——记住这十个字:拆词、问数、查源、找历史、守心态。