

你有没有过这种崩溃时刻?花大价钱调用大模型处理业务,结果它啰嗦半天,还动不动给你格式错误。
现在,一个「不会说话」的模型,正在悄悄改写游戏规则。
就在刚刚,最近爆火的Jev宣布向所有用户开放,无需申请候补名单。所有注册用户直接白送5美元额度,约1.2亿Token!
体验🔗 console.typesafe.ai
没想到在大模型混战的9月,即便是GPT和Claude也不能稳居王座。最近风头最劲、刷屏全网的,却是不能说话的Jev。
Jev开发者Diogo Almeida是OpenAI的研究员,他参与了ChatGPT的研发,后来提出了基于人类反馈的强化学习算法RLHF。
这套方法定义了行业走向。可Almeida却越来越怀疑它:
「我们有了一次性成功的创新,但没有把它变成真正有用的东西。」
他想明白了问题:我们一直在优化人类语言处理能力,但这对自动化没用,因为计算机使用不同的「语言」。
两年前,Almeida离开OpenAI,创办TypeSafe AI。公司隐身至今,直到9月15日才亮相,带来4000万美元种子轮融资,以及第一个模型Jev。
Jev依然是基于Transformer的模型,但刻意不做大语言模型,不输出完整句子。
你给它程序状态和预先定义好的问题,它返回的是类型化答案:一个选项、一个分数,或0到1之间的概率,外加置信度。
TypeSafe把这称为「校准后的决策」。
第一种叫Choice,从你定义好的列表选一项,最多255个选项,适合路由和分类。
第二种叫Score,把输入放在你划定的尺度上打分,衡量紧迫度、质量或风险。
第三种叫Noul,本质是是非判断,答案是一个数字,代表为真的概率。
每次回答都附完整概率分布和置信度,是强类型结果,不需要写JSON提示词,不需要额外解析器,也不用担心模型突然包一层Markdown代码块。
TypeSafe公布的数字显示,Jev端到端延迟在70到500毫秒之间,比同类大语言模型快20到200倍。
按当前公开价格,输入每十亿token为42美元,换成常见口径就是每百万token 0.042美元,输出不收费。
这意味着什么?赠送的1.2亿Token,你可以放开用。
由于用户可以提前定义输出结果,模型不会产生幻觉。Jev不会跳出预设选项乱答,选项内答错依然可能。
在公开的Ably Pong演示中,Jev在12秒内做出47次操作决策,而Gemini、Claude和GPT同样时间只做两三次。
程序直接把游戏数字交给Jev:球的位置、运动方向、球拍位置。Jev从「向上、向下、保持不动」中选一个。就这么简单,却快得吓人。
想借Jev做产品,需要程序配合。游戏规则、画面和联网都不是Jev生成,它只被插进反复执行的三选一环节。
Browser Use的公开项目jev-ultrafast实现的是浏览器代理。每到一个网页,先读取可操作元素,整理成编号清单。
以查机票为例,程序每轮同时问:下一步点击、输入、选择还是等待?点击该点哪个编号?这些共用同一份网页状态,分别作答。
碰到输入城市名称时,程序另调用小模型生成文本。浏览器执行后,再读取新状态。
Vercel工程师Pranit Sharma表示,公司用ChatGPT运行分类器检查命令安全性。换成Jev后,处理速度提高5到18倍,准确性也大大提升。
另一位开发者Nikhil Mudholkar测试分类商业邮件,Gemini准确率略高,但成本高出10到20倍。
先准备一张表,每行含邮件标题、正文、时间和上下文。
再把业务拆成明确问题。比如「订单被重复扣款,希望今天处理」,用Choice判断进入售后、销售还是合作队列;用Noul判断是否要求行动;用Score判断优先级。
Earendil的CTO Armin Ronacher说:
「这种方式将幻觉问题的处理责任转移到用户身上。概率50%或许可忽略,概率95%就可以利用。」
他说Jev另一个潜在应用是模型路由,预测任务是否需要特定模型。用大语言模型做这事很贵,Jev便宜又快,能实现实时路由。
Jev取自19世纪经济学家William Stanley Jevons。他提出的悖论指出,当商品成本下降,会被越来越多使用。智力成本下降,就该导致智力广泛应用。
Almeida设想的未来不是几个庞大应用垄断一切,而是大量微小智能判断分散各处,「更像早期互联网的样子」。
TypeSafe至今没公开Jev架构,外界猜测是在开源大语言模型基础上改造。公司称其为System One Models,取自卡尼曼的直觉思维概念,强调靠直觉判断而非推理链条。
官方建议把复杂判断拆成明确问题,由代码组合,而不是一股脑让模型包办。
Almeida透露,他很早预判自己会走上处理合成数据这条路,这或许是他这辈子做过最明智的决定。
被问公司是否算前沿实验室,Almeida说:
「前沿实验室的主要产物要么是恐惧,要么是炒作。我希望我们的主要产品是智慧。」
Jev上线后需求一度超出预期,API短暂无法响应。有人用它做信息流筛选,读取三天帖子提八个问题,运行约两秒,单次成本0.007美元。
也有团队接入营销分析,扫描广告库、比较存活周期,把人工判断提速30倍,成本压到3美元以内。
AI少说了很多话,软件却多做了几件事。
当所有人都在卷「谁更会说话」时,真正的机会或许藏在「谁更会闭嘴」里。
你觉得这种「不会聊天」的模型,能颠覆现在的AI格局吗?评论区聊聊!
如果今天的内容对你有启发,别忘了点赞、在看,转发给身边关注AI的朋友!