找工位
空间入驻
小程序

AI圈新宠Jev爆火:40秒分析724条广告,成本仅9美分

2026-09-21 05:02:08

最近AI圈又冒出一个新名字:Jev

短短几天,它在X、GitHub和Agent开发者社区迅速刷屏!相关推文已有3700万人围观。有人拿它40秒分析724条实时广告,有人把它接进Claude Code清理上下文,连LangChain和OpenAI的Tibo都下场关注。

这个Jev,到底是什么来头?

🎯 Jev到底是啥?一句话:AI界的「智能if语句」

它不做生成,只做判断

简单来说,Jev是一种专门处理「判断题」的AI

9月15日,TypeSafe AI正式发布Jev,把这类模型称为「System One Models」。它接收一段程序状态或文本信息,快速返回结构化判断结果以及对应概率。

举个例子!假设客服系统收到一封邮件,开发者可以让Jev同时判断:这是销售线索吗?用户情绪是否激烈?是否需要人工介入?属于账单、技术还是销售问题?

Jev返回的可能是一组概率:销售线索0.91,需要人工介入0.12,技术问题0.83。应用程序立刻根据这些数字进入下一步流程。

💡 三种判断形式,覆盖高频决策

目前Jev提供三类核心判断形式:Noul负责Yes/No类型判断,Choice从给定选项中选择答案,Score根据预设标准进行评分。

每个结果都会附带概率或置信度,多道问题还可以围绕同一份输入同时进行判断。这套设计让Jev很快找到了一个爆发式增长的应用场景——给Agent当「裁判」

⚠️ 为什么Agent开发者集体上头?

Agent的痛点:谁来验收任务?

今天的AI Agent经常需要连续完成几十甚至几百个步骤!写代码、调用工具、搜索网页、修改文件之后,系统还需要判断任务是否已经完成。

这类问题恰好符合Jev的工作方式。开发者可以把Agent的执行记录交给Jev,然后询问:目标是否完成?结果是否符合要求?是否存在遗漏?当前结果质量属于哪个等级?

LangChain在9月20日发布了一项Jev-as-a-Judge实验。他们让Jev、GPT-5.6 Luna、GPT-5.6 Terra和Claude Sonnet 4.6对固定的Agent输出反复评分。

在这组小规模实验中,Jev平均每次调用耗时约0.44秒,成本约0.00035美元,在连续评分的一致性上表现突出。LangChain也强调,这仍属于早期小规模测试,后续还需要在更多真实生产任务中验证。

🌟 出圈名场面:40秒处理724条广告

Jev在广告分析上的一组数据,让它进一步出圈!

开发者Matthew Berman分享了一次实验:系统使用Jev分析了来自37个品牌的724条实时广告,对Hook、形式、Offer、CTA、用户认知阶段以及广告与落地页的一致性进行分类,总共产生8724次判断

根据公布的数据,这批任务大约40秒完成,Token成本约9美分,每条广告的中位处理时间约216毫秒!相关案例已被收录进Jev社区案例库。

🚀 两个杀手级应用:上下文压缩与浏览器Agent

另一个传播很快的项目叫fast-jev-compaction。这个Claude Code插件把大量工具调用和终端输出交给Jev评分,由Jev判断哪些内容仍然与当前任务相关,再根据结果压缩发送给模型的上下文。项目上线后迅速获得大量关注,并出现多个移植版本。

浏览器Agent也成为Jev的热门实验场!目前已有多个开源项目采用「浏览器读取页面—生成候选动作—Jev选择动作—浏览器执行」的循环。一个公开的航班搜索Demo中,开发者报告整个搜索过程大约耗时7秒,成本约0.004美元

🔑 名字背后的野心:当判断便宜到可以「浪费」

System One + 杰文斯悖论

Jev的命名透露了TypeSafe的野心!

System One」来自Daniel Kahneman在《思考,快与慢》中提出的System 1概念,即快速、直觉式的判断系统。而「Jev」则来自经济学家William Stanley Jevons。

TypeSafe借用了「杰文斯悖论」的含义:当一种资源的使用效率大幅提高,其总体使用量反而可能迅速增长。

放在AI上,含义非常明显!当一次智能判断的价格下降几个数量级,开发者会开始在以前根本舍不得调用模型的地方加入AI。

一条日志是否重要,一封邮件属于什么类型,一个Agent是否完成任务,一条广告处于什么认知阶段——这些微小判断组合起来,可能形成下一代Agent系统里非常庞大的调用量。

📊 性能数据与理性看待

TypeSafe在自己的workflow benchmark中宣称,Jev在部分任务上最高达到约193.6倍速度提升444.6倍成本优势

不过TypeSafe同时说明,这些结果处于他们预计实际收益的高端区间,测试集也由公司模型能力团队制作,因此这些数字更适合作为技术路线的早期参考。

💭 真正的机会,藏在那些「小判断」里

Jev目前仍处于early access阶段,社区围绕它的浏览器、代码Agent、广告分析、评估器和上下文管理实验才刚刚开始。

但它已经提出了一个很有意思的问题:在未来的AI应用里,真正消耗最多智能算力的,也许会是成千上万个隐藏在软件流程中的小判断。

而Jev想成为的,正是这些「智能if语句」背后的基础设施。

金句:当判断的成本趋近于零,AI才能真正渗透进每一个微小的决策缝隙。

大家尝试Jev了吗?你觉得「专门做判断题的AI」会成为Agent时代的标配吗?欢迎评论区聊聊!

如果这篇文章让你对Jev有了新认识,别忘了点赞+分享给身边的开发者朋友!