

你有没有过这样的时刻:辛辛苦苦写完的方案,老板看了三秒就否了,理由还特别玄乎——「感觉不对」。
你追问哪里不对,他说不上来。你改了三版,他还是那句「再想想」。
最近刷屏的 JEV,号称能解决这类「说不清道不明」的判断问题。我拿它做了一轮实测,结果有点意思。
JEV 不聊天、不写文章,只做一件事:读取一段信息,给出一组判断及其概率。
听起来很复杂?其实它的原理像极了海龟汤游戏。
海龟汤里,玩家只能问封闭问题,得到的答案只有「是」或「否」。每个回答都不算最终答案,但能帮下一个问题找到方向。
JEV 也一样。它专门处理结构化判断,返回 true/false、选项、分数和概率。区别在于,它不只会说「是」或「否」,还会告诉你「大概率是真的」「可能是假的」,以及一个精确的概率数字。
0.99 意味着非常像 true,0.50 是无法确定,0.01 则非常像 false。
我第一次测试只用了 true/false 模式,不给它自由发挥的空间。
具体操作是:在 State 窗口放入一段信息,在 Questions 窗口写下判断标准,然后运行。
我放了一段聊天机器人的错误回复——当我提出「今天身体不舒服」,它却输出了一堆格式检查和步骤规划,完全不该出现在这种场景里。我设定的判断标准是「出现思维链内容即判定为错误」,JEV 返回的概率是 99%。
整个过程没有重新训练,它只是读取标准,据此判断。
这是我最想强调的一点。
如果你只写「这封邮件适不适合发送」,JEV 照样会给概率,但「适合」没有被定义,这个数字既难验证,也难复用到下一次。
只有把问题拆开,比如:是否泄漏了后台草稿?是否引入了无依据的旧话题?是否混淆了人物身份?是否没有回应用户当前表达?
这样得出的概率才容易验证,也能被下一次判断继续使用。
换句话说,JEV 的能力固然重要,但最终效果很大一部分取决于你能不能把判断标准写清楚,清楚到只剩封闭回答。
打工人日常最需要决策的场景是什么?是把活交上去,等老板拍板。
老板脑子里其实也在跑一组组问题:这个选题好不好?这篇文章会不会爆?这个视频有没有人看?
如果能把这些判断标准拆成具体的封闭问题,是不是就能提高通过率?
我决定试一下。
我收集了几十条过往选题,脱敏后作为 State 案例,批量询问一组固定的编辑判断问题。
TypeSafe 官方提供 HTTP API 和 Python SDK,发送一个 state 和一组 questions,就能得到结构化概率。新用户还送 5 美元额度,按它的低价来说绰绰有余。
我从飞书里整理出一套测试选题,每个选题生成「生肉版+熟肉版」——生肉版是灵感碎片,熟肉版是最终文章。保存为本地 JSONL,再生成测试脚本。
在飞书里我已经有一套人工打标系统,这次把 JEV 的结果和人工判定放在一起比较。
几个核心指标的高低排序,和人工打标大致相符。「论断越界」这一项它拿不太准——有些题的生肉版和熟肉版前后差别过大,它无法判断是好的升级还是坏的越界。
用一个全新选题验证:只有基本事实和描述,没有论点和论述方向,所以「结构性判断」只有 22%,证据充分性只有 8%。这和选题会上的讨论结果差不多。
最后套上一个简单的前端,一个选题判断器就诞生了。把点子和闪念扔进去,就能获得一系列打分。同一个热点,不同的写法,评分就会不同。
严格来说,这次没有真的把老板炼出来。
JEV 不知道老板是谁,也没学会某位领导变化多端的需求。它只是把散落在选题会、改稿意见和编辑经验里的判断标准,压缩成一组可以快速回答的问题。
但我觉得这已经很有价值了。
虽然没得到一个电子老板,但我得到了一份老板也得照着回答的问卷。至于离真正炼成丹还差什么,大概只差把领导历年的「这个不行」全部喂进去,以及承担由此产生的精神损耗。
把模糊的判断变成清晰的问题,本身就是一种能力。
你有没有想过,自己工作中最常被「感觉不对」卡住的环节是什么?如果把它拆成三个封闭问题,你会怎么问?
如果这篇文章对你有启发,点个赞,分享给那个总被老板「感觉」支配的同事吧。