

你有没有遇到过这样的场景——跟AI聊了半天,费尽口舌描述一张图表、一个页面长啥样,对方还是一头雾水?
别急,这个问题,整个AI行业都在想办法解决。过去一年,Coding和Agent能力疯狂改写大模型排名,而当AI开始接管越来越长的任务链,一个关键问题浮出水面:模型没有眼睛,怎么看得见自己干得好不好?
今年1月,OpenAI发布的企业使用报告透露了一个细节:在研发岗位最常用的ChatGPT工具里,图片上传排到了第三名,仅次于搜索和数据分析。
你可能会想:这不就是个普通功能吗?
但恰恰是这个“普通功能”,正在悄悄改变大模型的竞争格局。一位多模态研究员直言:
“长链任务如果只通过代码层面的反馈,误差会不断累积,最终效果非常差。视觉是更准确的反馈,也更贴近用户意图。”
什么意思?简单说,AI写代码、做网页,干完了之后总得“验收”吧?以前靠文字反馈,误差像滚雪球一样越滚越大;现在让AI直接“看一眼”自己干的活儿,发现问题当场改,效率天差地别。
一位研究员回忆起第一次让GPT-5.6 Sol操作桌面端Agent时的感受,用了两个字形容:震撼。
这个AI不仅自己打开浏览器,还能处理认证与权限,把本地代码推上平台,甚至直接登录训练平台启动任务。评价一句“知道很多诀窍”——为了完成目标,几乎把所有能用的办法都使上了。
问题来了:如果没有视觉能力,它怎么知道自己登录成功了没有?怎么确认页面加载完毕?
没错,靠的就是“眼睛”。
实话实说,给AI装视觉,不是加个插头那么简单。
图像和文字的数据结构、信息密度、学习速度完全不同。当它们共同训练同一套参数时,视觉数据会和文本、代码、数学推理“抢地盘”,不同训练目标还会互相干扰。
一位研究员摊牌了:
“任务越多,越难平衡。如果做统一原生多模态模型,付出的资源肯定是1+1大于2。”
更大的代价在于算力。视觉token越多、图像分辨率越高,训练和推理的开销就越大。对于只需读取几个字段的任务,让通用大模型反复“看”整张图,还真不一定比专业OCR划算。
上个月,月之暗面交出了K3——总参数2.8万亿的“水桶模型”,同时死磕视觉、Coding和Agent能力。结果相当能打:在Arena Frontend Code榜单上以1679分登顶,浏览器开发平台Puter制造了5处视觉偏差,K3对照目标页和运行页截图,居然全部找出,零误报。
这背后有个专业玩法叫“vision in the loop”:模型写完代码后查看页面,再根据视觉结果继续调整。说白了,就是AI边干边验收,干完再修,直到满意为止。
而就在K3发布几周后,DeepSeek给出了另一种答案。V4-Flash总参数只有K3的十分之一,不装视觉,也不大幅扩参数,光靠优化后训练,就在多项Coding和Agent评测中大杀四方,在Arena WebDev榜单上冲到1577分,直逼第一梯队。
一句话总结:
有意思的是,这场分歧的答案,可能不全在技术上。
一位业内人士说得直白:
“每家公司选择多大的模型、选择什么卖点,最后可能都是那几个人,或者说是老板说了算。”
核心团队的研究背景、产品场景和训练成本,都在影响优先级。猎头们已经嗅到了风向——K3发布后,月之暗面公司附近的咖啡馆里,多了不少来挖“多模态”人才的猎头。
但这不意味着所有公司都会all in。多位业内人士的共识是:Coding才是上牌桌的门槛,如果Coding冲不上去,可能就没有未来。
这场竞争像是同时拨动了两个时钟。
前一个时钟,决定谁跟得上眼下的速度;后一个时钟,或许决定这些公司最终能抵达哪里。
眼下没有统一答案,但方向已经鲜明——不管是“先装眼睛再赶路”,还是“先把脚下的路跑通”,所有玩家都在为同一个终点蓄力。
而那个终点,可能是真正看得懂、做得成、改得动的AI。
你说,这个“眼睛”,该不该现在就装?
如果觉得这篇文章讲明白了,点个“在看”,也欢迎分享给同样关注AI的朋友~