找工位
空间入驻
小程序

国产大模型集体进化:给AI装上“眼睛”,正在改写行业排名

2026-08-04 16:00:23

你有没有遇到过这样的场景——跟AI聊了半天,费尽口舌描述一张图表、一个页面长啥样,对方还是一头雾水?

别急,这个问题,整个AI行业都在想办法解决。过去一年,Coding和Agent能力疯狂改写大模型排名,而当AI开始接管越来越长的任务链,一个关键问题浮出水面:模型没有眼睛,怎么看得见自己干得好不好?

为什么说AI必须长“眼睛”?

🌟 视觉正在成为AI的“第六感”

今年1月,OpenAI发布的企业使用报告透露了一个细节:在研发岗位最常用的ChatGPT工具里,图片上传排到了第三名,仅次于搜索和数据分析。

你可能会想:这不就是个普通功能吗?

但恰恰是这个“普通功能”,正在悄悄改变大模型的竞争格局。一位多模态研究员直言:

“长链任务如果只通过代码层面的反馈,误差会不断累积,最终效果非常差。视觉是更准确的反馈,也更贴近用户意图。”

什么意思?简单说,AI写代码、做网页,干完了之后总得“验收”吧?以前靠文字反馈,误差像滚雪球一样越滚越大;现在让AI直接“看一眼”自己干的活儿,发现问题当场改,效率天差地别。

⚠️ 一个让研究员“震撼”的瞬间

一位研究员回忆起第一次让GPT-5.6 Sol操作桌面端Agent时的感受,用了两个字形容:震撼。

这个AI不仅自己打开浏览器,还能处理认证与权限,把本地代码推上平台,甚至直接登录训练平台启动任务。评价一句“知道很多诀窍”——为了完成目标,几乎把所有能用的办法都使上了。

问题来了:如果没有视觉能力,它怎么知道自己登录成功了没有?怎么确认页面加载完毕?

没错,靠的就是“眼睛”。

国产大模型,正在分岔路口

💡 一条路:给模型“装眼睛”到底贵不贵?

实话实说,给AI装视觉,不是加个插头那么简单。

图像和文字的数据结构、信息密度、学习速度完全不同。当它们共同训练同一套参数时,视觉数据会和文本、代码、数学推理“抢地盘”,不同训练目标还会互相干扰。

一位研究员摊牌了:

“任务越多,越难平衡。如果做统一原生多模态模型,付出的资源肯定是1+1大于2。”

更大的代价在于算力。视觉token越多、图像分辨率越高,训练和推理的开销就越大。对于只需读取几个字段的任务,让通用大模型反复“看”整张图,还真不一定比专业OCR划算。

🔥 两种答案,一场豪赌

上个月,月之暗面交出了K3——总参数2.8万亿的“水桶模型”,同时死磕视觉、Coding和Agent能力。结果相当能打:在Arena Frontend Code榜单上以1679分登顶,浏览器开发平台Puter制造了5处视觉偏差,K3对照目标页和运行页截图,居然全部找出,零误报。

这背后有个专业玩法叫“vision in the loop”:模型写完代码后查看页面,再根据视觉结果继续调整。说白了,就是AI边干边验收,干完再修,直到满意为止。

而就在K3发布几周后,DeepSeek给出了另一种答案。V4-Flash总参数只有K3的十分之一,不装视觉,也不大幅扩参数,光靠优化后训练,就在多项Coding和Agent评测中大杀四方,在Arena WebDev榜单上冲到1577分,直逼第一梯队。

一句话总结:

  • 有的公司押注“看得多、干得全”的大而全路线(阿里、字节也在跟进);
  • 有的公司坚持“精兵简政”,先靠后训练把核心能力做到极致。

💬 路线之争,本质是资源分配之争

有意思的是,这场分歧的答案,可能不全在技术上。

一位业内人士说得直白:

“每家公司选择多大的模型、选择什么卖点,最后可能都是那几个人,或者说是老板说了算。”

核心团队的研究背景、产品场景和训练成本,都在影响优先级。猎头们已经嗅到了风向——K3发布后,月之暗面公司附近的咖啡馆里,多了不少来挖“多模态”人才的猎头。

但这不意味着所有公司都会all in。多位业内人士的共识是:Coding才是上牌桌的门槛,如果Coding冲不上去,可能就没有未来。

两个时钟,一场长跑

这场竞争像是同时拨动了两个时钟。

  • 一个走得飞快:Coding和Agent的排名,几个月甚至几周就变一次;
  • 一个走得缓慢:模型从语言走向真正理解世界,需要更漫长的进化周期。

前一个时钟,决定谁跟得上眼下的速度;后一个时钟,或许决定这些公司最终能抵达哪里。

眼下没有统一答案,但方向已经鲜明——不管是“先装眼睛再赶路”,还是“先把脚下的路跑通”,所有玩家都在为同一个终点蓄力。

而那个终点,可能是真正看得懂、做得成、改得动的AI。

你说,这个“眼睛”,该不该现在就装?

如果觉得这篇文章讲明白了,点个“在看”,也欢迎分享给同样关注AI的朋友~