找工位
空间入驻
小程序

OpenAI砸3亿收购相机公司!AI终于长出了眼睛?

2026-09-20 12:46:25

你有没有想过一个问题:AI 到底是怎么「看」这个世界的?

过去我们以为,给 AI 一张照片就够了。可真相是——照片是人看的终点,却只是 AI 工作的起点。

就在最近,一条不太起眼的消息,可能悄悄改变了整个行业的走向。

一周之内,两件大事撞在了一起

一边,是 Apple 新机 iPhone 18 刷屏;另一边,是豆包手机助手消费者版发布,首款搭载机型努比亚 NaviX Ultra 今日开售。AI,正大摇大摆地走进手机系统。

但更值得琢磨的,是第三条消息——《华尔街日报》透露:OpenAI 已以超过 3 亿美元收购相机技术公司 Glass Imaging

交易尚未公开确认,可这块新拼图出现的位置太微妙了。

去年,OpenAI 花 65 亿美元收购了 Jony Ive 创办的硬件公司 io,至今还没做出大名堂。而如今,工业设计师和相机工程师,已经先后到位。

这说明什么?AI 硬件,可能就差「一双眼睛」了。

🎯 这家公司,到底什么来头?

Glass ImagingZiv AttarTom Bishop 创办。两人此前都曾在苹果从事计算摄影工作,还参与过 iPhone 人像模式的开发。

但别误会——他们研究的方向,真不是你想的那种 AI 修图。

⚠️ 关键区别:不是在「猜」,而是在「还原」

先说个冷知识。手机按下快门后,传感器最先得到的并不是一张能看的照片,而是一堆原始光信号。

传统图像信号处理器要完成降噪、校色、锐化等工序,才在屏幕上生成最终图像。

Glass Imaging 想做的,是用一套针对具体镜头和传感器训练的神经网络,接管整条流水线。

它的底层是 Neural ISP。传统 ISP 会把 RAW 数据依次交给去马赛克、降噪、多帧融合、锐化等模块,每一步由独立算法处理,过程中会丢掉一部分信息。

GlassAI 从 RAW 连拍数据出发,把去马赛克、降噪、去模糊、多帧融合放进同一个联合训练的网络,同时加入传统 ISP 不擅长的镜头像差反卷积和传感器串扰校正,最后直接输出成品 RGB 图像。

说白了,它学的是:一台相机如何产生误差,再在图像形成时把误差倒推回去。

💡 这里的「修复」,和修图完全是两码事

生成式修图,可以把远处模糊的文字、月亮和人脸「猜」得更清晰。

但清晰,不等于真实。

Glass Imaging 的资料说得很明白:其网络针对具体光学系统和 RAW 数据训练,目标是恢复传感器实际捕捉到的信息,而不是凭常识和推论生成新的纹理。

为什么这点如此重要?

如果摄像头只是为了拍朋友圈,照片好看就行。

可如果图像要交给 Agent 判断现实并采取行动,那么凭空补出来的物体和文字,就可能导致错误操作。

这就是 OpenAI 对它感兴趣的根本原因。

AI 设备,需要两种「观看权」

对手机厂商来说,Neural ISP 能让更小的镜头拍出更清晰的照片。

但对一家正在制造 AI 硬件的公司来说,它还有另一层意义:模型看到的世界,首先取决于摄像头交给它什么。

🌟 第一种:发生在屏幕以内

AI 要看懂用户正在浏览什么,读取哪些本地信息,还要获得调用不同 App 的权限。在这个基础上,理解整个操作系统里的上下文。

🌟 第二种:发生在屏幕以外

菜单上的文字、桌上的物品、眼前的道路、房间里的设备,这些无法只靠聊天记录让 AI「知道」。得先拍下一张照片,再交给 AI。

未来的 AI 设备若要及时行动,就必须缩短「人看见、拍摄、上传、询问」这一整条链路。

摄像头的身份,也因此发生了变化。

过去,它替人保存值得回看的画面。

未来,它将向机器提供判断下一步行动的依据。

硬件和软件的分工,正在被重新划定

GlassAI 的变焦技术已经进入荣耀 600 系列,说明它至少完成了从模型、手机芯片到量产设备的适配。公司还曾在骁龙 8 Elite Gen 5 参考设备上展示实时 4K 视频处理和 20 倍以上变焦增强。

这些能力现在是用来看远处的风景。可当摄像头连接的不是相册,而是一个准备采取行动的 Agent,成像的评价标准就会变。

照片不只要好看,还要尽可能真实、稳定、及时地呈现文字、物体和空间关系。因为模型接下来可能据此识别商品、操作设备,甚至规划行动。

⚡ 未来的硬件,可能这样被设计

过去,相机厂商先用镜头和传感器解决像差、模糊与噪声,再让 ISP 修饰最终图像。

GlassAI 则允许硬件保留一些能靠计算逆转的缺陷。只要传感器还捕捉到了足够的信息,专门训练的网络便能在成像过程中将其恢复。

结果就是:镜头可以更小,像素可以继续缩小,一部分原本需要增加镜片、厚度和成本才能解决的问题,被转移给了神经网络。

那么未来 AI 设备的硬件,也许不必先完整设计出来,再往里「塞一个模型」。

镜头、传感器、NPU、内存和模型,会从一开始就共同设计。

传感器负责保留哪些原始信号、神经网络能够修复哪些误差、设备需要多大本地算力、能否在低功耗状态下持续理解环境——这些问题,都将反过来影响硬件的形状。

同样的逻辑,也可能延伸到麦克风、空间传感器和其他感知部件。

过去,硬件负责把世界尽量完整地记录下来,软件只在事后处理。

未来,硬件只需捕捉模型能理解和还原的信息,模型则从一开始就参与影响硬件应该怎样观看世界。

模型不负责决定摄像头看什么,却会改变相机必须用多少硬件,才能得到一幅足以被还原和理解的图像。

说到底,AI 要真正走进现实世界,第一件事不是变聪明,而是先学会「看清」。

而这一次,它正在认真补上这堂课。

你觉得,AI 有了「眼睛」之后,最先被改变的会是什么?

欢迎在评论区聊聊你的想法。如果这篇文章让你有收获,别忘了点个赞、转发给身边关心 AI 的朋友,我们下期见!