大数跨境

OpenAI 买下 iPhone 人像模式幕后功臣,要给 AI 装上一双新眼睛

OpenAI 买下 iPhone 人像模式幕后功臣,要给 AI 装上一双新眼睛 APPSO
2026-09-19
2
导读:在未来,相机将变为向机器提供判断下一步行动的依据。
过去一周,科技界聚焦两款重磅新品:苹果 iPhone 18 与豆包手机助手消费者版(首发搭载努比亚 NaviX Ultra)。标志着 AI 正式深入手机系统底层。与此同时,《华尔街日报》披露,OpenAI 已以超 3 亿美元收购相机技术公司 Glass Imaging。
AI 正从“看见屏幕”迈向“触碰物理世界”。此次收购虽未获 OpenAI 官方确认,但时机微妙:继去年斥资 65 亿美元收购 Jony Ive 的硬件公司 io 后,OpenAI 在工业设计与相机工程领域再度补全关键拼图。

是 AI,更是重构成像逻辑

Glass Imaging 由前苹果计算摄影专家 Ziv Attar 和 Tom Bishop 创立,两人曾主导 iPhone 人像模式开发。其核心并非大众熟知的"AI 修图”,而是利用 AI 反向重塑相机硬件设计逻辑。
传统成像流程中,传感器获取的原始光信号需经 ISP(图像信号处理器)进行降噪、校色、锐化等独立模块处理,易导致信息丢失。Glass Imaging 提出的 Neural ISP 技术,通过针对特定镜头和传感器训练的神经网络,接管整个成像流水线。
该技术将去马赛克、降噪、去模糊及多帧融合等环节纳入联合训练网络,并加入传统 ISP 难以处理的镜头像差反卷积和传感器串扰校正,直接输出成品 RGB 图像。其核心理念是:只要传感器捕捉到足够信息,光学缺陷可由神经网络在成像过程中精准修复。
此处的“修复”绝非生成式 AI 的“脑补”。生成式修图虽能清晰化模糊文字或人脸,但可能失真。Glass Imaging 的目标是基于具体光学系统和 RAW 数据,恢复传感器实际捕捉的信息,而非凭空生成纹理。这对 AI Agent 至关重要:若图像用于决策行动,虚假细节可能导致错误操作。

AI 设备的两种“观看权”

Neural ISP 技术不仅助力手机厂商以小镜头实现高画质,更对 AI 硬件具有深层意义:模型对世界的认知,取决于摄像头输入的数据质量。AI 设备需具备两种“观看”能力。

屏幕内的上下文理解

第一种能力发生于屏幕内:AI 需理解用户浏览内容、读取本地信息并获得调用 App 权限,从而掌握操作系统内的完整上下文。

屏幕外的物理感知

第二种能力发生于屏幕外:菜单文字、桌面物品、道路环境等物理信息,无法仅凭聊天记录获取,必须通过拍摄照片传递给 AI。照片不仅是人类观看的终点,更是 Agent 工作的起点。未来 AI 设备需缩短“看见 - 拍摄 - 上传 - 询问”链路,使摄像头从“记录画面”转变为“提供行动依据”。
GlassAI 变焦技术已落地荣耀 600 系列,并在骁龙 8 Elite Gen 5 参考设备上展示了实时 4K 视频处理与 20 倍以上变焦增强能力。当摄像头连接的是即将采取行动的 Agent,成像标准将从“美观”转向“真实、稳定、及时地呈现空间关系”,以支撑商品识别、设备操作及行动规划。

软硬协同:重塑硬件设计边界

Glass Imaging 揭示了软硬件分工的重构:传统模式下,硬件尽力消除像差与噪声,软件负责修饰;新模式下,硬件可保留部分可计算逆转的缺陷,只要传感器捕捉到足够信息,神经网络即可在成像中恢复。这意味着镜头可以更小、像素可以更密,原本需增加镜片厚度与成本解决的问题,现可转移至神经网络。
未来 AI 硬件设计将不再遵循“先造硬件再塞模型”的路径,而是从伊始便共同设计镜头、传感器、NPU、内存与模型。传感器保留哪些信号、神经网络修复哪些误差、设备算力需求及低功耗环境理解能力,都将反向定义硬件形态。例如,若已知某些光学缺陷可被稳定修复,下一代相机在选型时可包容既往无法接受的缺陷,无需堆叠镜片消除像差,转而确保传感器保留充足原始信息供 AI 恢复。
这一逻辑同样适用于麦克风、空间传感器等感知部件。过去硬件负责完整记录世界,软件事后处理;未来硬件只需捕捉模型可理解还原的信息,模型从一开始即参与定义“如何观看”。模型虽不决定摄像头看什么,却将改变相机为获取一幅可被还原理解的图像所需付出的硬件代价。
【声明】内容源于网络
0
0
APPSO
AI第一新媒体,「超级个体」的灵感指南。 #AIGC #智能设备 #独特应用 #Generative Al
内容 15764
粉丝 0
APPSO AI第一新媒体,「超级个体」的灵感指南。 #AIGC #智能设备 #独特应用 #Generative Al
总阅读444.8k
粉丝0
内容15.8k