大数跨境

高通如何把AI装进每一台随身设备?

高通如何把AI装进每一台随身设备? 科技行者
2026-09-24
6
导读:高通与它的个人AI策略。

作者 | 周雅

来源 | 科技行者

骁龙峰会第二天会后,高通在媒体沟通会上被问到一个问题:接下来是继续提升个人AI终端的算力,还是把这些设备当作智能体网络中的不同节点。高通技术公司高级副总裁兼XR、可穿戴与个人AI业务总经理Ziad Asghar回答是多台设备协同,他解释高通正在推进的“混合AI”逻辑时,给出了一个直白理由:“设备上的token都是免费的,云端的token是要花钱的。”而智能体会让这笔账迅速变大。

高通技术公司音频产品管理资深经理Andrew Laister(左),高通技术公司高级副总裁兼XR、可穿戴与个人AI业务总经理Ziad Asghar(右)

回顾骁龙峰会第一天,高通在第六代骁龙8超级至尊版上完整运行300亿参数的MoE模型,无需调用云端。而峰会来到第二天,讨论的是下一步:AI 在手机、耳机、眼镜、汽车和电脑之间流转时,每一次计算该放在哪台设备上,用户的记忆又该由谁来保管。

此次,高通正式发布第二代骁龙音频平台至尊版(Snapdragon Sound Elite Gen 2),定位为首个为个人AI时代打造的高端音频平台。

Liquid AI发布“跨设备记忆”,但记忆由谁保管没有定论

在揭晓具体新品之前,本场演讲从一场极具信号意味的对话切入,对谈的双方是高通公司总裁兼首席执行官安蒙(Cristiano Amon)与Liquid AI联合创始人兼 CEO Ramin Hasani。

Liquid AI三年半前从MIT分拆出来,团队此前花了约十年研究如何在最小的计算单元里塞进尽可能多的智能。它做的基础模型叫LFM(Liquid Foundation Models),从设计阶段就把芯片的限制考虑进去,不走训练完再压缩的路子。Hasani称LFM开放权重,在Hugging Face上每周下载约140万次,参数规模从2亿到240亿不等。

该公司围绕模型做了两类产品。一类是模型加配套工具,可以直接部署到设备上的成品;另一类是一套开发工具,让手机、汽车等设备厂商按自己的需求定制。Hasani给公司定的目标相当激进:让LFM进入每年新生产设备的一半,范围包括可穿戴设备、手机、汽车、电脑、机器人和工业设备。他的依据是,每年全球有超过20亿颗能承载基础模型的处理器被造出来,这是一块尚未开发的机会,而高通“拥有这20亿里很大一部分”。

但是在Hasani看来,AI能力在指数级提升,能力和价值之间却有一道缺口:个人用AI提效走得很快,企业层面的转型远远落后。他上述指的“生产级 AI”目标有几条标准:智能体采取的行动要可靠,输出结果要能核验,同时满足具体场景的约束,比如隐私、联网条件和安全要求。

他提出,智能体要成为下一个计算平台,需要5件事同时成立。排在第一位的是质量,端侧模型与云端最前沿模型之间的差距要缩小,他认为本地 AI 迟迟没有普及,原因之一就卡在质量门槛上。第二是上下文,也就是跨设备的记忆层。第三是harness,指围绕基础模型的一整套工具和流程,他的说法是,“智能体等于‘模型+harness’”,两者要一起调整。第四是理解物理世界的限制,设备有电池、发热和内存的约束,要把这些约束反馈到模型设计里,让软硬件协同设计。第五是开发者,要开源,让独立开发者用得上这些技术;对企业来说,他认为数据最重要,应当让企业自己掌握训练模型的能力。

当天Liquid AI正式发布了Liquid Context on Snapdragon,试图回答上述问题。按Hasani介绍,它包括两部分:一个记忆层,从各种来源收集信息,“读取、压缩并写入”用户在设备上的经历,提炼出偏好;另一个智能体层,调用这些记忆去执行任务,两部分都在骁龙芯片上本地运行。

现场演示中,经用户授权,智能体读取消息、笔记和照片,在后台管理日程,还会按用户习惯提前拟好要发到X上的帖子。Hasani 强调这套系统的新意在于“主动”:用户并没有下指令,由系统自己判断什么时候该出手。据悉,这套软件针对骁龙芯片中的 Hexagon NPU 做了优化,设备厂商加入个人上下文能力的同时,仍可自行选择智能体和服务。

配套的Liquid Agent运行在一款针对骁龙调优、非Transformer架构的LFM2.5-2.6B模型上。这是一款面向厂商的B2B产品,Liquid AI已在骁龙数字座舱上与奔驰合作,在车内实现完全本地运行的智能体验。

被问到为什么选骁龙,他的回答是,首先,这类应用必须贴着用户持续感知和记录,只能在端侧运行;其次,骁龙内部有多种处理单元,Hexagon NPU 跑智能体,低功耗传感中枢从设备信号里提炼上下文,CPU承担智能体生成时的采样计算。他还提到,第二代LFM中有一部分模型就是照着骁龙设计的。

真正关键的是“记忆层”问题,这在当天几段发言里出现了四种说法。Hasani的说法是,把智能体能力交给厂商,“OEM 就能拥有自己的智能”。高通方面则认为,品牌可以从模型目录里挑选不同的AI模型,但整个平台共用一个记忆层,换了模型,关于用户的上下文记忆仍在。AWEAR主张把记忆还给用户本人,加密存储,只有用户能访问。在Google的表述里,个人AI应当跟着用户在所有设备间流动,手机是中心,Gemini贯穿其中。

这件事要紧,在于谁掌握了跨设备的记忆,谁就最了解用户,也更有机会决定用户用哪个助手、在哪里下单。四种说法对应四种商业模式。安蒙与Hasani对谈时说了一句能表明立场的话:“如果大家听懂了Ramin的意思,就会明白争论云和端是一件没什么意义的事,因为说到底,每个人都有自己的设备,它对用户来说是独一无二的。”

Hasani还抛出了一个更远的判断。今天的AI训练完成后基本就固定了,新的偏好和数据进来,只能定期更新模型,他认为这种做法并不理想,下一步应该是能在生产环境中持续学习的系统。再往后,他预期AI会进入“递归式自我改进”,自己更新模型和外围工具,到那时每个人都可能成为一家企业。他认为眼下最实在的机会在汽车,其次是手机和可穿戴设备;他给的时间表是,如果估算准确,到2029年这类体验可以进入数十亿台设备。

第二代骁龙音频平台至尊版发布,耳机开始直连智能体

接下来我们拆解第二代骁龙音频平台至尊版。

与上一代相比,新平台体积缩小30%,算力和AI性能翻倍,功耗降低40%。会后的媒体采访中,高通技术公司音频产品管理资深经理Andrew Laister对40%这个数字做了拆分:它指的是“环境模式”,也就是耳机戴在耳朵上、不放音乐也不通话、随时准备回答问题的待命状态;听音乐这类活跃状态下,功耗降幅在10%到25%之间。他说,待命功耗是这一代最重要的新指标,它决定了耳机能不能一直处在随叫随到的状态。

连接方面,它集成了蓝牙和超低功耗Wi-Fi,支持Wi-Fi 6E;再配合高通扩展个人局域网(XPAN)技术,耳机不经过手机,也能直接连上用户常用的服务和智能体。平台还加入了新的eNPU加速器。

音质方面,高通强调低延迟和逐比特还原的高解析度音乐。降噪方面,主动降噪(用麦克风采集外界噪声,再发出反向声波抵消)借助端侧AI,可以识别佩戴松紧和环境变化,遇到突如其来的巨响能立刻调整,同时保持稳定。通话和语音识别由升级后的cVc语音技术负责,在嘈杂环境里也能听清用户说话,这是和AI助手对话、实时翻译、语音输入的前提。

更大的变化在软件层面。高通宣布推出一个智能耳戴应用生态:骁龙畅听应用与智能体:就像给手机做应用一样,服务提供商现在可以直接给耳机做应用和智能体,从音乐、娱乐到AI助手,产品上市后还能像手机应用一样持续更新。Laister在会后采访中指出,接入骁龙畅听应用与智能体之后,服务商可以自行选择把 AI 负载放在自家云端、手机还是中枢设备上,用户用哪些服务,体验就随之不同。

再往前一步是给耳机装上摄像头。音频品牌Cleer在峰会上展示了一款把声音、摄像头和AI结合在一起的早期概念产品,其CEO Charles Wu称,耳机已是普及度最高的无线设备之一。

耳机装上摄像头以后,和眼镜的边界在哪里?在会后的媒体采访中,Asghar按功能给高通的眼镜芯片分了档:只有音频、没有摄像头的眼镜,用 Sound Elite Gen 2 就够,两侧镜腿各放一颗,彼此通信。再往上一档只要计算机视觉摄像头,拍不下人脸,只为 AI 提供情境信息,Cleer耳机上的摄像头就属于这一类。同时要音频和摄像头,或者再加一到两块显示屏的眼镜,用 Snapdragon AR1 系列;需要沉浸式增强现实的,用AR2。手表、吊坠、胸针则由Snapdragon Wear 平台覆盖。高通称这是业内覆盖最广的个人AI产品组合。

一颗音频芯片之所以能成为主角,在于高通不再把耳机当成发声单元,而是当成一个长在耳朵上的智能体。这恰恰呼应了Asghar登台时抛出的核心论调。

时间调回到Asghar在开场时指出:每一次计算革命都伴随一种新的人机交互方式,键盘鼠标对应电脑,触屏对应智能手机,智能体时代也会催生专属的个人AI设备。他强调,手机仍是智能体体验的关键枢纽,但要让AI真正个人化,还需要一批戴在身上的新设备:手表、眼镜、戒指、耳机、吊坠。理由有两条:它们始终在身上,比从口袋或包里掏手机方便;它们贴着身体,能“看到你所看到的,听到你所听到的”,给AI提供实时的上下文。

个人AI的难点在于,这些设备很小,电池也很小。为此,高通做了一系列创新,Asghar介绍:高通为此拼出一套低功耗技术。低功耗传感中枢不必唤醒主芯片就能持续收集信号,逐步建立对用户和周围环境的理解;常开摄像头只截取画面中需要的部分,在补充上下文的同时,减少耗电和隐私暴露;Hexagon NPU与微型NPU分层承担推理,简单任务交给更省电的小单元;视频分析引擎则把一部分感知功能直接固化在硅片里,高通称这基于十余年的感知技术研究。

最关键的一项是连接技术。今天的耳机和大多数智能眼镜通过蓝牙连到手机,再由手机上网,手机是必经的中转站。Asghar介绍,凭借业界首创的超低功耗Wi-Fi和XPAN技术,即便是最小的个人AI设备,也能以接近蓝牙的功耗直接连接云端服务和智能体,“而无需依附于另一台终端”。

支撑这类体验有更小的模型。Asghar 宣布,第一代骁龙AR1和AR1+成为全球首批支持多模态1-bit模型的个人AI平台,合作方PrismML在峰会上演示了一款跑在 AR1 眼镜上的20亿参数视觉语言模型。科技行者从展区了解到,按PrismML在4GB内存测试平台上的自测数据,模型中1-bit的语言部分只占0.43GB,同等规模的4-bit模型需要1.66GB,生成速度约为后者的两倍,但一次能处理的上下文只有1024个token。这套1-bit内核目前只在高通内部工具链中可用,何时向开发者开放还没有时间表。

Asghar放了一段演示:一位视障用户只戴着眼镜,手里没有手机,问“这个苹果是什么颜色”,眼镜回答是红苹果,可能是嘎啦、富士或蜜脆。整个过程设备没有联网,模型完全跑在眼镜端侧。

但合作伙伴一侧的名单已经不短。高通从最早的Ray-Ban Stories眼镜起就为Meta和雷朋的眼镜供货;Snap的Specs AR眼镜上周刚刚发布。Google部分,与三星、Gentle Monster和Warby Parker合作的Gemini眼镜将采用 Snapdragon AR1,今年晚些时候发布,主打把 Gemini 的帮助直接说进耳朵里,包括实时翻译对话、逐向导航、回答关于周围环境的问题,以及免手持听歌、拍照、打电话。

科技行者在现场体验了XREAL的有线XR眼镜Aura,它将是首款采用 Snapdragon Reality Elite平台的设备,Android XR运行在一个用线连着眼镜的独立计算盒上,眼镜本身因此可以做得更轻;我可以把PC或游戏掌机的画面拉进视野,变成一块悬浮的屏幕。

对没有芯片和软件能力的品牌,高通拿出的是Snapdragon START。它于今年AWE 2026上首次公布,性质上是一套“交钥匙”方案:芯片厂把一台能工作的设备所需的硬件模组、软件和设计资源整套交给品牌,品牌在此基础上做外观和功能,不必从零开发。

高通技术公司XR产品经理Cameron Sylvia介绍,START分三块:芯片层面,是一枚基于Snapdragon AR1+的紧凑模组,高通称它是业内最小的AI眼镜模组之一,可塞进各种镜框。软件层面,横跨眼镜端、手机的配套应用、云端。第三块是规模化能力,由合作伙伴提供白牌设计和定制路径,技术与制造伙伴包括 Applied Materials、Avegant、Jorjin、和硕和Thundercomm。

Sylvia演示的系统以语音为第一入口,不用解锁屏幕,也不用翻菜单,说一句话就能调用 SoundCloud 播放音乐,或者通过Yelp找一家餐厅并订位。考虑到不同品牌想要不同体验,平台允许品牌从模型目录里挑选 AI 模型,再用前文提到的统一记忆层保证切换模型时体验连贯;平台还向用户清楚展示哪些信息被记住、哪些被分享。有外媒将START类比为高通在2010年代初帮助厂商快速做出智能手机的参考设计项目,熟悉那段国产手机历史的读者不会陌生。Sylvia还指出,智能眼镜第一次让他觉得有用,是在泳池里托着六个月大的儿子,两只手都腾不出来,眼镜替他拍下了那一刻。

第一个吃“START”螃蟹的是英国眼镜公司INSPECS。其创始人兼执行董事长 Robin Totterman在眼镜行业干了38年,自称行业上两次真正的突破,是弹簧铰链和增透膜,都发生在他入行之前。Inspecs 自有工厂,镜框销往80个国家、7.5万个零售网点。高通今年6月向 Inspecs 做了1000万美元的战略股权投资,以每股1英镑认购750万股新股,Inspecs 旗下有 Barbour、CAT、Superdry、O'Neill等授权品牌以及自有品牌 TitanFlex。

INSPECS的切入点是安全眼镜。“数以亿计的人在开工前戴上眼镜,不因为酷,也不因为品牌叫他们戴,因为法规要求。”该公司创始人Robin Totterman指出,安全眼镜是全球装机量最大的强制佩戴眼镜,一百多年来它的职责只有一句话:保护眼睛。在工厂车间、石油钻台、实验室这类封闭工作环境里,摄像头早已被接受,工人不放下扳手就能拍照留档,远在4000英里外的专家看着同一路实时画面指导维修。

Totterman透露,项目今年6月启动,到可用的设备面世只用了四个月,“任何一家眼镜公司都无法独自做到,任何一家芯片公司也不可能独自做到这一点”。Inspecs当天展示了一个产品家族。带抗冲击防护、摄像头嵌在鼻梁处的企业款;只有音频、没有摄像头的日常款;以及他“最自豪”的一款,把处方镜片和听力辅助做进同一副镜框。他的理由是,人们在听力下降后平均要等九年才采取行动,原因不在价格和技术,在于听力下降发生得足够缓慢,让人总能找到理由否认。“眼镜早在一个世纪前就不再只是医疗器械,助听器却从来没有走出这一步。”Asghar 说,这让个人AI设备进入了企业和医疗两个新领域。

AWEAR走的是另一条路,它不自己造眼镜,给眼镜品牌提供操作系统和参考设计。该首席执行官Ash Saulsbury借用乔布斯“计算机是思维的自行车”的比喻:自行车放大身体的力量,计算机放大思维的力量,但蹬车的始终是人,智能体计算要回答的是机器替人蹬车之后会怎样。在他看来,四十年来人们沿用的一直是窗口、图标、应用、菜单这一套,只是把台式机缩小进口袋,有人又想把它缩小到脸上,这套模式本身就错了。人用手操作工具,用语音与智能交流,既然电脑变得智能,就该让它看你所看、听你所听、直接对你说话。AWEAR做的是一套名为As-One的智能体操作系统,以眼镜为中心,让周围的设备表现得像一个整体。它基于Snapdragon AR1+模组开发,先定镜框的形状、舒适度和风格,再把智能装进去。

眼镜之外,Asghar还预告了一款个人AI胸针的参考设计,基于Snapdragon Wear Elite 平台,集成独立5G、双摄像头、麦克风和端侧AI,高通计划明年公布更多细节。

个人AI设备还被推向医疗。高通宣布成立个人AI健康联盟(Personal AI Health Alliance),成员包括Optum Health、Scripps Health和默克集团等,目标是用在设备本地运行的AI解决医疗领域尚未满足的需求。

视频里几位联盟成员代表各讲了一个场景。一位提到,老年人每年跌倒3700万次,带来数以十亿美元计的医疗支出,联盟希望用智能穿戴设备在跌倒发生前预判风险,数据留在设备上,这种主动照护“能自己把成本赚回来”。另一位说,医生每天花近6个小时在电子病历系统里打字,常常背对病人,回家还要接着补记录,行内戏称“睡衣时间”;环境感知式 AI 可以自动记录问诊、标出危险信号,把时间还给医生。第三位希望结合智能设备、临床数据和真实世界信息,理解患者每天的实际状况。

Modular的软件栈开始进入骁龙

个人AI设备之后,峰会转向一个普通用户很少关心、业内却很看重的环节:软件。芯片再强,也需要软件把AI模型翻译成芯片能执行的指令。英伟达的CUDA就是这样一套编程平台,大量AI代码为它而写。高通宣布收购 Modular 时,就有业内人士指出,英伟达真正的护城河在于CUDA和迁移所需的重写成本,GPU本身反在其次。

高通技术公司先进AI软件与平台执行副总裁Chris Lattner重点介绍这部分内容,他是 LLVM 编译器框架和 Swift 编程语言的作者,如今苹果等公司的开发工具都建立在 LLVM 之上。高通6月份宣布收购他联合创立的Modular,按交割日收盘价计算,这笔交易对Modular的估值约31亿美元。

“众所周知,我们正处在一场算力危机中。”Lattner的判断是,行业正投入巨额资本,构建异构硬件生态系统,最大的问题却一直出在软件上。每一家硬件团队都得都得从零开始搭自己的软件栈,少数领先者做成了,其他人仍在挣扎,即便最大的公司也跟不上模型研究的节奏。

开发者这一侧的麻烦是,面前摆着许多相似却又各不相同的栈要来回切换。AI本身也已经从几个模型变成一整套分布式系统,任何一层偏弱都会掉队。他拿当年做 LLVM 的经历对比,那时大家都在用已有20年历史的GCC,却无人投入跨越式升级,如果业内能在一个共享的软件栈上合作,大家都能跑得更快。

Modular的解法是一套统一栈,主要分三层。最底层是 Mojo,一门语法接近 Python、又能完全掌控硬件的编程语言,用来弥合研究员写 Python 与工程师写 C++ 之间的断层;Mojo 已进入可用于生产的1.0版本,并以 Apache 2.0 许可开源。中间一层是MAX,一个模型服务框架;最上层是 Modular Cloud,面对今天复杂的数据中心加速器,它提供统一的接口和工具,把资源调度、扩容、性能优化和稳定运行这些麻烦事包下来。

Lattner称这套栈每隔几天就要在生产环境中处理数万亿个token,最近从GPU 扩展到数据中心专用加速器,总计支持6家厂商的6种架构,其中包括高通自家的飞龙数据中心加速器,它建立在高通的可扩展NPU平台上。Lattner 说移植过程很顺利,因为高通的NPU软件已经很成熟。

但是对开发者来说,有效信息在后半段:Modular的整套软件平台将被带到高通的全产品线,这意味着开发者今后有望用同一套工具,为手机、电脑和数据中心里的高通芯片写AI程序。

骁龙PC有三套操作系统可选

峰会最后一部分是PC。骁龙PC芯片采用Arm架构,与手机芯片同属一个体系,而Windows世界的大量软件长期是为英特尔和AMD的x86架构编写的,所以骁龙笔记本刚推出时,兼容性是最大的疑问。

高通技术公司高级副总裁兼计算与游戏业务总经理Kedar Kondap在台上回忆,几年前每一场对话都从这个问题开始:“我的应用能在这台设备上跑吗?”他说这些讨论已成过去。按高通的数据,Windows on Snapdragon拥有超过70家合作伙伴,各大电脑厂商累计推出170多款设计,产品进入120家零售商的超过1.2万家门店,超过15万名销售人员接受过培训。

Kondap随即把话题转到“推理”上。在他看来,AI 的计量单位已经从模型和算力变成 token,“问题不再是模型有多大,问题是推理应该在哪里发生”。一部分推理属于云端;而也有越来越多的推理正在移到终端,因为延迟、隐私和连接条件都很重要,而且按现在的规模,“把每一个token 都送去云端,这笔经济账算不过来”。

他描绘的是一张分布式的智能网络。手机、耳机、眼镜、汽车、电脑各是一个节点,各有传感器、算力和对用户的了解。下一步是设备之间的协同编排:设备知道周围有哪些能力,动态决定一项任务在本机跑、交给旁边的设备、交给边缘服务器,还是交给云端。他强调,目标并非把一切从云端搬到设备上,要让系统聪明到知道每一次推理在那一刻该放在哪里。在这张网络里,PC被他定位为“锚点”,因为它的散热余量、内存和算力最充裕。

第一套系统是Windows。微软Surface负责人Brett Ostrum发布了新一代 Surface Pro 12寸和 Surface Laptop 13寸,均采用 Snapdragon X2 Plus。他说上一代用户反复提的是续航,这次就按续航调校。微软称新品端侧AI性能提升95%,图形性能提升超过60%,续航最长22.5小时,屏幕亮度提升25%,10月中旬上市,Pro 部分型号支持5G。受内存涨价影响,两款机型的起售价都高于上一代。

第二套系统来自Google,载体就是Googlebook。Google笔记本电脑、平板电脑及Android企业业务副总裁兼总经理‌John soloman先交代了背景。Google十五年前开始做Chromebook,追求快速、安全、续航长的简洁体验,它至今仍是数千万消费者、学生和企业用户的基础电脑,他明确表示Google对这条产品线的投入不变。但他认为,今天人们的想法常在路上冒出来,在地铁里、出租车上、咖啡馆里,最后又要回到笔记本上接着干,衔接就在这里断掉。Google 内部把这种损耗叫作“切换税”:文件找不到、工作流被切碎、配套应用不好用,工作只能重来。

Googlebook搭载的并非传统的ChromeOS,而是一套基于Android技术栈和Gemini打造的全新桌面系统,因此能和Android手机无缝配合:任务可以从手机接力到电脑,手机里的文件在电脑上直接打开,用户不必记得文件存在哪台设备上。它能运行完整的桌面版Chrome 和整个Play商店,Adobe等针对桌面优化的Android应用可以原生运行,Netflix 可以离线看。

第三套系统是Linux。X2 Elite 在2025年骁龙峰会上发布后,一直只支持 Windows 11。“多年来开发者一直向我们要一样东西:骁龙上的 Linux。我们听到了心声。”Kondap宣布,从Snapdragon X2系列开始,骁龙正式支持Linux。HUMAIN的Horizon Ultra AI PC将搭载一套基于Linux的全新智能体操作系统。Ubuntu开发商、英国软件公司Canonical在视频中宣布,X2系列将通过 Ubuntu 认证,目标是2027年上半年。华硕将在同期为Zenbook A14和A16带来 Ubuntu,HP也表示会在HP设备上推进 Linux 开源适配。

三套操作系统的并存,标志着高通在PC市场的布局进入了新阶段。



·  FIN  ·

科技行者团队出品


3个月扩至5000人,拼多多在雄安要做什么?
端侧模型上车,为什么超六成车企选择了斑马智能?

【声明】内容源于网络
0
0
科技行者
科技行者,至顶科技旗下的创新生态媒体,多年来一直站在科技的最前沿,致力于与打造“更深刻的创新“和“更硬核的科技”的创业者、企业家对话,连接产品与市场,项目与资本让创新更有价值。
内容 1381
粉丝 0
科技行者 北京第二十六维信息技术有限公司 科技行者,至顶科技旗下的创新生态媒体,多年来一直站在科技的最前沿,致力于与打造“更深刻的创新“和“更硬核的科技”的创业者、企业家对话,连接产品与市场,项目与资本让创新更有价值。
总阅读25.3k
粉丝0
内容1.4k