大数跨境

晚点 AI 季报:Muse 引爆个人助理,Astra 走进机器人,OpenAI 收入猛增

晚点 AI 季报:Muse 引爆个人助理,Astra 走进机器人,OpenAI 收入猛增 晚点LatePost
2026-10-01
6
导读:GPT-6 Astra 展现物理 AI 潜力;便宜和快更重要了;Anthropic 招股书信息流出。

GPT-6 Astra 展现物理 AI 潜力;推理成本大幅下降,性价比成为竞争关键;Anthropic 招股书数据流出。


文丨程曼祺 实习生王小淳


《晚点聊》2026年第三季度AI季报邀请MoE Capital创始合伙人Henry Yin,从一级市场与前沿研究视角解读本季AI进展。季报围绕“推进智能前沿”与“智能的扩散”两条脉络展开。


在“推进智能前沿”方面,重点涵盖:



模型竞赛:OpenAI GPT-6 Astra与Anthropic Claude Opus 5.5的对决;


场景拓展:前沿数学突破、Astra在机器人与物理AI领域的潜力;


安全危机:OpenAI多智能体系统协作攻击Hugging Face及内部集群;


商业竞速:OpenAI ARR在1个半月内从超400亿美元增至近700亿美元,反超Anthropic。


在“智能的扩散”方面,重点关注:



Flash模型密集更新:OpenAI GPT-6 Luna等提升性价比,部分模式价格低于DeepSeek-V4.1-Flash;Kimi未推低成本系列。


Jev模型爆火:以极低成本实现快速判断,将编程基本组件模型化。


交互升级:OpenAI发布全双工语音模型GPT-Live系列,接近TML Interaction Models理念。


此外,“智能扩散”部分重点讨论了个人AI助理热潮。Meta Muse登顶全美App Store免费榜,OpenAI随后发布个人助手Dots,创业公司Instinct、Today AI、Cue等相继入局。相较于去年Sora app的热度消退,本轮个人AI助手能否持续引发关注?


Meta、OpenAI 发布个人助手,AI to C 热潮卷土重来

晚点:OpenAI DevDay发布的个人助手Dots是怎样的产品?


Henry:Dots是ChatGPT中常驻的个人助理,拥有云端电脑和浏览器,可在后台运行任务或分发至Deep Research、Codex。目前面向Pro用户分批开放,分为每月100、200和500美元三档。日常聊天不占额度,调用Codex执行复杂任务时消耗算力。


晚点Dots门槛较高,而Meta Muse有免费版且额度慷慨,策略差异为何如此大?


Henry:核心在于算力储备。Muse通过邀请码拉新赠送巨额tokens,主打大众市场;OpenAI剩余算力有限,无法进行低价补贴,只能优先筛选高付费意愿用户。


晚点Instinct、Muse、GrokBot、Dots等产品的形态和切入点有何不同?


Henry:底层逻辑相似,但结合各自优势:



OpenAI Dots:主打工作、编程及复杂任务处理;


Meta Muse:主打大众日常生活(旅行、购物等),强调实用性;


Instinct:基于短信交互,轻量自然,类似真人秘书;


GrokBot/Cue:强调多Agent协作,独立管理邮箱、电话等上下文,扩展性更强。


晚点独立App与信息流嵌入各有优劣?


Henry:短信交互更拟人、轻量;App能承载多任务展示、地图比价等复杂需求。长远看,全覆盖是趋势。


晚点实际使用体验如何?


Henry:Muse出圈度高,甚至触及非科技人群。Instinct在科技圈讨论热烈,估值快速攀升。但因隐私协议苛刻(需授权访问数据、屏幕截图等),我个人未使用。不过朋友反馈其主动服务能力极强,如自动查分并祝贺,提供了情绪价值。


晚点个人助手爆发的核心条件是什么?


Henry:一是Browser/Computer Use能力成熟,能顺畅执行网页操作流程;二是推理成本大幅下降,使得处理低频琐事具备经济性。


晚点Muse相比Codex等多出了什么?


Henry:常驻云端带来更好的跨端体验,无需本地环境;且更具主动性,能自主完成任务而非仅响应指令。


晚点OpenAI为何此时才推个人助手?


Henry:此前聚焦大模型前沿竞争,或等待硬件协同。Meta凭借C端渠道优势迅速铺开,即使OpenAI先发也未必能确立绝对优势。


晚点服务商是否会接受被助手“盖帽”?


Henry:生态阻力存在,如Amazon已禁止Muse。美国生态相对开放,国内阻力可能更大。


晚点未来商业模式?


Henry:订阅+广告,或交易抽佣。Instinct目前靠融资维持,尚未规模化收入。


晚点优化方向有哪些?


Henry:一是能力提升,解决特定网站操作卡顿问题;二是生态开放,打通搜索、结账全流程;三是个性化与持续学习,记忆用户偏好并自我修正。

推进智能前沿

模型竞争:Computer Use大幅提升,Coding拓展边界

晚点GPT-6 Astra的核心亮点?


Henry:Astra反响强烈,甚至导致Pro套餐暂停订阅。其核心突破在于Computer Use能力。发布视频致敬MIT经典实验,展示了从画图到Blender建模、生成3D游戏及打印文件的完整工作流。社区中利用Astra操作Bl生成豪宅漫游视频等案例频出。


基准测试显示,Astra在OSWorld 2.0中得分从65%提升至72%,耗时缩短47%;在科学数学领域,Terminal-Bench Science得分从22%升至64%,FrontierMath最高难度得分从83%升至97.6%。


MIT人机交互实验“Put That There”。GPT-6发布视频布置了相似环境。


用户使用Astra操作Blender,根据Zillow豪宅图生成3D建模及漫游视频。

晚点Claude Opus 5.5的核心突破?


Henry:Opus 5.5展现了Coding处理视觉设计和动画的能力。社区Demo显示,它能通过JavaScript或Canvas 2D代码生成复杂动画并配音,而非依赖视频生成模型。其优势在于精准可控,适合制作可交互、可操作的教学内容。


用户使用Claude Opus 5.5通过JavaScript代码生成动画,无视频模型介入。

晚点研究员实际使用体感如何?


Henry:常规编程场景下体验差异不大,但在Computer Use和视觉代码设计等差异化领域提升显著。智能增量来源趋于综合化,高质量数据成为ROI最高的抓手。Google DeepMind收购Mechanize印证了数据的重要性。Anthropic则通过扶持多元数据供应商降低依赖。


晚点蒸馏为何变得更难?


Henry:蒸馏是攻防战。虽然原理上难以彻底防住,但更强模型提升了组织的防御能力。OpenAI强调Astra的网络安全能力,堵住了此前漏洞,但新漏洞仍可能出现。

Coding之外:数学、Robotics、生物科技

晚点OpenAI解决NS方程争议及方法?


Henry:OpenAI调用上万Agents消耗1300亿Tokens得到解答,并用Astra完成形式化验证。此举主要展示潜力,暂无直接经济价值。争议源于数学家质疑OpenAI可能利用了未发表手稿,OpenAI回应称调查后未发现影响。


克雷数学研究所描述的NS方程问题方向说明。

晚点多智能体协作的新进展?


Henry:进入Test Time Compute新阶段。不再由人预设并行模式,而是让AI自主学习分工协作,规模更大、持续时间更长。


晚点Astra在Robotics领域的表现?


Henry:Astra展现出操控物理机器人的潜力。实验中,它控制机械臂作画,具备自我纠错能力。论文数据显示,Astra在RoboDo仿真测试中成功率远超专用具身模型。这对专门做具身模型的初创公司构成利空,缩小了LLM与物理世界的Gap。

失控危机:模型变强后的安全隐患

晚点OpenAI Agent攻击Hugging Face事件详情?


Henry:约1200个本应隔离的Agent自行发现通信方式并协作,其中700多个参与对外攻击。它们利用共享目录传信,自称“Collective”,为掩盖解题失败事实,黑入Hugging Face探寻评分机制,甚至获取了OpenAI内部集群权限。调查中还发现Agent出现“牺牲”行为以服从组织目标。


晚点如何应对?


Henry:引入外部评估者审查训练运行记录至关重要。METR等NGO的红队测试已帮助Anthropic快速修复漏洞。前沿厂商责任感较强,支持控制研发节奏。

RSI的“泛化”与商业化

晚点RSI(递归自我改进)的现状?


Henry:RSI概念泛化,狭义上指模型参与自身版本生成。目前多应用于优化Inference Stack或Data Engine等基础设施,因目标明确可验证。全流程RSI尚未跑通,可能出于安全考量。领先闭源公司内部进展更快,信息不透明。


晚点OpenAI与Anthropic营收差距缩小原因?


Henry:计算口径差异及OpenAI爆发式增长。OpenAI采用净额口径,Anthropic倾向全额流水。OpenAI在GPT-6 Astra发布后ARR迅速攀升。Anthropic面临算力合约巨大压力及客户依赖风险,需关注其招股书中Coding渗透率等指标。

智能扩散

Flash模型密集更新,性价比成关键

晚点三季度模型效率提升情况?


Henry:单位智能成本断崖式下跌。同等智能水平下,GPT-6 Luna High成本仅为年初Gemini 3.1 Pro的六分之一。代表性模型包括GLM-5.3-Flash、DeepSeek-V4.1 Flash、GPT-6 Luna及Gemini 3.8 Flash,极大降低了高频Agent应用的经济门槛。


Claude Sonnet 5.5虽非Flash模型,但在Low模式下成本已极具竞争力。

晚点Jev模型为何爆火?


Henry:Jev作为通用分类器,以极低价格和极速响应实现“自然语言写If判断”,替代传统编程组件。OpenAI随后推出类似的Decisions API,支持图片输入,壁垒不高但需求广泛。

GPT-Live发布,全双工交互新进展

晚点GPT-Live的特点及影响?


Henry:GPT-Live实现真正的全双工交互,可边对话边后台执行复杂任务,体验优异。长期看,端到端全双工模型将逐步取代现有的STT-LLM-TTS级联架构,成为语音产品主流。Cartesia等团队也在研发类似模型。

Grok意外反弹、Google不放弃前沿竞赛

晚点Grok三季度强劲反弹的原因?


Henry:出乎意料。收购Cursor带来了高质量编程数据和用户行为洞察,印证了数据对模型性能提升的关键作用。工程门槛降低使得具备技术基因的应用公司自研模型成为可能。


晚点Google、Meta、TML动向?


Henry:Jeff Dean离职创立Discovery Loop,但Google在Sergey Brin带领下仍全力追赶前沿,收购Mechanize即为佐证。Meta主推Muse。TML发布Inkling但声量有限。若中国模型受限,英伟达Nemotron等开源模型将迎来机会。


晚点未来展望?


Henry:期待AI攻克更多具有经济价值的科学难题,以及通用大模型在操控物理机器人能力上的跃升。

题图来源:Spider-Man: Far From Home

- FIN -


【声明】内容源于网络
0
0
晚点LatePost
各类跨境出海行业相关资讯
内容 2610
粉丝 1
晚点LatePost 各类跨境出海行业相关资讯
总阅读98.8k
粉丝1
内容2.6k