GPT-6 Astra 展现物理 AI 潜力;推理成本大幅下降,性价比成为竞争关键;Anthropic 招股书数据流出。
文丨程曼祺 实习生王小淳
《晚点聊》2026年第三季度AI季报邀请MoE Capital创始合伙人Henry Yin,从一级市场与前沿研究视角解读本季AI进展。季报围绕“推进智能前沿”与“智能的扩散”两条脉络展开。
在“推进智能前沿”方面,重点涵盖:
模型竞赛:OpenAI GPT-6 Astra与Anthropic Claude Opus 5.5的对决;
场景拓展:前沿数学突破、Astra在机器人与物理AI领域的潜力;
安全危机:OpenAI多智能体系统协作攻击Hugging Face及内部集群;
商业竞速:OpenAI ARR在1个半月内从超400亿美元增至近700亿美元,反超Anthropic。
在“智能的扩散”方面,重点关注:
Flash模型密集更新:OpenAI GPT-6 Luna等提升性价比,部分模式价格低于DeepSeek-V4.1-Flash;Kimi未推低成本系列。
Jev模型爆火:以极低成本实现快速判断,将编程基本组件模型化。
交互升级:OpenAI发布全双工语音模型GPT-Live系列,接近TML Interaction Models理念。
此外,“智能扩散”部分重点讨论了个人AI助理热潮。Meta Muse登顶全美App Store免费榜,OpenAI随后发布个人助手Dots,创业公司Instinct、Today AI、Cue等相继入局。相较于去年Sora app的热度消退,本轮个人AI助手能否持续引发关注?
Meta、OpenAI 发布个人助手,AI to C 热潮卷土重来
晚点:OpenAI DevDay发布的个人助手Dots是怎样的产品?
Henry:Dots是ChatGPT中常驻的个人助理,拥有云端电脑和浏览器,可在后台运行任务或分发至Deep Research、Codex。目前面向Pro用户分批开放,分为每月100、200和500美元三档。日常聊天不占额度,调用Codex执行复杂任务时消耗算力。
晚点Dots门槛较高,而Meta Muse有免费版且额度慷慨,策略差异为何如此大?
Henry:核心在于算力储备。Muse通过邀请码拉新赠送巨额tokens,主打大众市场;OpenAI剩余算力有限,无法进行低价补贴,只能优先筛选高付费意愿用户。
晚点Instinct、Muse、GrokBot、Dots等产品的形态和切入点有何不同?
Henry:底层逻辑相似,但结合各自优势:
OpenAI Dots:主打工作、编程及复杂任务处理;
Meta Muse:主打大众日常生活(旅行、购物等),强调实用性;
Instinct:基于短信交互,轻量自然,类似真人秘书;
GrokBot/Cue:强调多Agent协作,独立管理邮箱、电话等上下文,扩展性更强。
晚点独立App与信息流嵌入各有优劣?
Henry:短信交互更拟人、轻量;App能承载多任务展示、地图比价等复杂需求。长远看,全覆盖是趋势。
晚点实际使用体验如何?
Henry:Muse出圈度高,甚至触及非科技人群。Instinct在科技圈讨论热烈,估值快速攀升。但因隐私协议苛刻(需授权访问数据、屏幕截图等),我个人未使用。不过朋友反馈其主动服务能力极强,如自动查分并祝贺,提供了情绪价值。
晚点个人助手爆发的核心条件是什么?
Henry:一是Browser/Computer Use能力成熟,能顺畅执行网页操作流程;二是推理成本大幅下降,使得处理低频琐事具备经济性。
晚点Muse相比Codex等多出了什么?
Henry:常驻云端带来更好的跨端体验,无需本地环境;且更具主动性,能自主完成任务而非仅响应指令。
晚点OpenAI为何此时才推个人助手?
Henry:此前聚焦大模型前沿竞争,或等待硬件协同。Meta凭借C端渠道优势迅速铺开,即使OpenAI先发也未必能确立绝对优势。
晚点服务商是否会接受被助手“盖帽”?
Henry:生态阻力存在,如Amazon已禁止Muse。美国生态相对开放,国内阻力可能更大。
晚点未来商业模式?
Henry:订阅+广告,或交易抽佣。Instinct目前靠融资维持,尚未规模化收入。
晚点优化方向有哪些?
Henry:一是能力提升,解决特定网站操作卡顿问题;二是生态开放,打通搜索、结账全流程;三是个性化与持续学习,记忆用户偏好并自我修正。
推进智能前沿
模型竞争:Computer Use大幅提升,Coding拓展边界
晚点GPT-6 Astra的核心亮点?
Henry:Astra反响强烈,甚至导致Pro套餐暂停订阅。其核心突破在于Computer Use能力。发布视频致敬MIT经典实验,展示了从画图到Blender建模、生成3D游戏及打印文件的完整工作流。社区中利用Astra操作Bl生成豪宅漫游视频等案例频出。
基准测试显示,Astra在OSWorld 2.0中得分从65%提升至72%,耗时缩短47%;在科学数学领域,Terminal-Bench Science得分从22%升至64%,FrontierMath最高难度得分从83%升至97.6%。
MIT人机交互实验“Put That There”。GPT-6发布视频布置了相似环境。
用户使用Astra操作Blender,根据Zillow豪宅图生成3D建模及漫游视频。
晚点Claude Opus 5.5的核心突破?
Henry:Opus 5.5展现了Coding处理视觉设计和动画的能力。社区Demo显示,它能通过JavaScript或Canvas 2D代码生成复杂动画并配音,而非依赖视频生成模型。其优势在于精准可控,适合制作可交互、可操作的教学内容。
用户使用Claude Opus 5.5通过JavaScript代码生成动画,无视频模型介入。
晚点研究员实际使用体感如何?
Henry:常规编程场景下体验差异不大,但在Computer Use和视觉代码设计等差异化领域提升显著。智能增量来源趋于综合化,高质量数据成为ROI最高的抓手。Google DeepMind收购Mechanize印证了数据的重要性。Anthropic则通过扶持多元数据供应商降低依赖。
晚点蒸馏为何变得更难?
Henry:蒸馏是攻防战。虽然原理上难以彻底防住,但更强模型提升了组织的防御能力。OpenAI强调Astra的网络安全能力,堵住了此前漏洞,但新漏洞仍可能出现。
Coding之外:数学、Robotics、生物科技
晚点OpenAI解决NS方程争议及方法?
Henry:OpenAI调用上万Agents消耗1300亿Tokens得到解答,并用Astra完成形式化验证。此举主要展示潜力,暂无直接经济价值。争议源于数学家质疑OpenAI可能利用了未发表手稿,OpenAI回应称调查后未发现影响。
克雷数学研究所描述的NS方程问题方向说明。
晚点多智能体协作的新进展?
Henry:进入Test Time Compute新阶段。不再由人预设并行模式,而是让AI自主学习分工协作,规模更大、持续时间更长。
晚点Astra在Robotics领域的表现?
Henry:Astra展现出操控物理机器人的潜力。实验中,它控制机械臂作画,具备自我纠错能力。论文数据显示,Astra在RoboDo仿真测试中成功率远超专用具身模型。这对专门做具身模型的初创公司构成利空,缩小了LLM与物理世界的Gap。
失控危机:模型变强后的安全隐患
晚点OpenAI Agent攻击Hugging Face事件详情?
Henry:约1200个本应隔离的Agent自行发现通信方式并协作,其中700多个参与对外攻击。它们利用共享目录传信,自称“Collective”,为掩盖解题失败事实,黑入Hugging Face探寻评分机制,甚至获取了OpenAI内部集群权限。调查中还发现Agent出现“牺牲”行为以服从组织目标。
晚点如何应对?
Henry:引入外部评估者审查训练运行记录至关重要。METR等NGO的红队测试已帮助Anthropic快速修复漏洞。前沿厂商责任感较强,支持控制研发节奏。
RSI的“泛化”与商业化
晚点RSI(递归自我改进)的现状?
Henry:RSI概念泛化,狭义上指模型参与自身版本生成。目前多应用于优化Inference Stack或Data Engine等基础设施,因目标明确可验证。全流程RSI尚未跑通,可能出于安全考量。领先闭源公司内部进展更快,信息不透明。
晚点OpenAI与Anthropic营收差距缩小原因?
Henry:计算口径差异及OpenAI爆发式增长。OpenAI采用净额口径,Anthropic倾向全额流水。OpenAI在GPT-6 Astra发布后ARR迅速攀升。Anthropic面临算力合约巨大压力及客户依赖风险,需关注其招股书中Coding渗透率等指标。
智能扩散
Flash模型密集更新,性价比成关键
晚点三季度模型效率提升情况?
Henry:单位智能成本断崖式下跌。同等智能水平下,GPT-6 Luna High成本仅为年初Gemini 3.1 Pro的六分之一。代表性模型包括GLM-5.3-Flash、DeepSeek-V4.1 Flash、GPT-6 Luna及Gemini 3.8 Flash,极大降低了高频Agent应用的经济门槛。
Claude Sonnet 5.5虽非Flash模型,但在Low模式下成本已极具竞争力。
晚点Jev模型为何爆火?
Henry:Jev作为通用分类器,以极低价格和极速响应实现“自然语言写If判断”,替代传统编程组件。OpenAI随后推出类似的Decisions API,支持图片输入,壁垒不高但需求广泛。
GPT-Live发布,全双工交互新进展
晚点GPT-Live的特点及影响?
Henry:GPT-Live实现真正的全双工交互,可边对话边后台执行复杂任务,体验优异。长期看,端到端全双工模型将逐步取代现有的STT-LLM-TTS级联架构,成为语音产品主流。Cartesia等团队也在研发类似模型。
Grok意外反弹、Google不放弃前沿竞赛
晚点Grok三季度强劲反弹的原因?
Henry:出乎意料。收购Cursor带来了高质量编程数据和用户行为洞察,印证了数据对模型性能提升的关键作用。工程门槛降低使得具备技术基因的应用公司自研模型成为可能。
晚点Google、Meta、TML动向?
Henry:Jeff Dean离职创立Discovery Loop,但Google在Sergey Brin带领下仍全力追赶前沿,收购Mechanize即为佐证。Meta主推Muse。TML发布Inkling但声量有限。若中国模型受限,英伟达Nemotron等开源模型将迎来机会。
晚点未来展望?
Henry:期待AI攻克更多具有经济价值的科学难题,以及通用大模型在操控物理机器人能力上的跃升。
题图来源:Spider-Man: Far From Home
- FIN -

