上周,阿里云扔了个“核弹”。
他们发布了Qwen3.5 MoE模型,白纸黑字写着:在部分任务上,性能超越了OpenAI的GPT-5.2和Anthropic的Claude 4.5 Opus。
消息一出,圈内直接炸了。有人狂喜“国产之光”,有人冷笑“营销碰瓷”。但如果你只盯着“谁吊打谁”的口水战,那就彻底错过了重点。
这根本不是一场简单的模型性能赛跑。
这是一场关于AI未来形态的路线宣战,而阿里这步棋背后,藏着一个比超越GPT重要100倍的野心。
一场精心设计的“选择性超越”
先别急着高潮或嘲讽,我们拆开看看阿里到底“超越”了什么。
他们用了超过30个基准测试来对比。最亮眼的成绩在IFBench上,这是一个专门评测大模型“遵循用户指令”能力的榜单。在这里,Qwen3.5确实拿了第一。
但如果你仔细看其他项目,故事就复杂了。比如在HMMT推理基准上,它赢了Claude 4.5,却输给了GPT-5.2。
这说明了什么?
阿里非常聪明地选择了一个当前AI应用最痛、也最体现“可用性”的维度来建立优势。 指令遵循能力,直接决定了模型能不能听懂人话,老老实实按你的要求办事。这恰恰是很多炫酷大模型落地时变成“人工智障”的命门。
他们没去硬刚GPT最擅长的通用推理或创意写作,而是瞄准了“工程化能力”这个靶心。
这就像两个学生考试,一个门门90分,另一个语文85、数学95,但拍着胸脯说:“老师,我执行力最强,你让我干啥我保证不出错。” 阿里扮演的就是后者。
更关键的是技术路径:Qwen3.5是一个3970亿参数的MoE(混合专家)模型,每次调用只激活170亿参数。这意味着它的成本可能远低于动辄全参数运行的对手。
大厂的算盘,打得比你想的精。 他们追求的不是实验室里的满分试卷,而是一个在性能和成本之间取得最佳平衡、能快速铺进千万企业的“商用引擎”。
真正的战场,早已不在“模型”本身
但如果你认为阿里的目标只是造一个更便宜、更听话的GPT平替,那就太天真了。
看看同时期在发生什么。
就在最近,GitHub上像雨后春笋一样冒出一大堆像 PhoneClaw 这样的开源项目。这东西本质上是一个AI手机自动化代理,能让AI直接控制你的安卓手机——读屏、点击、打字、执行多步骤任务。
这只是一个缩影。过去三个月,围绕AI代理(Agent)的开发工具、托管平台、安全框架,出现了上百个。一个庞大的、去中心化的“AI手脚”生态,正在疯狂生长。
而大洋彼岸,OpenAI在干嘛?他们一边迭代GPT,一边全力推进“ChatGPT实时语音”、“AI助理深度集成操作系统”。Anthropic则在死磕长上下文和宪法AI,追求极致的安全与可靠。
发现区别了吗?
中美AI,正在走向两条截然不同的路。
美国巨头们,依然在执着地锻造更强大、更通用的“AI大脑”。而中国的战场,嗅觉敏锐的玩家们,已经开始疯狂地为这个大脑制造“手脚”、搭建“躯干”、规划“行动网络”。
阿里发布Qwen3.5,根本意图不是去OpenAI的主场打败它,而是为自己的生态,提供一个足够好用的“本地大脑”。
生态的战争:大脑与手脚的合谋
为什么“手脚”比“大脑”更重要?
想想移动互联网时代。苹果做出了最惊艳的iPhone(大脑),但真正造就万亿生态的,是App Store里那千万个应用(手脚)。没有这些“手脚”,iPhone只是一部昂贵的音乐播放器。
今天的AI,正处于“iPhone诞生,但App Store还没影”的混沌前夜。大家都有了大语言模型这个“大脑”,但让大脑真正去改变世界,需要无数个像PhoneClaw这样的“手脚”去连接具体场景:自动处理工单、分析财报、操控软件、管理智能家居。
谁掌握了“手脚”的生态,谁就掌握了AI时代的水和电。
这就是阿里最深的焦虑,也是它最大的机会。
作为中国最大的云厂商和商业操作系统,阿里比谁都清楚“生态”的力量。淘宝不是赢在技术多牛,而是赢在让千万商家在这里赚钱。现在,它想复刻这个逻辑:通过开源一个“足够好用且免费”的Qwen3.5,吸引全球开发者都来为它的AI生态开发“手脚”。
这步棋,是对腾讯混元、百度文心的一大截击,更是对国内AI创业公司的一次“生态收编”。当大家都用通义千问的模型做Agent时,阿里就成了规则的制定者。
黄仁勋说“AI的iPhone时刻已经到来”。但张一鸣和马云早就教过我们:在中国,“山寨机”和“应用商店”的战争,往往比“iPhone首发”更血腥,也更有油水。
泡沫与未来:Agent是金矿还是坟场?
毫无疑问,AI代理是2024年最火的风口。但每一个风口都伴随着巨大的泡沫。
现在的情况是,“大脑”的能力还没完全突破,“手脚”的创业公司已经估值上天。 很多所谓的AI Agent,无非是把GPT的API包装一层,做个聊天界面,就敢宣称“颠覆工作流”。这像极了2016年遍地开花的“区块链+”。
真正的硬骨头在于:可靠性、安全性、成本。
PhoneClaw这样的项目很酷,但让它真正替代人类操作手机,需要解决误触、权限、复杂场景理解等一系列地狱级难题。这需要长期、枯燥的工程打磨,而不是套个LLM就能速成。
大厂和创业公司在这里面临不同的命运。
对于创业公司,机会在于找到一个极其垂直、场景封闭、价值明确的痛点,做出一个“超级手脚”。比如,专门帮电商客服自动处理退款,或者帮设计师自动切图标注。想做个“万能助理”?那几乎是留给阿里、腾讯们的终局游戏。
对于阿里这样的大厂,挑战在于如何忍住“我全都要”的冲动,真正把生态做开放。如果一边用开源模型吸引开发者,一边又用自己的云服务、自家应用去掐尖最好的Agent,那最终只会催生出一批依附的“藤壶”,而非共生的雨林。
所有的生态繁荣,本质上都是利益分配的智慧。
一句戳破
所以,别再问“Qwen3.5到底有没有超越GPT-5”这种天真的问题了。
当阿里在炫耀基准测试分数时,它眼里看的,根本不是旧王座上的OpenAI,而是下一个时代——那个由无数个“AI手脚”构建的、虚实融合的新世界。
它的刀,已经挥向了生态的王座。
这场战争里,模型是粮草,代理是兵马,而开发者,才是决定江山归属的民心。
你现在是准备去造一把更锋利的刀,还是去成为那个运筹帷幄、分发兵器的人?
---
(正文结束)

