AI 评测 · 刀哥聊AI
腾讯Hy4-preview大模型 深度评测:
开源创新可用,免费2周,前端能力看齐Kimi?
8月28日,腾讯混元扔出了一颗重磅炸弹,
新一代大模型 Hy4-preview 正式发布并开源。4000字,阅读需要10分钟
这是继7月Kimi K3、8月初Qwen3.8-Max、GLM-5.3之后,国内开源大模型阵营的又一次重要迭代。
作为一名从凌晨蹲到发布,又在WorkBuddy里连肝十几个小时的AI爱好者,我想用这篇4000字的长文,把Hy4-preview到底是个什么水平、值不值得用,讲清楚。
划重点 · 三项科幻级设定
第一,递归自我改进闭环——AI自己出题、考试、改错,形成无限循环。
第二,自主优化推理基础设施——AI改造自己的灶台,吞吐量提升 31.8%。
第三,AI研究员能力——像博导一样协调多个Codex并行实验,效率远超独立探索。
一、三项科幻设定般的开创性贡献
如果把以前的AI大模型比作被喂饭的学霸,那Hy4-preview最大的突破就是:它开始自己给自己做饭、自己给自己看病、甚至自己给自己盖厨房了。
腾讯官方给Hy4-preview总结了三项开创性贡献。听着很技术,但其实每一个都特别有画面感。
- ✦第一项:递归自我改进闭环。
你可以把它理解为AI考上了自己的培训班。传统的大模型训练,是人类工程师定方法、人类工程师挑数据、人类工程师搭评测,模型像个学生一样被动接受训练。而Hy4-preview这次第一次参与了自己训练方法、数据策略、评估体系和底层算子的自动优化。 - ✦第二项:自主优化推理基础设施。
这一项更离谱——它相当于AI不仅学会了炒菜,还学会了改造灶台。Hy4-preview能自己分析推理系统的瓶颈,围绕算子融合、通信优化等方向开展多轮优化,把端到端吞吐量相较基线提升了31.8%。 - ✦第三项:AI研究员能力。
这是三项里最有科幻感的一个。Hy4-preview可以像研究者一样同时管理多个Codex Session开展实验,并根据结果持续调整方向。官方测试中,它作为研究组长协调多个Codex并行优化,最终8项评测全部优于Codex独立探索。
这三项贡献合在一起,描绘了一个清晰的未来图景:AI正在从工具变成能自我进化的生产力系统。当然,Hy4-preview还只是一个preview版本,腾讯自己也承认它还有长思考和过度自我验证的问题,但这个方向本身足够重要。
二、跟Kimi K3和Opus 5比:不是更大,而是更专
很多人看到Hy4-preview的参数规模会问:770B总参数、49B激活参数,跟Kimi K3的2.8万亿参数比起来是不是差远了?
答案是:参数确实小很多,只是kimi的四分之一(2800B),但真实能力差距没有数字看上去那么夸张。
先看跟Kimi K3的对比。Kimi K3是目前全球参数最大的开源模型,2.8万亿总参数、104B激活参数,原生支持视觉理解,定位是全能旗舰。
Hy4-preview跟它比起来,更像是一个偏科但单科成绩很能打的选手。在腾讯组织的163名内部专家、203个工程任务盲测中,Hy4-preview均分2.99/4,略高于Kimi K3的2.94/4,胜负关系是胜51.2%、平7.9%、负40.9%。
再看跟Claude Opus 5的差距。Opus 5是Anthropic 7月24日发布的旗舰模型,也是目前AI编程和复杂任务的天花板之一。Hy4-preview跟它相比,差距是结构性的。
在Terminal Bench 2.1上,Hy4-preview拿到了85.4分,官方宣称与Opus 5持平;在SWE Atlas Refactoring、PostTrainBench、Toolathlon-Verified等任务上已经逼近Opus 5所在的区间。
但短板同样明显:在ProgramBench上,Hy4-preview只有17.5分,而Opus 5是39.5;在HLE纯文本任务上,Hy4-preview是43.4,Opus 5远高于此;在DeepSWE上,Hy4-preview也明显落后于Opus 5和Kimi K3。
总结一句话:Hy4-preview已经稳稳进入国产开源第一梯队,部分单项能跟Opus 5掰手腕,但综合能力仍有可见差距。它要精准卡位:把自己放在了代码、办公、游戏、科研这些生产力场景上。
三、跟Hy3比:脱胎换骨,代际跃升
Hy3正式发布50多天,worbuddy上一直免费,但是真的弱的不行,完全不如deepseek。Hy4-preview这次的进步幅度可以说是激进。
- ◆参数规模:
Hy3总参数295B、激活参数21B、上下文256K;Hy4-preview直接拉到770B总参数、49B激活参数、1M上下文。总参数翻了约2.6倍,激活参数翻倍还多,上下文长度翻了4倍。 - ◆基准成绩:
最亮眼的是Terminal Bench 2.1,从Hy3的约70.8分暴涨到85.4分,一下追平Opus 5;DeepSWE从28.0分跳到64.3分,翻了2.3倍。在12项基准测试中,Hy4-preview相对Hy3实现了全面的代际飞跃。 - ◆场景能力:
Hy3宣称已经能处理较复杂的代码和Agent任务,但Hy4-preview在真实生产力上走得更深。它增强了长程开发任务的理解、规划、调试与验证能力,提升了前端开发的视觉审美和交互质量,优化了办公分析、金融建模、跨文件协作,还强化了游戏原型生成和科学研究能力。
腾讯自己的定位也很清楚:Hy4-preview是为生产力而生的模型。它不是要做另一个聊天机器人,而是要嵌进软件工程、游戏开发、金融分析、安全研究这些真实工作流里。
四、部署最低配置:开源是真的,但个人跑不动。。。
Hy4-preview是开源的,Apache 2.0协议,权重和代码都公开,可以免费商用。这点要给腾讯点赞。但开源不等于个人能跑,大约需要770GB的显卡!
首先,模型文件体积巨大:BF16原始权重大约1.42 TiB(约1.5TB),FP8量化版大约760GB。实际推理需要多卡张量并行,并且对GPU架构有要求——FP8路径需要SM100架构支持。
社区里有人算过账:4张32GB显卡只有128GB显存,远远不够;4张48GB显卡192GB,仍然差得远;8张80GB显卡640GB,依然低于FP8权重本身的770GB占用。再加上MLA KV Cache、运行时开销等,实际需要的配置只会更高。
所以结论是:本地完整部署Hy4-preview,基本是企业和大型工作室的事,个人开发者别折腾,直接用云API更划算。
腾讯云TokenHub和OpenRouter都提供了API,价格是输入6元/百万tokens、输出18元/百万tokens、缓存命中0.3元/百万tokens。
而且WorkBuddy/CodeBuddy现在还有两周限免,普通用户完全够用了。
五、实测表现:前端惊艳,复杂任务仍在排队
接下来是我个人最关心的部分——实际用起来到底怎么样?我挑了几个有代表性的任务做了实测,结果如下。
- 1 水果忍者:完美实现。
一次跑通,视觉效果和交互流畅度都在线。 -
-
我本来想拿deepseek跟它比的,结果完全不行,两次返工都是bug,黑屏。只能把标题换成kimi。kimi-k3仍然是国产顶流,也是一次成功。 -
-
但是Hy4-preview的水果UI还是明显超过了kimi,Hy4-preview有点东西。
-
2 旋转六边形弹球:完成度超过DeepSeek 物理稳定,球不穿墙不卡边。 -
-
deepseek六边形都没给我画出来 -
- 3 GBA比卡丘回合游戏:实现完美
战斗逻辑、回合切换、状态判定都到位。 -
- 4 GBA模拟器:完成度及格线
有框架、能演示,但功能和体验还是差一些。Kimi也不能很好复刻他们的宣传视频。 -
- 5 图片文字和动物图炸开、替换:50分钟未完成,排队。
- 我用的是字节的一个很不错的宣传视频,做复刻评测:

- (凌晨和早8点前还行,目前基本是个瘫痪状态)
50分钟没完成,我觉得视觉多模态能力还有明显短板。 -
这个Kimi-K3 十分钟左右竟然完美完成了: -
-
我之前为了做这个动画,写了两千字提示词给Kimi-K2.7,这次完全不需要多余提示词,真的膜拜Kimi-K3。 -
-
- 6 企业私有化Agent执行系统:单次指令完成度及格,需要二次开发
适合做第一版生成器Demo,完整功能即使给了详细的技术设计文档,也需要多次迭代。 -
六、总结:什么场景值得用?还有哪些要提高?
值得用的场景
-
前端开发和游戏原型(WebDev Arena开源模型第3名) -
长上下文办公分析(1M上下文处理超长文档、财报、代码库) -
代码智能体和软件工程任务(Terminal Bench、DeepSWE、Toolathlon成绩亮眼) -
中小企业和个人开发者尝鲜(两周限免+云API)
还需要提高的地方
-
多模态视觉能力(图像理解和复杂视觉编辑不够强) -
从零架构复杂系统的能力(ProgramBench低分说明更擅长在已有框架里执行) -
长任务中的过度思考和自我验证(复杂任务下会变慢) -
私有化部署门槛太高(普通开发者基本跑不动)
📌 刀哥结语
到今天,可以说,腾讯终于有一款自己的国产一流模型了,可用好用。
Hy4-preview是一个定位非常清晰、进步非常扎实的模型。它用770B的参数规模,在多个真实生产力场景里打出了接近甚至超过2.4T/2.8T对手的效果,这本身就是一种能力。姚顺雨这次交的作业,分数80+!
如果你是开发者、产品经理、独立创作者,或者只是单纯想体验国产AI的最新进展,这两周限免非常值得上车。用它来生成前端原型、处理长文档、做办公自动化,你会明显感受到它比上一代的Hy3强了一大截。但如果你期待它现在就能完全替代资深程序员、设计师或架构师,那还为时尚早。

(可以从元宝失利、HY3差评的阴影里出来了吧!)
Hy4-preview最大的意义,或许不是它今天有多强,而是它展示了一个方向:AI不再只是被动接受训练的工具,它开始参与自身的进化、基础设施的优化,甚至像研究员一样组织实验。
AI是万能锤子,这次它开始自己找钉子了。这个方向如果跑通,正式版的Hy4可能会给我们带来更大的惊喜。

