大数跨境

腾讯Hy4-preview大模型深度评测: 开源创新可用, 免费2周, 前端能力看齐Kimi?

腾讯Hy4-preview大模型深度评测: 开源创新可用, 免费2周, 前端能力看齐Kimi? 刀哥聊AI
2026-08-29
23

AI 评测 · 刀哥聊AI

腾讯Hy4-preview大模型 深度评测:
开源创新可用,免费2周,前端能力看齐Kimi?

8月28日,腾讯混元扔出了一颗重磅炸弹,
新一代大模型 Hy4-preview 正式发布并开源。4000字,阅读需要10分钟

这是继7月Kimi K3、8月初Qwen3.8-Max、GLM-5.3之后,国内开源大模型阵营的又一次重要迭代。


作为一名从凌晨蹲到发布,又在WorkBuddy里连肝十几个小时的AI爱好者,我想用这篇4000字的长文,把Hy4-preview到底是个什么水平、值不值得用,讲清楚。



划重点 · 三项科幻级设定

第一,递归自我改进闭环——AI自己出题、考试、改错,形成无限循环。

第二,自主优化推理基础设施——AI改造自己的灶台,吞吐量提升 31.8%

第三,AI研究员能力——像博导一样协调多个Codex并行实验,效率远超独立探索。

一、三项科幻设定般的开创性贡献

如果把以前的AI大模型比作被喂饭的学霸,那Hy4-preview最大的突破就是:它开始自己给自己做饭、自己给自己看病、甚至自己给自己盖厨房了。

腾讯官方给Hy4-preview总结了三项开创性贡献。听着很技术,但其实每一个都特别有画面感。

  • 第一项:递归自我改进闭环。
    你可以把它理解为AI考上了自己的培训班。传统的大模型训练,是人类工程师定方法、人类工程师挑数据、人类工程师搭评测,模型像个学生一样被动接受训练。而Hy4-preview这次第一次参与了自己训练方法、数据策略、评估体系和底层算子的自动优化。
  • 第二项:自主优化推理基础设施。
    这一项更离谱——它相当于AI不仅学会了炒菜,还学会了改造灶台。Hy4-preview能自己分析推理系统的瓶颈,围绕算子融合、通信优化等方向开展多轮优化,把端到端吞吐量相较基线提升了31.8%
  • 第三项:AI研究员能力。
    这是三项里最有科幻感的一个。Hy4-preview可以像研究者一样同时管理多个Codex Session开展实验,并根据结果持续调整方向。官方测试中,它作为研究组长协调多个Codex并行优化,最终8项评测全部优于Codex独立探索。

这三项贡献合在一起,描绘了一个清晰的未来图景:AI正在从工具变成能自我进化的生产力系统。当然,Hy4-preview还只是一个preview版本,腾讯自己也承认它还有长思考和过度自我验证的问题,但这个方向本身足够重要。

二、跟Kimi K3和Opus 5比:不是更大,而是更专

很多人看到Hy4-preview的参数规模会问:770B总参数、49B激活参数,跟Kimi K3的2.8万亿参数比起来是不是差远了?

答案是:参数确实小很多,只是kimi的四分之一(2800B),但真实能力差距没有数字看上去那么夸张。

先看跟Kimi K3的对比。Kimi K3是目前全球参数最大的开源模型,2.8万亿总参数、104B激活参数,原生支持视觉理解,定位是全能旗舰。

Hy4-preview跟它比起来,更像是一个偏科但单科成绩很能打的选手。在腾讯组织的163名内部专家、203个工程任务盲测中,Hy4-preview均分2.99/4,略高于Kimi K3的2.94/4,胜负关系是胜51.2%、平7.9%、负40.9%。

再看跟Claude Opus 5的差距。Opus 5是Anthropic 7月24日发布的旗舰模型,也是目前AI编程和复杂任务的天花板之一。Hy4-preview跟它相比,差距是结构性的。

在Terminal Bench 2.1上,Hy4-preview拿到了85.4分,官方宣称与Opus 5持平;在SWE Atlas Refactoring、PostTrainBench、Toolathlon-Verified等任务上已经逼近Opus 5所在的区间。


但短板同样明显:在ProgramBench上,Hy4-preview只有17.5分,而Opus 5是39.5;在HLE纯文本任务上,Hy4-preview是43.4,Opus 5远高于此;在DeepSWE上,Hy4-preview也明显落后于Opus 5和Kimi K3。

总结一句话:Hy4-preview已经稳稳进入国产开源第一梯队,部分单项能跟Opus 5掰手腕,但综合能力仍有可见差距。它要精准卡位:把自己放在了代码、办公、游戏、科研这些生产力场景上。

三、跟Hy3比:脱胎换骨,代际跃升

Hy3正式发布50多天,worbuddy上一直免费,但是真的弱的不行,完全不如deepseek。Hy4-preview这次的进步幅度可以说是激进。

  • 参数规模:
    Hy3总参数295B、激活参数21B、上下文256K;Hy4-preview直接拉到770B总参数、49B激活参数、1M上下文。总参数翻了约2.6倍,激活参数翻倍还多,上下文长度翻了4倍。
  • 基准成绩:
    最亮眼的是Terminal Bench 2.1,从Hy3的约70.8分暴涨到85.4分,一下追平Opus 5;DeepSWE从28.0分跳到64.3分,翻了2.3倍。在12项基准测试中,Hy4-preview相对Hy3实现了全面的代际飞跃。
  • 场景能力:
    Hy3宣称已经能处理较复杂的代码和Agent任务,但Hy4-preview在真实生产力上走得更深。它增强了长程开发任务的理解、规划、调试与验证能力,提升了前端开发的视觉审美和交互质量,优化了办公分析、金融建模、跨文件协作,还强化了游戏原型生成和科学研究能力。

腾讯自己的定位也很清楚:Hy4-preview是为生产力而生的模型。它不是要做另一个聊天机器人,而是要嵌进软件工程、游戏开发、金融分析、安全研究这些真实工作流里。

四、部署最低配置:开源是真的,但个人跑不动。。。

Hy4-preview是开源的,Apache 2.0协议,权重和代码都公开,可以免费商用。这点要给腾讯点赞。但开源不等于个人能跑,大约需要770GB的显卡!

首先,模型文件体积巨大:BF16原始权重大约1.42 TiB(约1.5TB),FP8量化版大约760GB。实际推理需要多卡张量并行,并且对GPU架构有要求——FP8路径需要SM100架构支持。

社区里有人算过账:4张32GB显卡只有128GB显存,远远不够;4张48GB显卡192GB,仍然差得远;8张80GB显卡640GB,依然低于FP8权重本身的770GB占用。再加上MLA KV Cache、运行时开销等,实际需要的配置只会更高。

所以结论是:本地完整部署Hy4-preview,基本是企业和大型工作室的事,个人开发者别折腾,直接用云API更划算。


腾讯云TokenHub和OpenRouter都提供了API,价格是输入6元/百万tokens、输出18元/百万tokens、缓存命中0.3元/百万tokens。

而且WorkBuddy/CodeBuddy现在还有两周限免,普通用户完全够用了。

五、实测表现:前端惊艳,复杂任务仍在排队

接下来是我个人最关心的部分——实际用起来到底怎么样?我挑了几个有代表性的任务做了实测,结果如下。

  • 1 水果忍者:完美实现。
    一次跑通,视觉效果和交互流畅度都在线。
  • 我本来想拿deepseek跟它比的,结果完全不行,两次返工都是bug,黑屏。只能把标题换成kimi。kimi-k3仍然是国产顶流,也是一次成功。

  • 但是Hy4-preview的水果UI还是明显超过了kimi,Hy4-preview有点东西。
  • 2 旋转六边形弹球:完成度超过DeepSeek
    物理稳定,球不穿墙不卡边。

  • deepseek六边形都没给我画出来

  • 3 GBA比卡丘回合游戏:实现完美
    战斗逻辑、回合切换、状态判定都到位。

  • 4 GBA模拟器:完成度及格线
    有框架、能演示,但功能和体验还是差一些。Kimi也不能很好复刻他们的宣传视频。

  • 5 图片文字和动物图炸开、替换:50分钟未完成,排队。

  • 我用的是字节的一个很不错的宣传视频,做复刻评测:


  • (凌晨和早8点前还行,目前基本是个瘫痪状态)

  • 50分钟没完成,我觉得视觉多模态能力还有明显短板。
  • 这个Kimi-K3 十分钟左右竟然完美完成了:

  • 我之前为了做这个动画,写了两千字提示词给Kimi-K2.7,这次完全不需要多余提示词,真的膜拜Kimi-K3。

  • 6 企业私有化Agent执行系统:单次指令完成度及格,需要二次开发
    适合做第一版生成器Demo,完整功能即使给了详细的技术设计文档,也需要多次迭代。

六、总结:什么场景值得用?还有哪些要提高?

值得用的场景

  • 前端开发和游戏原型(WebDev Arena开源模型第3名)
  • 长上下文办公分析(1M上下文处理超长文档、财报、代码库)
  • 代码智能体和软件工程任务(Terminal Bench、DeepSWE、Toolathlon成绩亮眼)
  • 中小企业和个人开发者尝鲜(两周限免+云API)

还需要提高的地方

  • 多模态视觉能力(图像理解和复杂视觉编辑不够强)
  • 从零架构复杂系统的能力(ProgramBench低分说明更擅长在已有框架里执行)
  • 长任务中的过度思考和自我验证(复杂任务下会变慢)
  • 私有化部署门槛太高(普通开发者基本跑不动)

📌 刀哥结语

到今天,可以说,腾讯终于有一款自己的国产一流模型了,可用好用。


Hy4-preview是一个定位非常清晰、进步非常扎实的模型。它用770B的参数规模,在多个真实生产力场景里打出了接近甚至超过2.4T/2.8T对手的效果,这本身就是一种能力。姚顺雨这次交的作业,分数80+!

如果你是开发者、产品经理、独立创作者,或者只是单纯想体验国产AI的最新进展,这两周限免非常值得上车。用它来生成前端原型、处理长文档、做办公自动化,你会明显感受到它比上一代的Hy3强了一大截。但如果你期待它现在就能完全替代资深程序员、设计师或架构师,那还为时尚早。


(可以从元宝失利、HY3差评的阴影里出来了吧!)

Hy4-preview最大的意义,或许不是它今天有多强,而是它展示了一个方向:AI不再只是被动接受训练的工具,它开始参与自身的进化、基础设施的优化,甚至像研究员一样组织实验。

AI是万能锤子,这次它开始自己找钉子了。这个方向如果跑通,正式版的Hy4可能会给我们带来更大的惊喜。





【声明】内容源于网络
0
0
刀哥聊AI
大厂经历,出海视野,深耕AI圈。新鲜新闻、实用工具、硬核技术解读,有深度有实践,带你玩转AI。
内容 188
粉丝 0
刀哥聊AI 大厂经历,出海视野,深耕AI圈。新鲜新闻、实用工具、硬核技术解读,有深度有实践,带你玩转AI。
总阅读12.8k
粉丝0
内容188