大数跨境

最新混元Hy3,DeepSeek-V4-Pro,Qwen3.7-Max实测,谁才是性价比之王?

最新混元Hy3,DeepSeek-V4-Pro,Qwen3.7-Max实测,谁才是性价比之王? 郭震AI
2026-07-08
6
你好,我是郭震

近期 DeepSeek-V4 价格上调,许多读者关注是否存在兼具高性价比与高性能的大模型替代方案。经调研对比主流模型定价:

  • DeepSeek-V4-Pro:输入 3 元/百万 tokens,输出 6 元/百万 tokens;
  • Qwen3.7-Max:输入约 12 元/百万 tokens,输出 36 元/百万 tokens;
  • 腾讯混元 Hy3:输入 1 元/百万 tokens,输出 4 元/百万 tokens。

目前腾讯混元 Hy3 定价最低,但其核心能力,尤其是用户关注的 Coding Agent 表现尚待验证。本文将通过实测重点评估其 Agent 能力。

Hy3 大模型概况

此前已对 DeepSeek-V4-Pro、Qwen3.7-Max 及 GLM5.2 等模型进行过实测。腾讯最新推出的 Hy3 大模型重点强化了 Agent 与 Coding 能力,涵盖任务规划、工具调用及代码生成等维度。

官方评测数据显示,Hy3 在反映 Agent 能力的 BrowseComp、MCP Atlas、ClawEval 和 SkillsBench 等基准测试中表现优异:

然而,基准得分仅供参考,实际应用场景中的表现更为关键。不同大模型各具优势,需通过真实任务实测以明确其强项。

测试方法:将同一 Agent 任务分别提交给 Hy3、DeepSeek-V4-Pro 和 Qwen3.7-Max,并邀请 Gemini-3.1-Pro 和 Codex 作为裁判进行打分。

任务一:3D 飞行躲避小游戏开发

首组测试聚焦 Coding Agent 能力,选取偏向前端交互与视觉呈现的任务。提示词要求模型生成一个基于 Three.js 的单文件 3D 飞行躲避游戏,包含自动飞行、移动控制、障碍物躲避、能量收集、计分系统及难度递增等功能,且不依赖外部资源。

该任务旨在检验模型能否将复杂的前端交互需求拆解为完整模块,并一次性生成可运行、可交互且状态闭环的代码,这比单纯问答更贴近真实开发场景。

1. Hy3 实测结果

在 WorkBuddy 中选择 Hy3 模型并输入提示词:

等待生成结果:

任务完成截图:

游戏互动效果演示(GIF):

2. DeepSeek-V4-Pro 实测结果

使用相同提示词测试 DeepSeek-V4-Pro:

生成结果截图:

运行录屏演示(GIF):

3. Qwen3.7-Max 实测结果

使用相同提示词测试 Qwen3.7-Max:

生成结果截图:

运行录屏演示(GIF):

该项任务的具体评分将在第四节统一公布。

任务二:Excel 数据分析微信小程序开发

第二组测试聚焦 Working Agent 能力,模拟办公生产力场景。任务要求模型基于 Excel 文件生成一个微信小程序版数据分析看板,支持文件上传、字段识别、汇总计算,并展示核心指标卡片、趋势图、分类对比图及数据洞察。

此为典型的多步骤 Agent 任务,不仅涉及代码生成,还需理解小程序目录结构,拆分页面、脚本与样式,并将 Excel 数据转换为前端适用的数据结构。

1. Hy3 实测结果

Hy3 生成的微信小程序工程文件结构:

项目结构展示:

使用微信开发者工具导入项目(Test Account):

导入 Excel 文件并展示数据:

手机端数据可视化预览效果:

2. DeepSeek-V4-Pro 实测结果

DeepSeek-V4-Pro 生成的项目结构:

小程序启动界面及导入流程:

测试发现,DeepSeek-V4-Pro 在导入 Excel 后提示未能提取有效数据,存在明显 Bug。虽可通过后续调试修复,但此处不再展开。

3. Qwen3.7-Max 实测结果

WorkBuddy 默认未集成 Qwen3.7-Max,需手动配置 API Base 与 API Key。配置后生成的项目结构如下:

微信开发者工具中的运行效果(首页、加载页、数据概览):

可视化图表及数据预览:

专业裁判打分分析

任务一评分:由 Gemini-3.1-Pro 对三个模型生成的 HTML 文件进行评判。

最终得分:

结果显示,Hy3 以微弱优势位列第一,Qwen3.7-Max 第二,DeepSeek-V4-Pro 第三。三者分差极小且总分均高,表明各模型在该任务上完成度优秀。

任务二评分:鉴于该任务为完整工程项目,采用 Codex 作为裁判,全面分析项目完成度。

Codex 给出的三项细分得分:

数据显示,Hy3 在"Excel 导入与解析稳定性”及“数据分析与洞察完整度”两项中夺得第一;Qwen3.7-Max 则在“可视化与交互呈现”方面表现最佳。该结果与前文实测展示情况高度吻合。

总结与建议

本次实测涵盖两个真实 Agent 场景:3D 小游戏开发(Coding Agent)与 Excel 数据分析小程序(Working Agent)。参测模型包括参数量 295B 的混元 Hy3、1600B 的 DeepSeek-V4-Pro 以及参数量超万亿的 Qwen3.7-Max。

尽管 Hy3 模型尺寸最小,但在两项 Agent 任务中的表现已追平甚至超越更大参数的竞品。结合价格因素,Hy3 的 API 成本显著更低:输入价格为 Qwen3.7-Max 的 1/12,输出价格仅为对方的 1/9。

结论:Hy3 在性能与成本之间取得了最佳平衡,性价比最为突出,适合作为高频调用的主力模型。

目前 WorkBuddy 平台已支持 Hy3 免费试用,感兴趣的开发者可立即体验:

全文共计 2065 字,配图 34 张。若本文对您有所助益,欢迎点赞、转发与在看。

【声明】内容源于网络
0
0
郭震AI
郭震,工作8年后到美读AI博士,努力分享一些最新且有料的AI。
内容 1467
粉丝 1
郭震AI 郭震,工作8年后到美读AI博士,努力分享一些最新且有料的AI。
总阅读66.7k
粉丝1
内容1.5k