大数跨境

我用一枚火箭面试 6 个 AI:谁最适合当 3D 动画制作数字员工?

我用一枚火箭面试 6 个 AI:谁最适合当 3D 动画制作数字员工? AI智能体研究
2026-07-21
3
导读:​

这篇文章原本不在数字员工第一季的主线计划里。

7 月 16 日,Kimi Code 的官方更新记录: https://www.kimi.com/code/docs/en/kimi-code/whats-new.html把 Kimi K3 列为新发布模型。随后几天,我连续看到关于 K3 的讨论。它到底比上一代强在哪里、适合做什么,很快成了这一轮国产模型更新里最热的话题之一。

更巧的是,K3 的官方技术博客: https://www.kimi.com/fr-fr/blog/kimi-k3专门提到了一类“软件工程 + 视觉推理”的任务,包括游戏开发、前端和 CAD。

这不等于它已经证明自己会做好 3D 动画,但正好给了我一个值得验证的问题:

  
  
  
如果我要招聘一个 3D 动画制作数字员工, 刚发布的 K3 真能比上一代和其他国产模型交出更好的成片吗?

我原本就准备给数字员工增加一个 3D 动画岗位,于是临时把这轮实验补进第一季。与其继续转述发布数据和官方 benchmark,不如给 K3 一份真实任务,让它和其他候选站到同一个工位上交活。

前面给数字员工做岗位评测时,我越来越确定一件事:

公开榜单只能帮我圈候选人,真正决定录不录用的,必须是它在我的工位上交出来的东西。

这一次,我想补招一个新岗位:3D 动画制作数字员工。

我要的不是一个会聊 Three.js、会解释相机和灯光的模型,而是一个能接收任务单,自己进工作区写代码,最后交出可运行页面、固定帧、完整视频和验收记录的员工。

所以我没有再给它们出一道普通代码题,而是让 6 个候选做同一枚火箭:

  
  
  
28 秒实时 3D 动画 火箭发射 级间分离 一级翻转 下降点火 回收着陆

先说清楚:这不是“输入一句话,视频模型直接吐出 MP4”的文生视频评测。

它测的是另一类工作:让 Hermes 数字员工编写并交付一个离线可运行的 Three.js 实时动画工程。

这更接近一个真正的技术岗位。它不只要想出画面,还要组织场景、时间轴、相机、交互和工程文件,并让浏览器真的跑起来。

我不是在挑聊天模型,而是在招一个能交活的员工

这次的岗位说明书很具体:

  
  
  
岗位:3D 动画制作数字员工 输入: 一份统一的火箭动画 brief 必须交付: 1. 源码与工程结构 2. 浏览器可运行页面 3. 六个固定时间点的截图 4. 一份 2 倍速完整视频 5. 可复查的验收记录 统一约束: 1. 离线运行,不依赖运行时 CDN 2. 总时长 28 秒 3. 提供六个阶段跳转按钮 4. 提供广角和跟踪两种镜头 5. 时间轴必须可确定性跳转 6. 最大 20 个工具回合、1200 秒

固定截图时间点定在:

  
  
  
0 秒 5 秒 11 秒 15.5 秒 21 秒 27 秒

这六个时间点覆盖了发射、上升、分离、一级翻转、下降和着陆。

模型最后说一句“任务完成”没有用。

浏览器能打开、时间轴能跳转、关键动作在固定帧里能被看清、视频能从头跑到尾,才算交差。

这也是我现在对数字员工的最低要求:

  
  
  
一个隔离的 Hermes profile + 一个限定范围的工作区 + 一份岗位任务单 + 一套验收规则 + 能留下来的交付物

只有模型,没有这些工作文件和验收记录,还不能算真正的员工。

为什么偏偏选一枚可回收火箭

如果只让模型画一个旋转立方体,六个候选大概率都能完成。

但这并不能帮我挑人。

可回收火箭在一道题里同时压了几个能力:

  
  
  
3D 场景搭建 确定性时间轴 多阶段状态切换 火箭级间分离 一级姿态翻转 广角和跟踪运镜 下降点火与着陆 浏览器工程交付

任何一个环节没处理好,结果都会很直观。

代码也许没有报错,但镜头没有跟上,火箭会在画面里缩成一个小点。

时间轴也许能走,但一级没有明显翻转,观众看不懂发生了什么。

页面也许很漂亮,但固定时间点不能稳定复现,后面就没法自动验收。

这正是我想要的面试题:不靠模型自我介绍,一眼就能看出它到底会不会交活。

六个候选,全部走同一个 OpenRouter

为了尽量排除 provider 差异,这一轮六个模型全部通过 OpenRouter 调用:

  
  
  
Kimi K3 moonshotai/kimi-k3 Kimi 2.7 Code moonshotai/kimi-k2.7-code GLM-5.2 z-ai/glm-5.2 DeepSeek V4 Pro deepseek/deepseek-v4-pro MiniMax M3 minimax/minimax-m3 Qwen 3.7 Max qwen/qwen3.7-max

我为它们分别创建了新的 Hermes profile:

  
  
  
animk3 animk27 animglm52 animdeepseek4 animm3 animqwen37

六个 profile 相互隔离,拿到相同的基线目录、相同的本地 Three.js 0.185.1、相同的任务单和相同的时间上限。

每个候选只接收一次同样的任务,不针对结果追加提示,也不允许某个模型失败以后单独重做。

我在 Windows 侧用 Codex 冻结任务、检查边界、做浏览器验收;在 WSL 里让六个 Hermes profile 进入公共实验区完成工程。

不听自评,直接检查浏览器和成片

六个候选完成交付后,我用同一套冻结规则做完整验收。

客观部分检查:

  
  
  
页面能否加载 控制台是否有错误 28 秒时间轴是否确定 六个阶段跳转是否可用 两种镜头是否可切换 分离、下降和回收状态是否存在 视频能否完整录制

视觉部分则把模型名拿掉,只保留候选 A 到 F。

每个候选都生成六张固定帧和一份 2 倍速视频,再按同一套规则评分。正式分数先锁定,然后才揭开模型映射。

具体评分者是 Codex:我在 Windows 侧让 Codex 按冻结规则完成浏览器、运行时和源码验收,并对隐藏模型名的 A 到 F 成片进行视觉评分。六个参赛模型不会给自己打分,也看不到其他候选的结果。

总分 100:

  
  
  
浏览器与运行时 50 源码与工程交付 10 匿名视觉与动作盲评 40

视觉盲评再拆成:

  
  
  
场景与故事表达 12 动作和阶段连续性 10 摄影、纵深和光照 10 完成度与 UI 8

这仍然只是 Codex 这一名单一评分者的一次匿名评审,不是多人评委或统计学结论;它能减少模型名带来的先入为主,但不能消除主观判断。

最终成绩:K3 赢效果,GLM 赢性价比

最终有效成绩如下:

排名 模型 客观分 /60 视觉分 /40 总分 OpenRouter 成本 耗时
1 Kimi K3 58.0 37.5 95.5 $0.4665084 1200.8 秒,达到上限
2 GLM-5.2 58.0 33.5 91.5 $0.073443243 713.3 秒
3 DeepSeek V4 Pro 57.0 29.0 86.0 $0.149413821 935.1 秒
4 Qwen 3.7 Max 59.0 21.5 80.5 $0.62494064 1200.9 秒,达到上限
5 Kimi 2.7 Code 58.0 19.0 77.0 $0.21762048 306.3 秒
6 MiniMax M3 25.0 0.0 25.0 $0.101383057 714.1 秒

六个候选总实付 OpenRouter 成本:

  
  
  
$1.633309641

K3 和 Qwen 都达到统一的 1200 秒上限,但留下了可运行成品,所以可以评价其成片,不能写成“按时完成”。

MiniMax M3 的页面因为它交付的 JavaScript 存在语法错误而无法渲染,因此没有进入视觉评分,应该算候选自身的交付失败。

Kimi K3:最像能直接接高质量任务的主力

下面是同一份任务录制出的 2 倍速完整动画。它不是后期剪出来的镜头,而是浏览器里的 Three.js 实时页面按时间轴运行的完整过程。

为适配公众号图文加载,下面使用压缩后的循环 GIF。动图降低了分辨率、帧率和色彩数,但没有删减时间轴阶段。

K3 的优势并不只是“画面更漂亮”。

它是这轮端到端视觉叙事最完整的候选:发射台、点火、持续跟踪、级间分离、一级翻转、下降、着陆点火和落地,每个阶段都能被肉眼读出来。

尤其是在火箭离开发射台以后,它的相机仍然持续抓住主体。到了分离和下降阶段,观众不需要猜“现在发生了什么”。

它的问题也很明确:

  
  
  
最终镜头略紧 UI 尺寸比较克制 触及 1200 秒上限 成本约为 GLM-5.2 的 6.35 倍

如果岗位目标是“尽量把成片效果做高”,K3 是这一轮最合适的主力员工。

它和 Kimi 2.7 做的是同一题,但总分高了 18.5 分。之前在较简单任务里不容易看出的代际差距,在 3D 场景组织、运镜和长时间轴上被放大了。

GLM-5.2:只落后 4 分,但成本约为 K3 的六分之一

同样地,下面使用完整时间轴的压缩循环 GIF。

GLM-5.2 的画面有很强的风格化处理:发光水面和地面、阶段 HUD、分离与一级旋转都比较清楚。

它的主要问题在回收阶段。落点进入发射架,着陆点火也没有 K3 那么有说服力。

但把成本放进来,结论就变得很有意思:

  
  
  
K3: 95.5 分,$0.4665084 GLM-5.2:91.5 分,$0.073443243

GLM 只落后 4 分,成本却只有 K3 的约六分之一。

它的单分成本是:

  
  
  
$0.00080266

本轮最低。

所以“效果最好”和“最值得批量使用”不是同一个结论。

如果我要做一条重点展示、愿意为更好的运镜和回收过程多花成本,我会派 K3。

如果要批量制作内部演示、概念验证或短动画素材,我会先派 GLM-5.2。

DeepSeek 稳健,Qwen 工程规范

DeepSeek V4 Pro:状态完整,但画面偏保守

DeepSeek V4 Pro 得到 86 分。

它的状态完整,整体更像一份技术任务复盘:信息清楚,但城市和地形偏示意化,镜头切换也有些突兀。

Qwen 3.7 Max:工程交付分最高,但镜头没有讲清故事

Qwen 3.7 Max 总分 80.5,但客观与工程部分拿到 59/60,是本轮最高。源码结构、说明文件和可复查性都比较规范。

但动画最终还是要被人看。

它的相机没有持续抓住火箭,主体在上升、分离和下降阶段变得太小。工程交付干净,却没有把故事讲清楚。

这说明 3D 动画员工的任务单不能只写:

  
  
  
做一个火箭发射动画。

还必须把镜头验收写进去:

  
  
  
关键阶段中,主体不得小于可辨识尺寸。 分离和回收必须在固定帧中肉眼可读。 相机跟踪不得在上升后丢失主体。

同一个模型,brief 是否把镜头语言写成验收条件,可能直接改变结果。

最后的录用决定

如果今天就要给这个岗位定路由,我会这样安排:

  
  
  
高质量 3D 动画主力: Kimi K3 批量生产 / 成本敏感备选: GLM-5.2 工程规范备选: Qwen 3.7 Max

这里的“主力”不是综合模型冠军,也不是永久结论。

更准确的说法是:

在本轮统一任务、统一 OpenRouter、统一工具和单次 one-shot 条件下,Kimi K3 的成片质量最高;GLM-5.2 的性价比最好。

我不会因为一题就把其他候选永久淘汰。

但这张岗位路由表已经足够指导下一次真实派工。

可以直接复用的 3D 动画员工面试单

如果你也想挑一个 3D 动画制作数字员工,可以先把下面这张面试单复制出去:

  
  
  
岗位 - 要交付什么类型的 3D 动画? - 是追求展示效果,还是批量生产? 统一输入 - 同一份 brief - 同一份关键阶段说明 - 同一份固定截图时间表 冻结工具 - 同一个 Three.js / WebGL 版本 - 同一个 provider 或路由 - 同样的最大回合数和时间上限 交付物 - 源码和工程结构 - 可运行页面 - 六张固定帧 - 完整视频 - 验收记录 客观验收 - 浏览器能否加载 - 控制台是否有错误 - 时间轴能否确定性跳转 - 阶段按钮是否有效 - 两种镜头是否有效 - 分离与回收是否真的发生 视觉盲评 - 场景与故事表达 - 动作连续性 - 摄影、纵深和光照 - 完成度与 UI 成本与效率 - 实付成本 - 单分成本 - 完成耗时 - 是否触及超时上限 故障归因 - 是员工代码错误? - 还是公共 vendor、依赖或浏览器工位错误? 录用结论 - 高质量主力 - 成本敏感备选 - 专项备选 - 暂不录用,以及原因

这张表最重要的作用,不是让分数显得更专业。

而是逼我在派工前先说清楚:

  
  
  
我到底要什么? 怎样才算完成? 失败是谁的责任? 质量相近时,成本怎么选?

这些问题不明确,模型再强也很难变成稳定员工。

这次评测的边界

这是一道题、一次 one-shot。

它测的是“完成指定 Three.js 火箭动画工程”的岗位适配度,不是模型的综合能力排名。

它也没有覆盖 Blender、Unity、专业 DCC 工作流或文生视频模型,更不能证明 K3 在所有 3D 任务中都会赢。

K3 和 Qwen 还都触及了 1200 秒上限。如果日常生产有严格排期,耗时必须算进录用条件。

所以这篇能支持的结论很有限,但也足够实用:

  
  
  
这道题里,K3 成片最好。 GLM-5.2 性价比最好。 任务变了,应该继续回归测试。

写在最后:别挑最会自我介绍的模型

六个 AI 都能说自己会写代码、会做 3D、会完成复杂任务。

但自我介绍是最便宜的能力。

真正像数字员工的,是它能不能在限定工位里完成任务,留下源码、页面、图片、视频和验收记录;失败以后,我还能根据统一验收规则定位具体问题。

这轮实验最后得到的不只是一张模型分数表。

还有一份可以复用的岗位说明书、一套浏览器验收方法、一张视觉评分表和一份成本记录。

这才是我想要的数字员工实验:

不听它说自己有多强,只看它最后交了什么。

【声明】内容源于网络
0
0
AI智能体研究
欢迎关注“AI 智能体研究”!这里聚焦 AI 智能体前沿成果,解析技术原理,探讨应用场景。无论是技术爱好者还是行业探索者,都能获取最新资讯与深度见解。一起探索 AI 智能体的无限可能,共赴科技未来!
内容 173
粉丝 0
AI智能体研究 欢迎关注“AI 智能体研究”!这里聚焦 AI 智能体前沿成果,解析技术原理,探讨应用场景。无论是技术爱好者还是行业探索者,都能获取最新资讯与深度见解。一起探索 AI 智能体的无限可能,共赴科技未来!
总阅读4.1k
粉丝0
内容173