这篇文章原本不在数字员工第一季的主线计划里。
7 月 16 日,Kimi Code 的官方更新记录: https://www.kimi.com/code/docs/en/kimi-code/whats-new.html把 Kimi K3 列为新发布模型。随后几天,我连续看到关于 K3 的讨论。它到底比上一代强在哪里、适合做什么,很快成了这一轮国产模型更新里最热的话题之一。
更巧的是,K3 的官方技术博客: https://www.kimi.com/fr-fr/blog/kimi-k3专门提到了一类“软件工程 + 视觉推理”的任务,包括游戏开发、前端和 CAD。
这不等于它已经证明自己会做好 3D 动画,但正好给了我一个值得验证的问题:
如果我要招聘一个 3D 动画制作数字员工, 刚发布的 K3 真能比上一代和其他国产模型交出更好的成片吗?
我原本就准备给数字员工增加一个 3D 动画岗位,于是临时把这轮实验补进第一季。与其继续转述发布数据和官方 benchmark,不如给 K3 一份真实任务,让它和其他候选站到同一个工位上交活。
前面给数字员工做岗位评测时,我越来越确定一件事:
公开榜单只能帮我圈候选人,真正决定录不录用的,必须是它在我的工位上交出来的东西。
这一次,我想补招一个新岗位:3D 动画制作数字员工。
我要的不是一个会聊 Three.js、会解释相机和灯光的模型,而是一个能接收任务单,自己进工作区写代码,最后交出可运行页面、固定帧、完整视频和验收记录的员工。
所以我没有再给它们出一道普通代码题,而是让 6 个候选做同一枚火箭:
28 秒实时 3D 动画 火箭发射 级间分离 一级翻转 下降点火 回收着陆
先说清楚:这不是“输入一句话,视频模型直接吐出 MP4”的文生视频评测。
它测的是另一类工作:让 Hermes 数字员工编写并交付一个离线可运行的 Three.js 实时动画工程。
这更接近一个真正的技术岗位。它不只要想出画面,还要组织场景、时间轴、相机、交互和工程文件,并让浏览器真的跑起来。
我不是在挑聊天模型,而是在招一个能交活的员工
这次的岗位说明书很具体:
岗位:3D 动画制作数字员工 输入: 一份统一的火箭动画 brief 必须交付: 1. 源码与工程结构 2. 浏览器可运行页面 3. 六个固定时间点的截图 4. 一份 2 倍速完整视频 5. 可复查的验收记录 统一约束: 1. 离线运行,不依赖运行时 CDN 2. 总时长 28 秒 3. 提供六个阶段跳转按钮 4. 提供广角和跟踪两种镜头 5. 时间轴必须可确定性跳转 6. 最大 20 个工具回合、1200 秒
固定截图时间点定在:
0 秒 5 秒 11 秒 15.5 秒 21 秒 27 秒
这六个时间点覆盖了发射、上升、分离、一级翻转、下降和着陆。
模型最后说一句“任务完成”没有用。
浏览器能打开、时间轴能跳转、关键动作在固定帧里能被看清、视频能从头跑到尾,才算交差。
这也是我现在对数字员工的最低要求:
一个隔离的 Hermes profile + 一个限定范围的工作区 + 一份岗位任务单 + 一套验收规则 + 能留下来的交付物
只有模型,没有这些工作文件和验收记录,还不能算真正的员工。
为什么偏偏选一枚可回收火箭
如果只让模型画一个旋转立方体,六个候选大概率都能完成。
但这并不能帮我挑人。
可回收火箭在一道题里同时压了几个能力:
3D 场景搭建 确定性时间轴 多阶段状态切换 火箭级间分离 一级姿态翻转 广角和跟踪运镜 下降点火与着陆 浏览器工程交付
任何一个环节没处理好,结果都会很直观。
代码也许没有报错,但镜头没有跟上,火箭会在画面里缩成一个小点。
时间轴也许能走,但一级没有明显翻转,观众看不懂发生了什么。
页面也许很漂亮,但固定时间点不能稳定复现,后面就没法自动验收。
这正是我想要的面试题:不靠模型自我介绍,一眼就能看出它到底会不会交活。
六个候选,全部走同一个 OpenRouter
为了尽量排除 provider 差异,这一轮六个模型全部通过 OpenRouter 调用:
Kimi K3 moonshotai/kimi-k3 Kimi 2.7 Code moonshotai/kimi-k2.7-code GLM-5.2 z-ai/glm-5.2 DeepSeek V4 Pro deepseek/deepseek-v4-pro MiniMax M3 minimax/minimax-m3 Qwen 3.7 Max qwen/qwen3.7-max
我为它们分别创建了新的 Hermes profile:
animk3 animk27 animglm52 animdeepseek4 animm3 animqwen37
六个 profile 相互隔离,拿到相同的基线目录、相同的本地 Three.js 0.185.1、相同的任务单和相同的时间上限。
每个候选只接收一次同样的任务,不针对结果追加提示,也不允许某个模型失败以后单独重做。
我在 Windows 侧用 Codex 冻结任务、检查边界、做浏览器验收;在 WSL 里让六个 Hermes profile 进入公共实验区完成工程。
不听自评,直接检查浏览器和成片
六个候选完成交付后,我用同一套冻结规则做完整验收。
客观部分检查:
页面能否加载 控制台是否有错误 28 秒时间轴是否确定 六个阶段跳转是否可用 两种镜头是否可切换 分离、下降和回收状态是否存在 视频能否完整录制
视觉部分则把模型名拿掉,只保留候选 A 到 F。
每个候选都生成六张固定帧和一份 2 倍速视频,再按同一套规则评分。正式分数先锁定,然后才揭开模型映射。
具体评分者是 Codex:我在 Windows 侧让 Codex 按冻结规则完成浏览器、运行时和源码验收,并对隐藏模型名的 A 到 F 成片进行视觉评分。六个参赛模型不会给自己打分,也看不到其他候选的结果。
总分 100:
浏览器与运行时 50 源码与工程交付 10 匿名视觉与动作盲评 40
视觉盲评再拆成:
场景与故事表达 12 动作和阶段连续性 10 摄影、纵深和光照 10 完成度与 UI 8
这仍然只是 Codex 这一名单一评分者的一次匿名评审,不是多人评委或统计学结论;它能减少模型名带来的先入为主,但不能消除主观判断。
最终成绩:K3 赢效果,GLM 赢性价比
最终有效成绩如下:
| 排名 | 模型 | 客观分 /60 | 视觉分 /40 | 总分 | OpenRouter 成本 | 耗时 |
|---|---|---|---|---|---|---|
| 1 | Kimi K3 | 58.0 | 37.5 | 95.5 | $0.4665084 | 1200.8 秒,达到上限 |
| 2 | GLM-5.2 | 58.0 | 33.5 | 91.5 | $0.073443243 | 713.3 秒 |
| 3 | DeepSeek V4 Pro | 57.0 | 29.0 | 86.0 | $0.149413821 | 935.1 秒 |
| 4 | Qwen 3.7 Max | 59.0 | 21.5 | 80.5 | $0.62494064 | 1200.9 秒,达到上限 |
| 5 | Kimi 2.7 Code | 58.0 | 19.0 | 77.0 | $0.21762048 | 306.3 秒 |
| 6 | MiniMax M3 | 25.0 | 0.0 | 25.0 | $0.101383057 | 714.1 秒 |
六个候选总实付 OpenRouter 成本:
$1.633309641
K3 和 Qwen 都达到统一的 1200 秒上限,但留下了可运行成品,所以可以评价其成片,不能写成“按时完成”。
MiniMax M3 的页面因为它交付的 JavaScript 存在语法错误而无法渲染,因此没有进入视觉评分,应该算候选自身的交付失败。
Kimi K3:最像能直接接高质量任务的主力

下面是同一份任务录制出的 2 倍速完整动画。它不是后期剪出来的镜头,而是浏览器里的 Three.js 实时页面按时间轴运行的完整过程。
为适配公众号图文加载,下面使用压缩后的循环 GIF。动图降低了分辨率、帧率和色彩数,但没有删减时间轴阶段。

K3 的优势并不只是“画面更漂亮”。
它是这轮端到端视觉叙事最完整的候选:发射台、点火、持续跟踪、级间分离、一级翻转、下降、着陆点火和落地,每个阶段都能被肉眼读出来。
尤其是在火箭离开发射台以后,它的相机仍然持续抓住主体。到了分离和下降阶段,观众不需要猜“现在发生了什么”。
它的问题也很明确:
最终镜头略紧 UI 尺寸比较克制 触及 1200 秒上限 成本约为 GLM-5.2 的 6.35 倍
如果岗位目标是“尽量把成片效果做高”,K3 是这一轮最合适的主力员工。
它和 Kimi 2.7 做的是同一题,但总分高了 18.5 分。之前在较简单任务里不容易看出的代际差距,在 3D 场景组织、运镜和长时间轴上被放大了。
GLM-5.2:只落后 4 分,但成本约为 K3 的六分之一

同样地,下面使用完整时间轴的压缩循环 GIF。

GLM-5.2 的画面有很强的风格化处理:发光水面和地面、阶段 HUD、分离与一级旋转都比较清楚。
它的主要问题在回收阶段。落点进入发射架,着陆点火也没有 K3 那么有说服力。
但把成本放进来,结论就变得很有意思:
K3: 95.5 分,$0.4665084 GLM-5.2:91.5 分,$0.073443243
GLM 只落后 4 分,成本却只有 K3 的约六分之一。
它的单分成本是:
$0.00080266
本轮最低。
所以“效果最好”和“最值得批量使用”不是同一个结论。
如果我要做一条重点展示、愿意为更好的运镜和回收过程多花成本,我会派 K3。
如果要批量制作内部演示、概念验证或短动画素材,我会先派 GLM-5.2。
DeepSeek 稳健,Qwen 工程规范
DeepSeek V4 Pro:状态完整,但画面偏保守

DeepSeek V4 Pro 得到 86 分。
它的状态完整,整体更像一份技术任务复盘:信息清楚,但城市和地形偏示意化,镜头切换也有些突兀。
Qwen 3.7 Max:工程交付分最高,但镜头没有讲清故事

Qwen 3.7 Max 总分 80.5,但客观与工程部分拿到 59/60,是本轮最高。源码结构、说明文件和可复查性都比较规范。
但动画最终还是要被人看。
它的相机没有持续抓住火箭,主体在上升、分离和下降阶段变得太小。工程交付干净,却没有把故事讲清楚。
这说明 3D 动画员工的任务单不能只写:
做一个火箭发射动画。
还必须把镜头验收写进去:
关键阶段中,主体不得小于可辨识尺寸。 分离和回收必须在固定帧中肉眼可读。 相机跟踪不得在上升后丢失主体。
同一个模型,brief 是否把镜头语言写成验收条件,可能直接改变结果。
最后的录用决定
如果今天就要给这个岗位定路由,我会这样安排:
高质量 3D 动画主力: Kimi K3 批量生产 / 成本敏感备选: GLM-5.2 工程规范备选: Qwen 3.7 Max
这里的“主力”不是综合模型冠军,也不是永久结论。
更准确的说法是:
在本轮统一任务、统一 OpenRouter、统一工具和单次 one-shot 条件下,Kimi K3 的成片质量最高;GLM-5.2 的性价比最好。
我不会因为一题就把其他候选永久淘汰。
但这张岗位路由表已经足够指导下一次真实派工。
可以直接复用的 3D 动画员工面试单
如果你也想挑一个 3D 动画制作数字员工,可以先把下面这张面试单复制出去:
岗位 - 要交付什么类型的 3D 动画? - 是追求展示效果,还是批量生产? 统一输入 - 同一份 brief - 同一份关键阶段说明 - 同一份固定截图时间表 冻结工具 - 同一个 Three.js / WebGL 版本 - 同一个 provider 或路由 - 同样的最大回合数和时间上限 交付物 - 源码和工程结构 - 可运行页面 - 六张固定帧 - 完整视频 - 验收记录 客观验收 - 浏览器能否加载 - 控制台是否有错误 - 时间轴能否确定性跳转 - 阶段按钮是否有效 - 两种镜头是否有效 - 分离与回收是否真的发生 视觉盲评 - 场景与故事表达 - 动作连续性 - 摄影、纵深和光照 - 完成度与 UI 成本与效率 - 实付成本 - 单分成本 - 完成耗时 - 是否触及超时上限 故障归因 - 是员工代码错误? - 还是公共 vendor、依赖或浏览器工位错误? 录用结论 - 高质量主力 - 成本敏感备选 - 专项备选 - 暂不录用,以及原因
这张表最重要的作用,不是让分数显得更专业。
而是逼我在派工前先说清楚:
我到底要什么? 怎样才算完成? 失败是谁的责任? 质量相近时,成本怎么选?
这些问题不明确,模型再强也很难变成稳定员工。
这次评测的边界
这是一道题、一次 one-shot。
它测的是“完成指定 Three.js 火箭动画工程”的岗位适配度,不是模型的综合能力排名。
它也没有覆盖 Blender、Unity、专业 DCC 工作流或文生视频模型,更不能证明 K3 在所有 3D 任务中都会赢。
K3 和 Qwen 还都触及了 1200 秒上限。如果日常生产有严格排期,耗时必须算进录用条件。
所以这篇能支持的结论很有限,但也足够实用:
这道题里,K3 成片最好。 GLM-5.2 性价比最好。 任务变了,应该继续回归测试。
写在最后:别挑最会自我介绍的模型
六个 AI 都能说自己会写代码、会做 3D、会完成复杂任务。
但自我介绍是最便宜的能力。
真正像数字员工的,是它能不能在限定工位里完成任务,留下源码、页面、图片、视频和验收记录;失败以后,我还能根据统一验收规则定位具体问题。
这轮实验最后得到的不只是一张模型分数表。
还有一份可以复用的岗位说明书、一套浏览器验收方法、一张视觉评分表和一份成本记录。
这才是我想要的数字员工实验:
不听它说自己有多强,只看它最后交了什么。

