大数跨境

OpenAI CTO离职创业开源首秀,Inkling模型实测

OpenAI CTO离职创业开源首秀,Inkling模型实测 至顶AI实验室
2026-07-17
17


 作者 |Don

来源 | 至顶AI实验室

OpenAI CTO Mira Murati,2025年初和OpenAI联合创始人John Schulman、前OpenAI副总裁Lilian Weng一起成立了创业公司Thinking Machines Lab,闷头做了十七个月终于拿出第一个自研模型Inkling,而且是开放权重。
Youtube博主Bijan Bowen也是第一时间拿到了开源模型Inkling,跑了一整套他常年沿用的本地AI基准测试,他说本来以为只是又一次跑分,点进官方页面看到Hugging Face链接后兴奋度直接翻倍。 

开放权重,瞄准企业微调





Inkling体量不小:975B总参数、41B激活参数的混合专家(MoE)模型,每个token会路由到256个专家里的6个,再加2个常驻激活的共享专家,架构思路和DeepSeek V3比较接近。预训练用了45万亿token的文本、图像、音频和视频数据,协议是Apache 2.0,商用、修改、二次分发都不受限制,这点在博主眼里格外加分。除了这个近万亿参数的旗舰版本,官方还预告了一个正在准备中的轻量版Inkling-Small,276B总参数、12B激活参数,未来如果能塞进NVIDIA DGX Spark这类128GB统一内存的桌面设备,对本地部署爱好者会是个实在的选项。

Inkling同时支持文本、图像、音频三种输入模态,官方通稿里反复强调的另一个重点是可定制,欢迎企业拿自己的数据去微调出专属版本。博主的解读很直接:喜欢跑分的爱好者可能还是会优先选编程能力更强的GLM-5.2,但大量法律事务所之类的美国企业客户本来就被合规卡死,不可能碰中国实验室的开源模型,Inkling这种美国血统、权重开放、可微调的组合恰好卡在这批客户的需求缝隙里。官方雷达图里也把GLM-5.2、Claude Fable 5列为对比对象,能看出Inkling在编码能力上不如这些同代模型突出。


浏览器桌面测试:能跑,但不算惊艳





正式测试从“浏览器OS”这个博主常用的基准开始:一句话要求做一个可交互的桌面系统,塞进小游戏、记事本、文件管理器、计算器等应用。
Inkling给出的桌面主题叫Chrome OS,星云背景、居中时钟,开始菜单和各个应用点开都能正常运作:赛车小游戏能开、记事本能存到浏览器缓存、计算器算对了128乘6,语音指令也能正确唤出应用或切换壁纸。博主整体评价是“过得去”,但对比之前测过的Qwen3.6等模型,观感上没有太大惊艳。

编程测试:地铁场景与滑板游戏





进入OpenCode里的编程测试后,画风变得更实际。做一个赛博地铁场景时,模型先是漏了一个import map、还带语法错误,博主把控制台报错原样贴回去,模型迅速自我修复并重启服务;调亮画面后,场景整体偏暗、细节不算丰富,但结构基本立得住。
博主还测试了模型看截图自我纠错的能力:先截图给模型看效果,模型判断"不满意",随后主动调整相机和灯光重新渲染,这种自己截图、自己判断、自己改的闭环在博主看来是加分项。
随后的C++滑板小游戏测试就没这么顺利,代码能编译、能跑起来,但控制和渲染都有明显问题,博主中途放弃了继续深挖。截至这一步,实际花掉的API调用成本是7.28美元。

手表官网与维修工Steve





前端测试环节找回一些状态:给Slapis手表官网这个老测试题写首页,模型先给出偏"电影运镜"风格的英雄区,被追问是否该做3D手表模型后,又迅速改出了立体感更强的版本。
创意写作部分是一段角色扮演测试:博主设定模型扮演车库里偷偷开维修店的Steve,以房东身份下逐客令,再半开玩笑地用一台1997年的二十周年纪念版Macintosh(TAM,内置Bose低音炮)作筹码谈判续租。Inkling接受了这个略带试探又不失分寸的对话节奏,没有往露骨方向发展,还准确记住了TAM这台老设备的具体配置,显示出不错的知识储备和分寸感。

城市时间线与AI作品集网站





城市时间线测试让模型渲染1945年到2055年同一座城市的变化,人物造型和建筑风格随年代切换。1985年这段效果被专门表扬,霓虹感和年代招牌都做出来了;不过所有年代的人物角色统一"没有头发",成了一个略显意外的固定bug。
后面还有一个多模态编码测试,博主把一张手绘的作品集网站草图拍照发给模型,要求做成能应聘顶尖AI/ML岗位的高端作品集页面。成品是棕金配色的暗色系设计,页面里嵌入了注意力机制、梯度下降模拟、embedding投影、置信度曲线等可交互的机器学习演示模块,质感和前面的手表官网有些相似,但和博主预期的蓝紫配色完全不同,这种"模型自己的审美偏好"也是每次测新模型挺有意思的部分。
最后的"街头王八拳"(Street Yeet)小游戏测试暴露了移动控制的短板,人物走位跑偏,但靠鼠标乱点也能触发把路人"揍飞"的搞笑效果,勉强算完成任务。

结语:不追求跑分冠军





整场测试下来,博主的结论比较克制:Inkling在他这套偏创意/agentic编程向的测试里没有一项表现特别惊艳,编码能力也明显不如同期的GLM-5.2、Claude Fable 5。但他强调这不等于模型不行,Inkling的官方定位本来就不是"跑分最强",模型卡里官方原话也承认它"不是当下开放或闭源模型里最强的那一个",卖点是均衡的综合能力,加上原生支持文本、图像、音频三种输入,以及围绕Tinker平台搭建的微调工具链。
对那些出于合规原因不能用中国实验室开源模型、又想控制API成本的美国企业,比如博主举例的律所,Inkling这种"美国血统、权重开放、能微调"的组合可能比跑分数字更有说服力。等12B激活参数的Inkling-Small正式发布,本地AI爱好者应该能有更轻量的机会亲自试一试这套模型家族。
END
本文来自至顶AI实验室,一个专注于对AI计算机、工作站及各类AI相关硬件设备,开展基于真实使用场景评测的研究机构。


图片


图片

【声明】内容源于网络
0
0
至顶AI实验室
一个专注于探索生成式AI前沿技术及其应用的实验室。
内容 17
粉丝 0
至顶AI实验室 一个专注于探索生成式AI前沿技术及其应用的实验室。
总阅读202
粉丝0
内容17