大数跨境

刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS

刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS 新智元
2026-09-14
7
导读:AI开始自己进化,中国天团已入场

新智元报道


大额免费 Token Plan:https://discovery-home.intern-ai.org.cn/,https://api.atria-asi.ai/,https://zenmux.ai/atria-asi/atria-dawn-preview

项目网站:https://atria-asi.ai/

模型权重:https://huggingface.co/internlm/Atria-Dawn-Preview

Paper 链接:https://github.com/atria-asi/Atria-Dawn-Preview/blob/main/atria-dawn-preview.pdf


20 分钟搭建 MiniOS 操作系统;1 分钟内完成未来一周全球天气预测。这是智能体模型Atria Dawn Preview在此次展示中完成的两项核心任务。


该模型由上海人工智能实验室联合复旦大学、中科院软件所、中国人民大学、中科院自动化所、华东师范大学和哈尔滨工业大学等多所高校及科研机构共同发布。


除了展示模型能力,团队更聚焦于一个深层问题:这个模型究竟是如何被研发出来的?


在 Atria 的后训练过程中,编程智能体已深度参与代码编写、实验执行与结果分析。当 AI 开始辅助“造 AI",人类的劳动发生了怎样的转移?Atria 团队通过拆解研发中的人机交互记录,给出了详细答案。

AI 连续执行的背后,谁在决定下一步?


回顾模型研发历程,人类的角色持续演变:从早期的数据标注,到偏好反馈,再到如今深度参与代码与实验流程。人机协作的边界已从数据生产延伸至研发全流程。


尽管大量操作可由智能体连续推进,但定义问题、选择技术路线、解读实验结果等关键决策仍难以量化。这些看似简短的判断,往往决定了后续一连串操作的方向。


因此,评估 AI 贡献的关键在于追溯过程:方案由谁提出?选择由谁作出?遇阻时由谁纠正方向?这也是 Atria 团队分析交互记录的核心逻辑。

769 条任务记录,拆开 AI 研发背后的人类劳动


团队分析了56 名参与者产生的 769 条任务记录。数据显示,在明确回答是否使用 AI 的 739 项任务中,有 713 项涉及 AI,使用率高达96.5%


然而,“有没有用”并不能完全代表“承担了多少”或“谁在决策”。以下几组数据揭示了更深层次的分工真相。

约三分之一已完成任务,参与者认为“没有 AI 就做不成”



在 455 项已完成、使用了 AI 且获得有效可行性回答的任务中,151 项(占比 33.2%)被参与者判定为:若无 AI 协助,在既定资源和质量要求下无法完成。


这表明 AI 的作用已超越效率提升,直接扩展了任务的可行边界。当然,这一判断基于参与者的回顾性评估,也反映了 AI 工具对研究者自身能力认知的重塑。

AI 经常出方案,多数最终选择仍由人作出



在技术决策层面,执行岗位报告的 567 项方法或参数决策中,AI 提出方案的比例达 64.6%。最常见的协作模式是"AI 提出,人类选择",占比 55.4%。


若聚焦最终决策权,人类依然占据主导:85.5%的方法或路线决策由人类拍板,AI 仅占 9.2%。在目标设定和验收标准环节,人类最终选择比例分别高达93.4%81.9%


即便是在那些被认为“没有 AI 就无法完成”的 151 项任务中,仍有95.4%的目标由人类最终选定。这说明,虽然研究者高度依赖 AI 执行,但在判断方案价值、确认结果合规性及指引研究方向上,人类仍承担着核心责任。

遇到困难,76.0% 经人类帮助继续推进,只有 0.7% 由人类接管



当智能体遭遇瓶颈时,人类如何介入?在记录的 588 项关键困难任务中,76.0% 经人类介入后由 AI 继续推进,而由人类完全接管工作的比例仅为0.7%


人类的主要作用集中在两点:

  • 补充背景或澄清需求(35.2%);
  • 诊断问题或调整方法(34.7%)。


另有 23.0% 的任务由 AI 自行恢复。此外,在发生实质性修改的产出中,75.4% 是由 AI 根据人类反馈完成的。这意味着,虽然初稿和修改稿可能均由 AI 生成,但人类的反馈指令才是驱动结果优化的关键,这部分隐性工作常被单纯统计代码量所低估。

8 项基准,两项第一、两项第二


除研发过程分析外,Atria Dawn Preview 的模型性能同样亮眼。在 8 项基准对比中,该模型取得两项第一、两项第二

  • AutomationBench、CyberGym:得分最高;
  • SkillsBench、Workspace-Bench-Lite:位列第二。


团队还展示了三个具体 Demo,涵盖模型训练、软件开发和网络安全,直观呈现了模型组织工作、使用工具及根据反馈推进任务的能力。

禁用网络搜索,训练一个超过 4 亿参数的天气模型



在无网络搜索限制下,模型基于超 100GB 全球气象数据,自主设计并训练了一个参数量超 4 亿的 ViT 骨干网络。经过 45,000 步训练学习 69 个气象变量演化规律,系统能在1 分钟内预测未来一周全球天气。部分指标优于英伟达经典模型 FourCastNet。

20 分钟,从自然语言需求到 MiniOS



在软件开发场景中,Atria Dawn Preview 仅用20 分钟便将自然语言需求转化为可运行的 MiniOS 系统,完整展现了从需求理解、代码实现到系统交付的全流程能力。

进入隔离靶场,把漏洞发现、修复和环境恢复接起来



在网络安全隔离靶场中,模型完成了从网站分析、攻击面排查,到漏洞发现、利用、修复及复验的全闭环操作,展示了其在复杂环境下的多轮测试与纠错能力。

AI 帮忙造 AI,下一轮还能继续吗?


Atria 的实践揭示了两个维度的观察:一是后训练模型的任务完成能力,二是研发过程中的人机分工。随着 AI 能力提升,两者交汇将触及递归自我改进的深水区。

AI 做得更快,检验能不能跟上?



当 AI 加速实验迭代,研究者面临更大的验证压力:训练信号是否可靠?评估是否有遗漏?自我修改是否偏离目标?若缺乏独立评估、可追溯记录及异常回退机制,错误可能被带入下一轮循环。因此,研发自动化的推进必须伴随验证体系的同步升级。

下一次,能不能由 AI 主动请人帮忙?



未来的关键在于 AI 能否主动识别何时需要人类介入。面对目标模糊、证据冲突或需现实反馈的场景,模型需具备精准求助的能力:清晰阐述卡点、不确定性及所需支持。这将改变人类的工作方式,使其从全程指挥转向关键节点决策。

96 人,65 名在校生,这支团队的另一面


Atria 背后是一支年轻且充满活力的研发团队。在 96 名主要成员中,65 名为在校生(博士生 33 人,本硕生 32 人),占比超三分之二;专项组长中学生比例达70%


团队汇聚了上海人工智能实验室及多所顶尖高校的研究力量。不同背景的青年学子在同一项目中协作,共同探索 AI 能力与人机分工的边界。


"Atria"之名寓意深远:既是南三角座的主星,象征远方探索;原意"atrium"指中庭,象征汇聚与交流。这颗星与这个空间,正承载着让更多人协同推动智能体能力进阶的愿景。


参考资料:https://github.com/atria-asi/Atria-Dawn-Preview/blob/main/atria-dawn-preview.pdf

编辑:大卫

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16543
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读400.1k
粉丝0
内容16.5k