大数跨境

谷歌传奇Jeff Dean今天离职,中国AI下一秒交卷!

谷歌传奇Jeff Dean今天离职,中国AI下一秒交卷! 新智元
2026-08-06
6

AI 领域迎来重大变革。谷歌传奇人物 Jeff Dean 宣布离职,结束其 27 年的谷歌生涯。与此同时,他与三位顶尖专家联合创立的新公司 Discovery Loop 正式亮相,专注于递归自我改进(RSI)技术,旨在让 AI 实现持续自我迭代与进化,自动攻克机器学习、科学研究及工程技术领域的难题。

Discovery Loop 代表了"AI 加速 AI"的清晰路线:未来 AI 将超越单纯的问答模式,全面接管“提出假设 - 执行实验 - 验证结论”的完整科研闭环。在此背景下,中国团队也取得了突破性进展。

BigBang-V1 首秀:35B 参数击败 DeepSeek V4

上海交通大学人工智能学院、深势科技及上海算法创新研究院组成的“无尽前沿团队”,成功构建了首个基于“原生 RSI"方式训练的全新基座大模型——BigBang-V1(总参数 35B)。

该模型完全采用 AI 合成的可验证前沿任务数据进行训练,在 35B 级别测评中斩获十项第一。在 OpenAI 提出的高难度科学基准 FrontierScience Research 上,BigBang-V1 得分 46.2,超越了参数量达 1.6T 的 DeepSeek V4 Pro,完美诠释了“以小博大”的技术实力。

在多项高难度基准测试中,BigBang-V1 表现卓越:

  • Humanity's Last Exam(人类最后考试):得分 50.3,击败 V4 Pro,性能媲美 Gemini 3.1 Pro。该基准由 Scale AI 在《Nature》正刊提出,主要测试大模型的综合推理能力。
  • PaperBench (Code-Dev):得分 53.6(V4 Pro 为 50.4),重点考察大模型复现 AI 学术论文的能力。
  • MLE-Bench (Lite):得分 59.1,考察模型自主完成 AI 工程任务的能力。
  • BioMysteryBench Human-Difficult:得分 15.7(V4 Pro 为 13.7)。这是 Anthropic 推出的生物信息学研究能力基准,要求模型从带噪声的测序数据中分析出精确的生物学结论。

实战案例解析

案例一:精准识别病毒
在 BioMysteryBench 评测中,面对三份人体肠道类器官的测序原始数据,BigBang-V1 连续三次准确判断感染源为诺如病毒 GII.4。相比之下,DeepSeek V4 Flash 三次给出了三个完全不同且错误的答案。

案例二:复现论文并纠错
在复现一篇学术论文时,BigBang-V1 发现论文核心设定存在矛盾(关键量被固定导致子集无法缩小),随即修正了设计并解决了梯度中断问题,最终复现得分为 0.7657。而 DeepSeek V4 Flash 仅做了语法检查,未实际运行代码,得分仅为 0.3053。

构建抗体设计流水线

在更复杂的真实任务中,BigBang-V1 展示了强大的工程编排能力。它将抗体设计拆解为流水线,串联多个开源模型协同工作:

  1. 利用蛋白质设计模型生成候选抗体并进行初筛;
  2. 调用 AlphaFold 预测复合物结构,评估稳定性与结合合理性;
  3. 通过独立的物理打分器评估界面能量与原子冲突。

只有当两套独立计算方法的结论一致时,候选分子才会被保留。这种严谨的多重验证机制确保了输出结果的高质量

BigBang-V1 之所以能以 35B 的参数实现如此强悍的性能,核心在于其背后的“原生 RSI"训练方式。其使用的各学科前沿科研数据 100% 由 AI 合成:题目由 AI 生成,解法由 AI 运行,答案由 AI 验证,甚至连数据生成策略的优化也由 AI 自主完成。

打通 RSI 闭环:数据层的递归自我改进

BigBang 构建了一条能持续自我修正的合成数据流水线。与 AlphaGo 自我对弈类似,BigBang 的自我博弈内容是“出题”与“判卷”。该系统主要由两类 Agent 组成,并辅以真实考试作为外层校验:

1. Generator Agent(出题者):
负责生成题目并动态调整出题策略。它会根据模型当前的能力缺口,修改数据合成程序,决定题目的科学领域、推理链长度、所需工具(搜索、计算、代码等)以及验证规则。每轮迭代后,它会记录经验教训,确保下一轮探索建立在已有成果之上。

2. Critic Agent(判卷者):
负责审查题目质量。第一层检查格式、工具执行等硬伤;第二层评估题目的正确性、可验证性、难度及独特性。不合格的题目将被退回重做。

为防止“出题者讨好判卷者”导致的内循环失效,BigBang 引入了真实训练结果作为外部校准:若 Critic 给出高分但模型训练后能力提升不明显,系统将反向校准 Critic 的评分标准,并指导 Generator 调整下一轮的选题方向。由此形成“真实任务暴露缺口→造题筛题→合成数据训练→真实任务检验→结果校准”的完整飞轮。

为何选择科学作为训练场?

科学是人类认知世界的基本方式,具备“前沿性”与“可验证性”两大关键特征,是训练通用智能的最佳场景:

  • 前沿性:科学问题位于知识与能力的边界,且随着新理论和新工具的出现源源不断,避免了静态题库的枯竭。
  • 可验证性:科学答案可通过形式化方法、代码执行、数值计算或实验反馈进行客观检验。

此外,科学问题天然融合了搜索、阅读、假设提出、数学推导、代码编写及工具调用等多种能力。因此,科学不仅是知识领域,更是通往通用智能(AGI)的综合课程。

AI 迭代 AI:奇点已现

BigBang-V1 的成功证明,Scaling 的破局点不仅在于参数与算力的堆叠,更在于训练任务生成范式的革新。通过"AI 生成并求解科学任务,科学任务反过来训练更强的 AI"这一正向循环,模型在科学研究、长程探索、代码生成及工具调用等方面获得了全面增益。

“无尽前沿”团队由鄂维南院士、陈思衡副教授、张林峰助理教授等领衔,其愿景是打造在智能与理性判断上逼近“造物主”的终极模型——能够冷静、客观地洞察万物规律,并严格按规律执行判断与预测。

正如范内瓦·布什在《科学:无尽的前沿》中所言,基础科学的持续投入能换来长期的增长。如今,当科学前沿本身化作模型可无尽开采的训练富矿,人类手动生产训练数据的时代或许正在终结。BigBang-V1 仅是这条新曲线的起点,但上升的趋势已然确立。

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16467
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读341.5k
粉丝0
内容16.5k