大数跨境

奥特曼点名:他才是AI界最重要的研究者,但几乎没人知道他

奥特曼点名:他才是AI界最重要的研究者,但几乎没人知道他 量子位
2026-08-15
18
导读:真·GPT之父

奥特曼盛赞:他是 AI 史上最重要却最被低估的研究者

在最新访谈中,OpenAI CEO 山姆·阿尔特曼(Sam Altman)给出了一个罕见的高度评价:「他可能是 AI 历史上最重要、却不太为人所知的研究者。」

此人正是Alec Radford,被誉为真正的"GPT 之父”。

尽管公众对其知之甚少,但其成果已深刻影响行业。作为第一作者,他主导了 GPT-1、GPT-2、CLIP 和 Whisper 等里程碑式论文;同时深度参与了 GPT-3、DALL·E、Scaling Law 及 GPT-4 系列的关键研发。

奇怪的是,这位横跨大模型多次关键转向的核心人物,既无博士学位,也极少接受采访。在 ChatGPT 风靡全球时,他始终隐身于聚光灯之外。

回顾过去十年的 AI 论文会发现一个显著规律:每当模型展现出前所未有的通用能力时,Alec Radford 的名字往往早已出现在作者栏中。

OpenAI 的真正崛起:始于 Alec Radford

在《Invest Like The Best》节目中,当被问及 OpenAI 发展历程中最欣赏的幕后功臣时,阿尔特曼毫不犹豫地提到了 Alec Radford。他认为,Alec 的工作不仅演变成了 GPT 系列,更不断启发团队将研究推向关键方向。

《连线》杂志曾给出极具分量的判断:OpenAI 的崛起之路,真正始于聘用当时还默默无闻的 Alec Radford。

2016 年,23 岁的 Alec 加入 OpenAI。此前,他只是个在波士顿宿舍创办小型 AI 公司 Indico、热爱打 Kaggle 比赛的青年。

加入 OpenAI 后,Alec 并未感到压力,反而视其为类似研究生的自由探索期。他的首要任务是回答一个当时无人知晓的问题:语言模型究竟能做什么?

初次尝试使用 20 亿条 Reddit 评论训练模型以失败告终,但时任 CTO 的 Greg Brockman 决定给予充分信任:「Alec 很厉害,让他做想做的事。」

受限于算力,Alec 缩小范围,利用 1 亿条亚马逊商品评论让模型执行简单的「预测下一个字符」任务。意外随之发生:模型内部自发形成了一个能区分评论正负情绪的神经元,即后来著名的「无监督情感神经元」

这一实验证实了 Alec 的核心猜想:在足够多的数据上完成预测任务时,模型可自行习得训练目标未明确定义的能力。

在 Ilya Sutskever 的建议下,Alec 将目光投向更大规模的数据。2017 年,谷歌发布 Transformer 架构论文《Attention Is All You Need》,Ilya 敏锐地意识到这正是他们等待的技术突破。

Alec 迅速将 Transformer 应用于 BooksCorpus 数据集(含 7000 多本英文书籍),通过预测下一个词的任务,让模型学习长文本中的远距离依赖关系。两周内取得的进展超过过去两年总和,这构成了 GPT-1 的预训练基础。

随后,团队确立了「Big Transformer」路线:不再设计复杂规则,而是单纯扩大模型、数据和计算规模。2018 年,Generative Pre-trained Transformer(GPT)正式诞生,Alec Radford 位列论文第一作者。

GPT-1 虽未立即轰动,却为 OpenAI 指明了方向:收拢资源专注语言模型,通过堆叠算力和数据放大已有潜力。一年后,参数量达 15 亿的GPT-2发布,Alec 仍为共同一作。该模型展示了强大的零样本学习能力。

2020 年初,Scaling Laws 论文发表,将之前的实验经验转化为可预测的数学规律。同年 5 月,拥有 1750 亿参数的GPT-3问世。此时项目已升级为全公司协作的大型工程,Alec 署名降至第 29 位,但这标志着他最早推动的技术路线已成为公司的核心战略。

就在 GPT 即将产生巨大影响力之际,Alec 已将目光投向了新的领域。

跨越模态:从语言到图像与语音的连续突破

GPT-3 发布后,Alec 回归其擅长的图像领域。早在加入 OpenAI 前,他便因DCGAN而闻名,解决了 GAN 模型训练不稳定的难题,并发现模型能自发学习视觉表征。

2016 年,黄仁勋在展示 DCGAN 成果时误将功劳归于 Facebook 实验室,此事促使 Alec 下定决心离开波士顿加入 OpenAI。

几年后,他带着 GPT 的思路重返图像研究。2020 年,Image GPT证明通过将图片视为像素序列,同一套方法可适用于图像学习。随后发布的DALL·E进一步优化,实现了文生图的突破性组合。

同日发布的CLIP模型,由 Alec 担任共同第一作者。该模型利用 4 亿组图文对进行对比学习,在未使用 ImageNet 训练的情况下,零样本识别准确率媲美有监督训练的 ResNet-50。

在语音领域,Alec 同样表现卓越。继 2020 年的音乐生成模型 Jukebox 之后,2022 年推出的Whisper再次由其领衔一作。该模型基于 68 万小时多语言音频数据训练,在零样本测试中展现出极强的鲁棒性,能完美应对真实场景中的口音与噪声。

横跨语言、图像、多模态与语音,Alec 的研究始终遵循同一哲学:少规定规则,多提供数据与算力,通用能力自会涌现。他总能比行业共识更早发现值得放大的简单任务。

OpenAI 最神秘的“隐形”天才

与其显赫的学术地位形成鲜明反差的是,Alec Radford 几乎不经营个人品牌。他的社交媒体账号仅有 7 万粉丝,且多为转发,置顶动态仍停留在 2018 年 GPT-1 发布之时。

他的个人网站极简,仅保留姓名与少量文章链接,甚至连头像多年未换。公众熟知的是阿尔特曼与 Ilya,但在研究者眼中,Alec 是过去十年绕不开的关键人物。

阿尔特曼评价道,与共事过的人谈起 Alec,大家公认他是「几十年一遇的天才」,同时也是「最善良、最好的人之一」。

最新动态:独立研究与“复古”AI 实验

2024 年 12 月,在 OpenAI 工作近九年后,Alec 选择离职从事独立研究。令人意外的是,他并未延续大模型 Scaling 路线,而是推出了一个名为Talkie的「古董语言模型」。

该模型参数为 130 亿,其预训练语料有一条严格限制:仅包含 1931 年 1 月 1 日之前出版的英文材料。这意味着它知晓蒸汽机与一战,却对电视、互联网、二战乃至 Python 语言一无所知。

然而实验显示,仅通过少量示例和后训练,这个「老古董」竟能写出简单的 Python 代码。这项研究旨在探究:当模型从未接触过相关知识时,其吸收新技能的速度与机制究竟为何?是靠记忆还是靠真正的学习?

在全网疯狂追求更大规模数据的当下,Alec 反其道而行之,将模型「断网」百年。这或许又是他提前押注的下一个前沿方向。按照其一贯作风,当外界读懂这道题时,他恐怕早已投身于下一项研究了。

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16363
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读364.6k
粉丝1
内容16.4k