大数跨境

互联网免费数据已被吃光,普通人反馈早没用了?前英伟达工程师:Transformer的原罪浪费算力,聊天机器人把GPU全糟蹋了

互联网免费数据已被吃光,普通人反馈早没用了?前英伟达工程师:Transformer的原罪浪费算力,聊天机器人把GPU全糟蹋了 AI科技大本营
2026-08-26
1
导读:世界上没有烂芯片,只有糟糕的定价。

世界上没有烂芯片,只有糟糕的定价。

编译 | 王启隆
出品丨奇点折射(ID:rgznai100)

硅谷正陷入对英伟达 Blackwell 芯片的疯狂抢购与数据中心吉瓦级扩容中,旨在实现聊天机器人的毫秒级响应。然而,前英伟达底层算子工程师、Sail Research 创始人 Neil Movva 指出,整个行业可能陷入了“延迟陷阱”。

Neil 认为,AI 的终局并非低延迟的实时对话,而是能自主运行数小时甚至数天的后台 Agent。“最好的延迟其实是零延迟——早晨醒来,机器在夜里已经替你把活全部干完了。”

为实现后台推理成本暴跌 1000 倍,Neil 提出了彪悍的“算力拾荒者战略”:“世界上没有坏芯片,只有糟糕的定价。”只要价格合适,任何芯片皆可利用。市场对非英伟达硬件的偏见,恰恰是最佳的套利机会。

核心观点速览:

  • 最好的延迟是零延迟:摆脱“提示并等待”的人机回路,让 Agent 在后台静默运行,人类只需验收结果。
  • 芯片套利策略:打破对英伟达的迷信,通过软件优化挖掘被低估的非主流芯片性能,追求极致的单位美元算力。
  • Transformer 架构缺陷:注意力层受限于内存带宽,矩阵乘法层受限于算力,单芯片难以兼顾,导致资源浪费。
  • 数据进化新路径:互联网高质量文本已耗尽,普通用户反馈失效。下一代智能依赖可验证任务沙盒中的强化学习博弈。
  • 分布式廉价机房:放弃 99.99% SLA 的高昂成本,利用 95% 可用率的分布式小机房配合天气模型调度,构建不对称成本优势。

01 / 把智能做成极廉价的大宗商品

Sail Research 定位为"Token 工厂”,提供市场上无可匹敌价格的开源大模型 API 推理服务,并支持构建长生命周期 Agent 虚拟机。其核心愿景是将“智能”转化为如同水电般廉价的大宗商品。

Neil 强调:“只要你把某样东西的成本降低 10 倍,它就会催生出一个全新的产品品类。”当前的北极星指标是拥有全行业最低的单 token 成本。未来,衡量标准将从 token 消耗量转向“成果(outcomes)”,Agent 将自我管理 token 预算以完成任务。

推动这一变革的两大顺风:一是开源崛起,客户渴望拥有智能主权;二是应用形态从“低延迟交互”转向“长周期任务”。当 Agent 连续运行数小时甚至数天时,每秒输出速度不再关键,放宽延迟要求将带来巨大的效率与成本优势。

02 / 最好的延迟是零延迟

Neil 提出终极梦想:“最好的延迟就是零延迟——当你早晨醒来时,工作已经在夜间全部做完了。”只要人类仍卡在“提示并等待”的回路中,就是 Agent 处理能力的瓶颈。未来的协作模式应贴近人类的时间节奏,按天或周同步,而非分钟级微观管理。

随着测试期计算扩展(test-time compute scaling)概念的验证,Agent 连续运行一小时已成常态。Neil 预测,今年年底后台任务与实时任务比例约为 50:50,未来将演变为 90:10,后台负载占据绝对主导。

典型应用场景包括深度研究(综合分析万级数据源)和网络安全(自动化渗透测试)。安全领域甚至出现了“工作量证明”现象:软件的安全性取决于投入多少算力去尝试攻破它。

03 / 凡是能被验证的问题,背后都标好了 Token 的价格

极度廉价的智能将解锁“主动式智能 Agent",如全天候理解用户需求的个人助理。关键在于甘愿在无即时回报承诺下肆意消耗 token,以攻克任何“可验证问题”(如软件工程、数学证明、科学发现)。

Neil 预言:“为任何科学问题或研究课题找到确定答案的成本,可能只要几百甚至几十美元。”人类受限的将仅是提出问题的能力,而非算力预算。至于不可验证的“审美与品味”,则继续留给人类。

04 / 放弃私家车的超低延迟,开好吞吐量这辆“大公交”

GPU 本质是吞吐量机器,但在聊天机器人场景下被强行优化为低延迟工具,导致计算单元利用率不足。Neil 比喻道:低延迟是“私家车”,点对点直达但成本高;高吞吐是“公交车”,虽需等待拼车但效率极高。

Sail Research 的策略是打造极致的“公交车”。对于非英伟达芯片,虽缺乏类似 NVLink 的高速互联技术,不适合张量并行,但可通过专家并行或流水线并行等策略,在基础计算部件上发挥其“单位美元算力”的优势。

05 / 拆解 Transformer 的“原罪”

Cerebras 等公司试图通过超大 SRAM 解决内存带宽问题,实现极速推理。然而,KV Cache(动态对话记忆)的膨胀成为新瓶颈。模型权重是固化知识,KV Cache 是动态知识,后者体积往往超过前者且难以预测。

Neil 指出 Transformer 的“原罪”:它将极度受限于内存带宽的注意力层,与极度受限于算力的矩阵乘法层硬拼在一起。单芯片难以兼顾。未来趋势可能是异构计算:用 Cerebras 类芯片托管 MLP(模型权重),用 GPU 处理注意力机制(长上下文)。

尽管存在缺陷,Transformer 凭借强大的可扩展性和通用学习能力,仍是当前主导架构。只要数据中存在模式,Transformer 就能通过过拟合再压缩的方式提取泛化能力。

06 / 互联网数据被吃光了,下一代智能靠沙盒里的自我博弈

“互联网是对数据的一次性补贴。”N Neil 认为,高质量互联网文本已被耗尽,普通大众的用户偏好反馈对先进模型已无价值。数据进化的下一阶段是强化学习环境沙盒

通过给模型分配高难度可验证任务(如编程、数学),并在隔离环境中让其自我博弈、自我评分,实现递归进化。这是通往 AGI 的最佳路径:不断叠加专用智能填补能力空白,前提是任务必须可验证。

在软件层面,算子工程正从手工编写转向由 AI 辅助生成。虽然目前人类仍负责概念设计,但自动化趋势不可逆转。真正的壁垒在于对硬件极限效率的持续追逐,即“光速极限”文化。

07 / 世界上没有烂芯片,只有糟糕的定价:在不受待见的硬件里做算力套利

面对 Blackwell 芯片的短缺与高价,Neil 坚持“算力套利”策略。市场普遍存在"AMD 不如 NVIDIA"的偏见,这反而是低价囤积的好时机。Sail Research 擅长通过软件栈快速适配新芯片,榨取其比较优势。

关于半导体估值泡沫论,Neil 持不同看法:当年的网络投资多为投机,而如今的 token 消费产生即时价值,推理支出将单调递增,不存在投机泡沫。

08 / 95% 可用率的小机房才是推理的性价比之王

传统数据中心为追求 99.99% SLA 付出了天价冗余成本。Neil 反其道而行,愿意收购95% 可用率的分布式小机房。对于后台运行的长周期 Agent,偶尔的宕机可通过控制平面平滑迁移任务,用户无感知。

更进一步,利用太阳能和风能的间歇性电力,配合天气模型调度工作负载,可获取极低成本能源。这种“拾荒者战略”——捡拾被遗落的芯片与闲散电力,构建分布式的“小型钢厂”集群,将在经济效益上碾压单一巨型数据中心。

09 / 扩散不可阻挡:3 到 6 个月的闭源代差,撑不起高昂的溢价神话

前沿实验室为保持 3-6 个月的技术代差支付高昂溢价,但随着“隐性蒸馏”(基于 GitHub 等公开代码训练)的普及,信息扩散无法阻挡。企业迭代速度慢于技术更新,使得短时代的领先优势商业价值存疑。

Neil 渴望看到一个“丰裕未来”:充裕廉价的 token 百花齐放,每个人都能定制专属 Agent。智能不应是昂贵的咨询服务,而应普及至每一个人。

10 / 商业的本质是套利

Neil 最离经叛道的观点集中在芯片架构改造上,特别是将 KV Cache 大规模卸载至闪存,以突破 HBM 瓶颈。他认为“世界上对智能的需求永远是无限的”,关键在于降低接入门槛。

对于创业者,Neil 建议聚焦供应链瓶颈(晶圆、HBM、封装、电力),寻找巨头难以转身的切入点进行套利。NVIDIA 之所以不直接卖 token,是为了培育多元化的生态竞争,确保持续的需求增长。

回顾职业生涯,Neil 铭记导师的教诲:“能够贯通从门级晶圆硅片一直到构建大规模互联网服务的全栈细节,在世界上是极其罕见的。”这种全栈通透的境界,正是他追求的目标。

【声明】内容源于网络
0
0
AI科技大本营
为AI领域从业者提供人工智能领域热点报道和海量重磅访谈;面向技术人员,提供AI技术领域前沿研究进展和技术成长路线;面向垂直企业,实现行业应用与技术创新的对接。全方位触及人工智能时代,连接AI技术的创造者和使用者。
内容 7110
粉丝 0
AI科技大本营 为AI领域从业者提供人工智能领域热点报道和海量重磅访谈;面向技术人员,提供AI技术领域前沿研究进展和技术成长路线;面向垂直企业,实现行业应用与技术创新的对接。全方位触及人工智能时代,连接AI技术的创造者和使用者。
总阅读148.5k
粉丝0
内容7.1k