编者按
本期我们深度对话研究机器学习和机器视觉,现任英伟达(NVIDIA)机器学习工程师赵一方博士。他发表学术论文及专利50余项,论文被国内外同行引用1000+次(Google Scholar)。曾在CVPR(计算机视觉与模式识别会议,计算机视觉领域最具权威性的国际学术会议之一)Waymo Challenge中获得国际比赛冠军。
答:AI发展大致经历三个阶段:感知AI(2012年起,解决“看懂听懂”)、生成式AI(2022年ChatGPT爆发,生成图文视频代码)、代理式AI(Agentic AI)(当前,能推理、调用工具、执行多步骤任务并持续交互)。
算力需求呈现三个增长来源:预训练(需大规模GPU集群)、后训练(强化学习、合成数据、蒸馏等)、推理(长上下文、Agent普及后单次任务消耗Token和计算量大幅增加)。如今算力不再只是“训练一次要多少”,而是预训练、后训练、推理长期同时消耗,且未来推理和Agent工作负载的驱动力可能越来越强。
基础设施投资上,2026年四家科技巨头资本开支预计超6300亿美元,大量投入AI服务器、数据中心、网络、电力和冷却。竞争已从采购芯片扩展到整个数据中心系统,而电力、网络带宽和建设周期正成为算力扩张的新约束。
一句话总结:算力需求正从“训练为王”转向“训练+后训练+推理长期并重”,推理和Agent将成为未来增长主引擎。
问:AI编程模式发生了哪些变革?人类在其中的角色如何转变?
答:编程范式正在经历深刻变革。2025年前后,开发者还需通过精心设计的提示词“引导”AI逐步完成任务;到2026年,AI已能自主进行多轮尝试、验证和改进。人类只需设定目标——包括期望的输出标准、可用资源预算和终止条件等——AI即可自行编写代码、运行测试、修复错误,形成完整闭环。
人的角色从“教练”转变为“裁判”,主要精力放在制定规则上:明确验收标准、划定安全边界、评估最终结果,不再需要逐行审查代码。当然,顶层设计和方向把控依然至关重要。
答:需要。通用模型解决的是“通用能力”,但决定行业效果上限的,是企业长期积累的专业判断和业务经验,这些很难仅靠提示词写出来。
案例一:金融专家判断。通用模型经专家优化提示词后准确率仍不足80%,而用专家精标数据+强化学习训练的定制模型准确率达84.7%,推理成本下降13.8倍。企业需要的不是更大的模型,而是学会专家判断方式的模型。
案例二:文本生成SQL。瓶颈在数据质量——52.1%的训练数据存在标准答案错误。重新构建专家验证数据集后,模型准确率达92.97%,略超人类基准,单任务成本仅0.035美元。
结论:商业价值来自企业独有的专家数据、业务规则和判断。未来壁垒在于“有没有别人拿不到的专家数据,以及能否转化为模型能力”,同时垂直模型推理成本会大幅降低。
问:当前 AI 的发展热点是什么?
答:当前非常值得关注的方向是RSI(递归式自我改进)——AI开始参与研发下一代AI,从“人提想法、AI写代码”走向“AI自己提假设、做实验、分析结果、改进模型”。
多家前沿团队正布局这一方向:
OpenAI和Anthropic:让AI承担更多AI研究工作,从代码生成走向自主实验与研究判断;
Recursive Superintelligence(田渊栋等):自动化“提出想法—实现—实验—验证”的AI研究闭环;
Oak Lab(Richard Sutton):侧重持续学习,让智能体部署后仍能从经验中不断改进。
RSI也正向AI自动科研延伸:
Periodic Labs:构建“自动化实验室+高保真物理模拟+大语言模型助手”三位一体闭环,实现“提出假设—模拟验证—真实实验—分析结果—迭代”的自动科研;
Discovery Loop(Jeff Dean等):先以AI优化机器学习研究本身,再反哺优化自身技术栈,最终推广到硬件设计、药物发现、材料科学等更广领域。
结论:未来AI竞争将从Model Scaling(模型规模扩展)转向Research Scaling(研发能力和实验规模的扩展)。过去是人类不断训练更强的AI,而RSI的目标,是让AI开始参与甚至主导下一代AI和新知识的研发。
答:物理AI的核心目标是构建世界模型——一个融合视觉、听觉、触觉、传感器等多模态信号的统一框架。它不仅识别当前状态,更关键的是能预测动作执行后环境的变化,并据此做出合理决策。
与传统AI相比,物理AI有三点本质区别:
模态更丰富:不限于文本和图像,还能融合触觉、力觉、惯性测量等物理传感器信息,形成对真实世界的全面感知。
数据需求更大:物理世界状态空间和动作自由度远高于传统任务,每个动作涉及位置、速度、力等连续变量,数据组合呈爆炸式增长。
互联网数据不够用:互联网主要提供“观察数据”(看到什么),而物理AI更需要“交互数据”(做了什么、世界如何变化)。因此,物理AI高度依赖真实世界交互、仿真环境、合成数据和世界模型来获取训练信号。
问:什么是世界模型,为什么需要世界模型?
答:简单说,世界模型就是让AI学会“世界如何运作”——不仅要识别当前看到什么,还要理解空间、物理和动力学规律,并预测“如果我做某个动作,接下来会发生什么”。这对机器人和自动驾驶至关重要:进入物理世界后,AI必须能预测未来、模拟结果并规划行动。李飞飞将世界模型分为三类:
渲染器:生成逼真的视觉画面;
模拟器:保证几何、物理和动力学正确,作为虚拟训练场;
规划器:根据当前状态和目标,决定下一步动作。
三者共享对世界规律的理解——真正懂“杯子”的模型,既要能从不同角度生成它,也要能预测推一下会怎样,并规划如何拿起它。
Facebook首席人工智能科学家LeCun则强调:世界模型不必生成每个像素,关键是学习一个抽象的内部状态,在抽象空间里预测“状态+动作→未来状态”,让AI在行动前先内部模拟不同结果,再做决策。
核心价值:世界模型让AI从“看到什么就做什么”升级为“理解世界、预测未来、模拟结果、再做决策”。如果说大语言模型学的是“语言如何变化”,世界模型学的则是“真实世界如何变化”。
答:主要有两大难题。
第一是通用性不足。理想中我们希望一台机器人既能叠衣服又能炒菜还能整理房间,但现实中的机器人仍然高度专业化,距离“通用”还有相当距离。
第二是商业化落地困难。人形机器人基本还停留在实验室和原型阶段,宇树科技等国内代表企业的人形机器人年产量仍在千台级别,目前的主要采购方是高校、研究机构和政府采购项目,距离消费级市场仍有距离。
从感知到生成,从生成到自主决策,AI的技术浪潮一浪高过一浪。正如赵一方博士所言:“技术本身的突破只是故事的一半,如何让技术落地、兼顾创新和商业闭环,才是未来十年真正的考题。”
(本文根据对赵一方博士的专访整理而成,内容经本人审阅。)
上海外服培训中心,作为上海外服(集团)有限公司专注于人才培养与知识服务的专业平台,致力于为企业与人才提供高品质的培训解决方案。中心深度承载“上海产训融合技能发展中心”的战略职能——该中心是上海市首个在优质人力资源服务机构中探索设立的高能级、综合性技能人才培养平台,由上海市副市长亲自揭牌,旨在全面提升职业技能培训的前瞻性、针对性和有效性。
依托上海外服服务超5万家企业的深厚资源,中心精准对接人工智能、生物医药、智能制造等“3+6”产业体系,构建覆盖在校生、在职人员、求职者的全链条培养体系,持续为产业升级赋能、为人才发展筑基。

