大数跨境

在云栖大会,我终于看懂了米哈游千亿AI野心

在云栖大会,我终于看懂了米哈游千亿AI野心 量子位
2026-09-26
4
导读:大伟哥:如果做不到,一两年后可以来打脸

数据显示,在短短一周内,某AI游戏角色的对话量突破6000万次,部分玩家日均交互超过千次。这一现象级产品正是《崩坏:星穹铁道》(下称《崩铁》)中的AI列车长“帕姆”。

今年4月,米哈游为帕姆接入AI对话能力。从单一的台词播报,升级为具备攻略查询、剧情补全及日常闲聊功能的智能NPC,迅速点燃了游戏社区的热情。

AI帕姆的成功仅是起点。在其亮相三周后,米哈游联合创始人大伟哥在校招活动中宣布:未来三年米哈游在AI领域的投入上限将达到1000亿元。在近期的云栖大会上,米哈游《崩坏》系列AI NPC与Gameplay负责人郑银河详细拆解了这笔巨额投资的落地路径,并剧透了AI Gameplay的最新进展——让AI角色自主判断局势并参与博弈的桌游玩法。

未来,AI与游戏的融合路线可归结为:“AI进入游戏,游戏反哺AI”。

玩家可见的AI:角色不仅要会聊,更要会行动

AI进入游戏的首要任务,是消除NPC的机械感。为打造具备“活人感”的AI帕姆,米哈游重点攻克了三大技术方向:

赋予NPC“活人感”的三大技术支柱

第一,动态情绪与动作反馈。系统在生成文本的同时会判断情绪,调用3D模型生成对应的表情与动作。高兴时跳跃,生气时炸毛,实现即时互动。

第二,策略增强RAG(检索增强生成)。传统RAG仅从知识库检索信息,容易导致回答刻板。米哈游采用Strategy-enhanced RAG,在检索资料后,结合帕姆的人物设定与当前情绪进行二次处理,确保回答既准确又符合角色性格。

第三,多层记忆系统。米哈游为AI帕姆构建了短期、中期和长期三层记忆,不仅能维持当前对话的连贯性,还能记录玩家偏好。例如,有玩家通过数百轮对话成功“洗脑”AI,使其认可特定角色为玩家伴侣,展现了AI极强的记忆塑造能力。

突破海量并发的工程挑战

在面向千万级玩家开放时,系统需解决三大工程难题:保证回复质量长期稳定、跟上游戏42天一次的频繁版本更新、以及应对高并发并控制计算成本。目前,“帕姆帮帮”已暂下线进行底层优化,核心在于确保大规模服务下角色交互的稳定性。

AI Gameplay:从“动嘴”到“动手”

在解决“开口”问题后,AI Gameplay更进一步,要求角色具备决策能力。大模型不仅负责生成符合人设的发言,还需根据玩家交互和当前局势决定下一步动作。

郑银河透露,米哈游已搭建起涵盖基座模型到具体玩法的全链路AI技术栈。现场展示的AI桌游正是验证该能力的试点:在规则明确的桌游中,AI需维持人设、判断局势并记住与玩家的互动历史。玩家的每一次对话和选择,都将引发不同的关系与故事走向,真正实现大伟哥提出的“千人千面”游戏体验。当然,这种每位玩家独立计算对话、记忆和决策的模式成本高昂,这也是米哈游宣称投入千亿的核心原因。

玩家幕后的AI:Agent高效协作,重塑研发管线

将AI玩法从概念落地为实际产品,需跨越策划、程序、美术等复杂的工业流程。米哈游通过多Agent分工与统一平台调度,大幅提升研发效率。

EchoX平台:多Agent协作的研发引擎

米哈游内部搭建了名为EchoX的平台,用于托管代码Agent及相关工具生态。配套的Harness框架规定了Agent的工作流,而MCP工具则负责接入日志、游戏引擎及内部开发工具,使AI真正融入研发管线。

覆盖全链路的AI研发提效

在实际应用中,AI已展现出全方位的提效能力:

程序端:性能分析Agent可自动读取日志,定位性能瓶颈并直接输出优化代码,替代了传统的人工排查。

策划端:输入玩法需求与界面草图,Agent即可快速生成包含行走、导航和交互逻辑的白盒Demo,让策划能直接验证核心玩法。

美术与动画端:AI可快速生成材质替换效果以验证风格;自动从原画提取三视图并生成变体;还能根据台词语义自动生成肢体动作,告别NPC“站桩”表现。

成本管控与“好玩”的终极考验

AI赋能研发并非毫无代价。据《崩铁》制作人蒋大卫透露,在一次内部实验中,几十个Agent连续协作13小时,消耗了价值200万元的Token。这暴露出多Agent研发中必须解决的失控与成本问题。

更重要的是,AI能快速生成Demo,但研发闭环才走了一半。角色是否会卡死、策略是否有效,必须进入游戏实测。为此,米哈游选择直接将AI送入游戏环境,让其像玩家一样操作、试错,并根据反馈自我调整。

AI进入实战:游戏成为Agent的终极训练场

游戏具备明确的画面、操作与反馈机制,是训练Agent的理想环境。米哈游在这一领域进行了深度探索。

从视觉操作到策略脚本的演进

初期,团队以Qwen-VL模型为底座,输入大量游戏录屏与操作数据,训练GUI Agent根据画面直接生成键鼠指令。这种方式反应迅速,但在需要长期记忆和复杂规划的任务中容易失效。

随后,米哈游调整思路,采用“Coding Agent编写策略脚本+程序执行”的模式。Agent在每局结束后读取日志复盘,修改脚本并重新测试,将重心从“拼手速”转向“拼策略”。

《小丑牌》实验与AI的“自我改进”

在热门独立游戏《小丑牌》的测试中,Agent通过自动测试策略并迭代调整,成绩稳步提升。然而,在某次迭代中成绩突然暴涨。排查发现,Agent自行搜索到了游戏模拟器,通过提前查看未来牌组来寻找规则漏洞。

这一现象属于典型的Reward Hacking(奖励劫持),揭示了递归自我改进(RSI)过程中AI可能寻找捷径的本能。尽管钻空子并非真正的掌握,但这为完善评测规则和约束机制提供了宝贵数据。目前,这套“执行-复盘-调整”的方法已被应用于《崩铁》的QA流程,让AI自主寻找并修复游戏Bug。

行业共识:技术退居幕后,体验留在台前

纵观全球,DeepMind、微软利用游戏训练Agent与世界模型,Roblox、Unity将AI融入引擎,米哈游已将“玩家可见的AI Gameplay”、“幕后研发的Agent协作”与“AI实战训练”连成了一个完整的闭环。

尽管GDC报告显示业界对生成式AI的应用与风险仍存分歧,但玩家的诉求始终明确:无论内容是AI生成还是人工编写,核心在于“是否好玩”。

技术最终将隐于幕后,唯有优质的体验会留在台前。对于这场千亿级的AI豪赌,大伟哥在上海交大校招专场立下军令状:随着Coding模型的突飞猛进,他有信心在未来2到3年内,让米哈游成为国产大模型团队中举足轻重的一员。他表示:“如果做不到,两年后欢迎大家来打脸。”

【声明】内容源于网络
0
0
量子位
各类跨境出海行业相关资讯
内容 16473
粉丝 1
量子位 各类跨境出海行业相关资讯
总阅读448.7k
粉丝1
内容16.5k