大数跨境

阿里千问开源业内首个原生语言世界模型 Qwen-AgentWorld,内置七大 Agent 环境建模,基准得分超越 GPT-5.4 与 Claude Sonnet 4.6。

阿里千问开源业内首个原生语言世界模型 Qwen-AgentWorld,内置七大 Agent 环境建模,基准得分超越 GPT-5.4 与 Claude Sonnet 4.6。 AIGC Studio
2026-07-13
2
导读:点击下方名片关注AIGC Studio公众号!获取最新AI前沿应用/AIGC实践教程!
点击下方名片关注AIGC Studio公众号获取最新AI前沿应用/AIGC实践教程
扫描下方二维码,加入AIGC Studio知识星球可以获得最新AI前沿应用/AIGC实践教程/大厂面试经验/算法刷题IT各学科入门到精通学习资料学习/科研/工作/副业,强烈推荐!

Qwen-AgentWorld是一个原生语言世界模型,它通过跨越七个统一领域的长链推理来模拟智能体环境:MCP、搜索、终端、软件工程、安卓、Web 和操作系统。它通过一个三阶段流程进行训练:CPT 注入环境知识,SFT 激活下一状态预测推理,RL 提升模拟精度,训练数据来自超过 1000 万条真实世界的交互轨迹。与以往将世界建模视为事后附加功能的方法不同,Qwen-AgentWorld 是一个原生世界模型:从 CPT 阶段开始,环境建模就是训练目标。

主要特点:

  • 七大统一领域。首个在单一模型中涵盖七个智能体交互领域的语言世界模型。
  • 原生世界模型。从CPT开始进行环境建模,而非事后适应。
  • 通用性强、可扩展且可控的模拟器。可零样本泛化到面向对象设计(OOD)环境(例如,爪形智能体);可控扰动和虚拟世界构建超越了真实环境训练。
  • 智能体基础模型。LWM RL 在单轮非智能体轨迹上的预热可以迁移到多轮、工具调用智能体任务,涵盖七个基准测试,其中包括三个完全超出领域范围的测试。

方法改进

相比于传统的基于规则或基于统计的系统,LWM具有以下优点:

  • LWM是一种通用的世界模型,可以应用于多种不同的任务和领域。
  • LWM可以通过大规模的数据和多源的知识库来学习真实世界的环境行为,从而提高了模型的准确性和鲁棒性。
  • LWM可以与任何类型的代理系统集成,使其更加灵活和可扩展。

解决的问题

  • 如何建立一个通用的世界模型,以支持不同任务和领域的应用?
  • 如何利用大规模的数据和多源的知识库来提高模型的准确性和鲁棒性?

unsetunset相关链接unsetunset

  • 合集:https://modelscope.cn/collections/Qwen/Qwen-AgentWorld
  • 模型:https://modelscope.cn/models/Qwen/Qwen-AgentWorld-35B-A3
  • BBenchmark:https://modelscope.cn/datasets/Qwen/AgentWorldBench
  • 技术报告:https://modelscope.cn/papers/2606.24597
  • 代码:https://github.com/QwenLM/Qwen-AgentWorld
  • 博客:https://qwen.ai/blog?id=qwen-agentworld

unsetunset论文阅读unsetunset

方法概述

本文提出了一个名为“Language World Model”(LWM)的语言世界模型,并使用该模型训练了一个能够预测环境响应的系统。该模型可以用于多个领域,包括终端、搜索、Android、Web、操作系统等。LWM的核心思想是将每个任务分解为一系列动作和观察结果,并通过语言模型来学习这些动作和观察结果之间的关系。

LWM的训练分为三个阶段:持续预训练(CPT)、监督微调(SFT)和强化学习(RL)。在CPT阶段,模型通过大量的非思考轨迹数据和专门领域的知识库来学习真实世界的环境行为。在SFT阶段,模型通过显式地激活下一步预测作为推理模式来提高一致性并减少幻觉。在RL阶段,模型通过模拟器进行环境交互来进一步优化其性能。

方法改进

相比于传统的基于规则或基于统计的系统,LWM具有以下优点:

  • LWM是一种通用的世界模型,可以应用于多种不同的任务和领域。
  • LWM可以通过大规模的数据和多源的知识库来学习真实世界的环境行为,从而提高了模型的准确性和鲁棒性。
  • LWM可以与任何类型的代理系统集成,使其更加灵活和可扩展。

unsetunset实验结果unsetunset

文章比较了Qwen-AgentWorld和其他前沿模型(如DeepSeek-V4-Pro、GPT-5.4等)在七个领域的平均得分,结果表明Qwen-AgentWorld在五个维度上表现最佳,整体得分最高。

通过跨域泛化能力的实验,训练Stage 3(强化学习)只使用Terminal数据,在其他三个文本领域上测试,结果表明该模型具有较强的泛化能力。AgentWorldBench 构成概览。左图:涵盖七大领域的领域分布、映射至各领域的源基准测试,以及五项评估维度(格式、事实性、一致性、真实性、质量)。右图:统计摘要,包括各领域的平均上下文长度和轨迹深度。所有“地面真值”(ground-truth)观测数据均源自真实环境中的执行过程。

unsetunset结论unsetunset

Qwen-AgentWorld的应用价值,包括作为独立环境模拟器和可控仿真环境的应用。在独立环境模拟器方面,文章将Qwen-AgentWorld应用于OpenClaw平台,通过生成多样化的真实交互轨迹,验证了其能够有效扩展到新的交互环境家族的能力。在可控仿真环境方面,文章分别针对MCP和Search两个领域,通过环境适应和虚构世界建设两种方式,证明了Qwen-AgentWorld可以提高代理的鲁棒性和泛化能力。多个实验验证了Qwen-AgentWorld的优越性能和广泛应用前景。

感谢你看到这里,添加小助手 AIGC_Tech 加入官方 AIGC读者交流群,下方扫码加入 AIGC Studio 星球,获取前沿AI应用、AIGC实践教程、大厂面试经验、AI学习路线以及IT类入门到精通学习资料等,欢迎一起交流学习💗~

【声明】内容源于网络
0
0
AIGC Studio
一个有趣有AI的AIGC公众号:关注AI、深度学习、计算机视觉、AIGC、Stable Diffusion、Sora等相关技术。这里不仅有简单易懂的AIGC理论实践和AI学习路线,还有大厂工作经历和体会分享。如果有幸能给你一些帮助就更好啦!
内容 1254
粉丝 0
AIGC Studio 一个有趣有AI的AIGC公众号:关注AI、深度学习、计算机视觉、AIGC、Stable Diffusion、Sora等相关技术。这里不仅有简单易懂的AIGC理论实践和AI学习路线,还有大厂工作经历和体会分享。如果有幸能给你一些帮助就更好啦!
总阅读38.9k
粉丝0
内容1.3k