Qwen-AgentWorld

3周前发布 499 0 0

阿里千问2026年6月24日发布的首个原生语言世界模型,用纯文本统一模拟七大数字环境,让智能体在"虚拟世界"中练手。

语言:
zh,en
收录时间:
2026-06-24
Qwen-AgentWorldQwen-AgentWorld

Qwen-AgentWorld是什么?

Qwen-AgentWorld 是通义千问团队于 2026年6月24日 正式推出的业界首个“原生语言世界模型”(Language World Model, LWM)。它并非传统的通用大语言模型,而是专为 AI 智能体(Agent)研发与训练打造的基础模型。该模型基于超过 1000 万条真实环境交互轨迹,通过 CPT(持续预训练)→ SFT(监督微调)→ RL(强化学习)的三阶段训练打造,旨在让智能体在执行真实操作前,能够在内部“脑补”并预测环境的反馈,从而做出更聪明、安全的决策。目前,该模型已全面开源,提供 35B-A3B(轻量版)与 397B-A17B(旗舰版)两种规模。

Qwen-AgentWorld的主要功能

  1. 七域统一环境模拟:单一模型即可覆盖七大智能体交互环境。包括文本类环境(MCP工具调用、Search搜索、Terminal终端、SWE软件工程)以及 GUI 类环境(Web浏览器、OS操作系统、Android移动端)。对于 GUI 领域,模型通过无障碍树、HTML 等可渲染代码而非原始像素来表示状态,实现了纯文本对视觉环境的建模。
  2. 长思维链状态预测:模型能够接收当前状态与智能体动作,通过长思维链(CoT)推理,精确预测出下一屏 UI、终端输出或报错信息等环境反馈。
  3. 可控对抗模拟:支持通过自然语言指令注入特定模拟指令(如“隐藏部分搜索结果”或“模拟磁盘满报错”),系统性地生成真实环境中罕见的边缘案例,用于智能体的对抗训练。
  4. 跨域知识迁移:得益于原生世界建模,模型在不同领域的知识可以互相迁移,例如在“操作网页”中学到的能力可以帮助其更快学会“操作手机 App”。

Qwen-AgentWorld的使用场景

Qwen-AgentWorld 的核心价值在于为 AI 智能体提供低成本、高可控的“虚拟训练场”和决策辅助,主要应用于以下场景:

  1. 智能体强化学习训练(解耦模拟器):替代真实环境或沙箱,让 AI 智能体在虚拟环境中进行大规模、回合级的强化学习训练。这种方式不仅成本低、速度快,还能避免真实环境中的不可逆危险操作。
  2. 智能体决策增强(统一基础模型):直接作为智能体的骨干模型,将环境建模能力内化为“反思”或“先想再做”的前向思考模式。智能体在真实执行动作前,先在内部预测环境变化,从而提升下游任务表现。
  3. 企业级自动化与数字员工:适用于需要在命令行、网页、桌面软件及手机 App 间无缝切换的复杂任务,如智能客服、自动化办公、软件测试等,能够大幅降低多智能体协同开发的难度与成本。

项目地址

  • GitHub开源地址:https://github.com/QwenLM/Qwen-AgentWorld
  • ModelScope开源地址:https://modelscope.cn/collections/Qwen/qwen-agentworld
  • Hugging Face:https://huggingface.co/collections/Qwen/qwen-agentworld
  • 演示地址:https://qwen.ai/blog?id=qwen-agentworld#interactive-demo-interactive-demo

如何使用Qwen-AgentWorld?

Qwen-AgentWorld 支持两种互补的使用范式:

  1. 作为解耦的环境模拟器(Decoupled):开发者可将模型部署为独立的环境模拟器,通过 API 接收当前的 (state, action),模型将返回预测的 next_state。这种方式无需搭建真实的沙箱或虚拟机,即可支撑大规模的智能体强化学习训练。
  2. 作为统一的智能体基础模型(Unified):直接将 Qwen-AgentWorld 作为智能体的核心骨干。其内置的世界建模能力可辅助动作选择,在 Terminal-Bench、SWE-Bench、Claw-Eval 等基准上开箱即用,且无需针对特定智能体任务进行额外的 RL 微调即可展现强泛化能力。

同类产品对比

对比维度 Qwen-AgentWorld (阿里) 传统通用大模型 (如 GPTs 生态) Agent World (字节·扣子) WebWorld
核心定位 原生多域语言世界模型 通用大模型 + 事后插件适配 智能体产品平台(生存空间) 单一 Web 领域专用世界模型
环境覆盖 7 大域 (MCP/Search/Terminal/

SWE/Web/OS/Android)

需独立适配,多环境适配成本高 分配云电脑、身份与社交关系 仅覆盖 Web 浏览单一域
训练范式 从 CPT 阶段即端到端训练环境建模 预训练后通过微调或外挂工具学习 侧重于真实环境中的自我进化 大规模 Web 智能体训练专用
核心优势 跨域泛化能力强,支持可控对抗模拟 通用对话与逻辑推理能力强 提供真实的自动扩充练兵场 专注于网页交互的深度模拟

数据统计

相关导航

暂无评论

none
暂无评论...