← 返回模型库

unsloth/Qwen-AgentWorld-35B-A3B-GGUF

Qwen-AgentWorld-35B-A3B-GGUF:智能体环境模拟世界模型

Qwen-AgentWorld-35B-A3B 是原生语言世界模型,专注智能体环境模拟,覆盖 MCP 工具调用、搜索、终端、SWE、Android、Web、OS 七个交互域,通过长链思维推理预测下一环境状态。适合智能体框架研究者、AgentWorldBench 评测用户及多工具调用 Agent 系统开发者使用。

世界模型智能体环境模拟Agent 评测环境状态预测
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型本体:35B 总参数、3B 激活参数的 MoE 因果语言模型,256 个专家每次激活 8 路由 + 1 共享,专为智能体环境模拟训练,采用 CPT→SFT→RL(GSPO) 三阶段管线,默认上下文 262K。量化仓库:unsloth 提供 IQ2 至 Q8 共十一种 GGUF 量化及 BF16、MXFP4_MOE 版本,覆盖消费级到专业卡显存区间。运行工具:兼容 llama.cpp、Ollama、LMStudio 本地推理,同时支持 vLLM、SGLang、Hugging Face Transformers 部署 API 服务。模型卡未说明消费级显卡的具体推理速度。

更适合谁

  • 智能体环境模拟与强化学习研究人员
  • AgentWorldBench 多维评测与对比者
  • 多工具调用 Agent 系统开发者
  • 世界模型训练方案设计团队

典型使用场景

  • 作为环境模拟器为强化学习 Agent 生成训练轨迹
  • 多轮 GUI 与命令行环境交互状态预测
  • 工具调用链路与软件工程任务的下一状态仿真
  • AgentWorldBench 五维度(格式、事实性、一致性、真实感、质量)评测

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

七大域统一覆盖

单模型同时支持 MCP、搜索、终端、SWE、Android、Web、OS 文本与 GUI 交互环境

原生世界模型训练

从 CPT 阶段即以环境建模为目标,非通用模型后期适配

零样本域外泛化

可迁移到 OpenClaw 等分布外环境,并支持可控扰动与虚构世界构建

长链思维推理

默认 thinking mode 下推理环境状态转换后再输出预测观测

256 专家 MoE 高效推理

35B 总参数下仅激活 3B,平衡能力与推理资源

硬件怎么准备

  • 入门 IQ2/IQ3 量化:至少 16GB 内存或 14GB 显存显卡
  • 主流 IQ4 量化:建议 24GB 内存或 RTX 4090 级 20GB 显存
  • 长上下文 128K+ 模拟:建议 32GB 以上内存或显存
  • 完整 Q5_K_M/BF16:建议 32GB 显存专业卡或同等配置双卡

量化版本怎么选

  • 显存充足时选 Q5_K_M 或 BF16 保真度最高
  • 24GB 显卡可选 IQ4_NL 或 Q4_K_M 平衡质量与体积
  • 16GB 显存推荐 IQ3_S 或 Q3_K_M 兼顾可用性
  • IQ2_M 与 Q2_K_XL 仅供压缩测试,建议仅在极限低显存环境使用

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ28.1 GB9 GB10.5 GB12.5 GB文件 ↗
Q28.1 GB9 GB10.5 GB12.5 GB文件 ↗
IQ312 GB13.5 GB15.5 GB18.5 GB文件 ↗
Q312 GB13.5 GB15.5 GB18.5 GB文件 ↗
IQ416 GB18 GB20.5 GB24.5 GB文件 ↗
Q416 GB18 GB20.5 GB24.5 GB文件 ↗
BF1620 GB22.5 GB26 GB31 GB文件 ↗
GGUF20 GB22.5 GB26 GB31 GB文件 ↗
Q520 GB22.5 GB26 GB31 GB文件 ↗
Q624 GB26.5 GB30.5 GB37 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 9GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 10.5GB。

阅读 12GB 显存选型指南 →

可以怎样运行

  • llama.cpp 直接加载 GGUF 文件
  • Ollama 拉取与命令行启动
  • LM Studio 图形界面推理
  • vLLM 或 SGLang 部署 OpenAI 兼容 API 服务

采用前要知道的限制

  • 模型卡未说明消费级显卡的具体推理速度与首字延迟
  • 长上下文 128K 以上对显存与内存要求显著升高
  • 训练目标聚焦环境模拟,非通用对话或写作
  • 模型卡未明确说明中文场景下的支持程度

COMPARISON PATH

继续对比同类方案

不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。