下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型本体:35B 总参数、3B 激活参数的 MoE 因果语言模型,256 个专家每次激活 8 路由 + 1 共享,专为智能体环境模拟训练,采用 CPT→SFT→RL(GSPO) 三阶段管线,默认上下文 262K。量化仓库:unsloth 提供 IQ2 至 Q8 共十一种 GGUF 量化及 BF16、MXFP4_MOE 版本,覆盖消费级到专业卡显存区间。运行工具:兼容 llama.cpp、Ollama、LMStudio 本地推理,同时支持 vLLM、SGLang、Hugging Face Transformers 部署 API 服务。模型卡未说明消费级显卡的具体推理速度。
更适合谁
- 智能体环境模拟与强化学习研究人员
- AgentWorldBench 多维评测与对比者
- 多工具调用 Agent 系统开发者
- 世界模型训练方案设计团队
典型使用场景
- 作为环境模拟器为强化学习 Agent 生成训练轨迹
- 多轮 GUI 与命令行环境交互状态预测
- 工具调用链路与软件工程任务的下一状态仿真
- AgentWorldBench 五维度(格式、事实性、一致性、真实感、质量)评测
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
七大域统一覆盖
单模型同时支持 MCP、搜索、终端、SWE、Android、Web、OS 文本与 GUI 交互环境
原生世界模型训练
从 CPT 阶段即以环境建模为目标,非通用模型后期适配
零样本域外泛化
可迁移到 OpenClaw 等分布外环境,并支持可控扰动与虚构世界构建
长链思维推理
默认 thinking mode 下推理环境状态转换后再输出预测观测
256 专家 MoE 高效推理
35B 总参数下仅激活 3B,平衡能力与推理资源
硬件怎么准备
- 入门 IQ2/IQ3 量化:至少 16GB 内存或 14GB 显存显卡
- 主流 IQ4 量化:建议 24GB 内存或 RTX 4090 级 20GB 显存
- 长上下文 128K+ 模拟:建议 32GB 以上内存或显存
- 完整 Q5_K_M/BF16:建议 32GB 显存专业卡或同等配置双卡
量化版本怎么选
- 显存充足时选 Q5_K_M 或 BF16 保真度最高
- 24GB 显卡可选 IQ4_NL 或 Q4_K_M 平衡质量与体积
- 16GB 显存推荐 IQ3_S 或 Q3_K_M 兼顾可用性
- IQ2_M 与 Q2_K_XL 仅供压缩测试,建议仅在极限低显存环境使用
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ2 | 8.1 GB | 9 GB | 10.5 GB | 12.5 GB | 文件 ↗ |
| Q2 | 8.1 GB | 9 GB | 10.5 GB | 12.5 GB | 文件 ↗ |
| IQ3 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
| Q3 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
| IQ4 | 16 GB | 18 GB | 20.5 GB | 24.5 GB | 文件 ↗ |
| Q4 | 16 GB | 18 GB | 20.5 GB | 24.5 GB | 文件 ↗ |
| BF16 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| GGUF | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| Q5 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| Q6 | 24 GB | 26.5 GB | 30.5 GB | 37 GB | 文件 ↗ |
| Q8 | 33 GB | 35.5 GB | 40.5 GB | 49 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 9GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 10.5GB。
阅读 12GB 显存选型指南 →可以怎样运行
- llama.cpp 直接加载 GGUF 文件
- Ollama 拉取与命令行启动
- LM Studio 图形界面推理
- vLLM 或 SGLang 部署 OpenAI 兼容 API 服务
采用前要知道的限制
- 模型卡未说明消费级显卡的具体推理速度与首字延迟
- 长上下文 128K 以上对显存与内存要求显著升高
- 训练目标聚焦环境模拟,非通用对话或写作
- 模型卡未明确说明中文场景下的支持程度
COMPARISON PATH
继续对比同类方案
不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。