下载量
0
参数
36B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力来自基础模型 IFM/K2-Horizon-MoVA-36B-A4B:采用 MoE 与 MoVA 注意力,36B 参数中每 token 仅激活 4B,官方称在智能体工具调用、终端编程、科学推理等基准上优于约30B开源稠密模型。GGUF 仓库目前只发布 BF16 量化版本,需约23GB显存或26.5GB内存。运行需使用支持 K2 Horizon 架构的 llama.cpp(如 MBZUAI-IFM 分支),官方推荐 SGLang 与 vLLM 服务方案,Ollama 与 LM Studio 虽在标签中列出但需自行确认兼容性。
更适合谁
- 需要前沿级开源推理与智能体能力的研究与工程团队
- 拥有23GB以上显存或充足内存的本地部署者
- 能接受 BF16 大文件并配置定制 llama.cpp 的实验性用户
典型使用场景
- 智能体工具调用与终端编程任务
- 长文档理解与多轮对话场景
- 科研推理与事实问答应用
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
稀疏激活
总参数36B,每 token 仅激活4B,兼顾规模与单次推理成本
长上下文
原生 524,288 token 上下文,适合长文档与多轮任务
推理与工具调用
在 tau3-Banking、Terminal-Bench 等智能体基准上表现突出
代码与科学
Terminal-Bench 2.1 与 SciCode 表现与更大模型相当
硬件怎么准备
- BF16 需约23GB显存,推荐26.5GB以上
- 内存方案需26.5GB起步、推荐31.5GB
- 当前未提供更小量化,消费级显卡难以舒适运行
- 模型卡未提供 BF16 在该硬件上的实测速度与吞吐
量化版本怎么选
- 仓库目前仅提供 BF16 版本,文件约22.5GB
- 模型卡未提供 Q4、Q5、Q8 等更小量化选项
- 下载前需确认运行工具支持 K2 Horizon 架构
- BF16 对显存与内存要求较高,不适合低配设备
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| BF16 | 21 GB | 23 GB | 26.5 GB | 31.5 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 23GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26.5GB。
阅读 24GB 显存选型指南 →可以怎样运行
- 使用支持 K2 Horizon 架构的 llama.cpp(如 MBZUAI-IFM 分支)
- 官方推荐 SGLang 服务方案,已在 2×H200 上验证
- 官方提供 vLLM 部署配方
- Ollama 与 LM Studio 在标签中列出,需自行验证兼容性
采用前要知道的限制
- GGUF 仓库仅提供 BF16 一种量化,体积与显存门槛高
- llama.cpp 对 K2 Horizon 的支持仍为 PR 进行中,需使用定制分支
- 模型卡未说明量化后的推理速度与吞吐
- 模型卡未提供其他语言能力数据,仅列出英语