← 返回模型库

IFM/K2-Horizon-MoVA-36B-A4B-GGUF

K2-Horizon-MoVA-36B-A4B-GGUF:36B总参4B激活的MoE长上下文推理

IFM 推出的 K2-Horizon-MoVA-36B-A4B 是稀疏 MoE 模型,总参数36B、每 token 仅激活4B,主打512K长上下文、推理与智能体工具调用。当前 GGUF 仓库仅提供 BF16 文件,显存门槛约23GB、内存26.5GB起步,需支持 K2 Horizon 架构的 llama.

MoE推理长上下文智能体工具调用代码生成
查看模型源页面
下载量
0
参数
36B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来自基础模型 IFM/K2-Horizon-MoVA-36B-A4B:采用 MoE 与 MoVA 注意力,36B 参数中每 token 仅激活 4B,官方称在智能体工具调用、终端编程、科学推理等基准上优于约30B开源稠密模型。GGUF 仓库目前只发布 BF16 量化版本,需约23GB显存或26.5GB内存。运行需使用支持 K2 Horizon 架构的 llama.cpp(如 MBZUAI-IFM 分支),官方推荐 SGLang 与 vLLM 服务方案,Ollama 与 LM Studio 虽在标签中列出但需自行确认兼容性。

更适合谁

  • 需要前沿级开源推理与智能体能力的研究与工程团队
  • 拥有23GB以上显存或充足内存的本地部署者
  • 能接受 BF16 大文件并配置定制 llama.cpp 的实验性用户

典型使用场景

  • 智能体工具调用与终端编程任务
  • 长文档理解与多轮对话场景
  • 科研推理与事实问答应用

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

稀疏激活

总参数36B,每 token 仅激活4B,兼顾规模与单次推理成本

长上下文

原生 524,288 token 上下文,适合长文档与多轮任务

推理与工具调用

在 tau3-Banking、Terminal-Bench 等智能体基准上表现突出

代码与科学

Terminal-Bench 2.1 与 SciCode 表现与更大模型相当

硬件怎么准备

  • BF16 需约23GB显存,推荐26.5GB以上
  • 内存方案需26.5GB起步、推荐31.5GB
  • 当前未提供更小量化,消费级显卡难以舒适运行
  • 模型卡未提供 BF16 在该硬件上的实测速度与吞吐

量化版本怎么选

  • 仓库目前仅提供 BF16 版本,文件约22.5GB
  • 模型卡未提供 Q4、Q5、Q8 等更小量化选项
  • 下载前需确认运行工具支持 K2 Horizon 架构
  • BF16 对显存与内存要求较高,不适合低配设备

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
BF1621 GB23 GB26.5 GB31.5 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 23GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26.5GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • 使用支持 K2 Horizon 架构的 llama.cpp(如 MBZUAI-IFM 分支)
  • 官方推荐 SGLang 服务方案,已在 2×H200 上验证
  • 官方提供 vLLM 部署配方
  • Ollama 与 LM Studio 在标签中列出,需自行验证兼容性

采用前要知道的限制

  • GGUF 仓库仅提供 BF16 一种量化,体积与显存门槛高
  • llama.cpp 对 K2 Horizon 的支持仍为 PR 进行中,需使用定制分支
  • 模型卡未说明量化后的推理速度与吞吐
  • 模型卡未提供其他语言能力数据,仅列出英语