← 返回模型库

unsloth/gemma-4-12B-it-qat-GGUF

gemma-4-12B-it-qat-GGUF:12B多模态本地量化指令版

Gemma 4 12B 统一架构指令调优版本,支持文本、图像与音频输入,输出仅文本,原生 256K 上下文,内置可配置思考模式与原生函数调用。Unsloth 提供 QAT 量化 GGUF 并附带 MTP 投机解码草稿模型,兼容 llama.cpp、Ollama 与 LM Studio。

多模态大模型本地推理GGUF量化长上下文
查看模型源页面
下载量
0
参数
12B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

Gemma 4 12B 由 Google DeepMind 发布,采用无编码器的 Unified 架构,将图像块与音频波形直接投影到 LLM 嵌入空间,原生支持文本、图像、音频三模态输入与文本输出,256K 上下文,可启用思考模式与函数调用,适合 Agentic 任务与长文档处理。本仓库为 Unsloth 打包的 QAT 量化 GGUF 集合,附 MTP 多令牌预测草稿模型以加速推理,兼容 llama.cpp、Ollama 与 LM Studio。模型卡未提供相对其他量化仓库的直接质量对比数据。

更适合谁

  • 想在本地消费级显卡运行多模态模型的个人开发者
  • 需要长上下文处理文档、代码或多轮对话的研究者与作者
  • 偏好单文件 GGUF 部署与量化感知训练质量的轻量化用户
  • 需要本地函数调用与 Agentic 能力的原型开发者

典型使用场景

  • 本地图像理解、文档解析与多模态问答
  • 长文档摘要、代码生成与补全
  • 带函数调用的 Agentic 流程与工具使用
  • 短音频自动语音识别与跨语言翻译

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

多模态统一架构

12B Unified 采用无编码器设计,图像与音频直接投影进 LLM 嵌入空间

超长上下文

原生 256K token 上下文窗口,适合长文档与多轮对话

思考与函数调用

内置可配置思考模式与原生函数调用,面向 Agentic 工作流

QAT 保持质量

通过量化感知训练,Q4_0 可在显著降低显存的同时接近 BF16 输出

MTP 投机解码

仓库附带 MTP 多令牌预测草稿,可与新版 llama.cpp 协同加速

硬件怎么准备

  • 纯文本与轻量多模态 Q4_0:约 7GB 内存或 6.5GB 显存即可加载
  • 完整多模态体验:建议 10GB 以上显存运行 BF16 或 F16 版本
  • Q8_0 更高保真:约 12.5GB 显存起步,推荐 14.5GB 以上显存
  • 启用 MTP 草稿模型时需额外显存容纳 drafter

量化版本怎么选

  • 显存紧张选 Q4_0:文件约 6GB,平衡内存占用与输出质量
  • 显存充足选 BF16 或 F16:文件约 7.5GB,更接近原生质量
  • 追求更高保真选 Q8_0:文件约 12GB,需要 14GB 以上内存
  • 多模态需配合 mmproj-F32.gguf 作为视觉与音频投影文件

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q45.6 GB6.5 GB7.5 GB8.5 GB文件 ↗
BF167.0 GB8 GB9.5 GB10.5 GB文件 ↗
F167.0 GB8 GB9.5 GB10.5 GB文件 ↗
GGUF7.0 GB8 GB9.5 GB10.5 GB文件 ↗
Q811 GB12.5 GB14.5 GB17 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 6.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 7.5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • 使用 llama.cpp 命令行加载 GGUF 文件进行推理
  • 通过 Ollama 拉取并运行该仓库模型
  • 使用 LM Studio 桌面端导入 GGUF 文件
  • 新版 llama.cpp 可自动从 -hf 仓库发现并启用 MTP 草稿模型

采用前要知道的限制

  • 仅支持文本输出,无法生成图像或音频
  • 音频输入最长 30 秒,视频输入最长 60 秒(按 1 帧/秒计)
  • 12B Unified 无专用视觉与音频编码器,依赖统一线性投影层
  • 模型卡未提供相对同尺寸竞品的速度与质量排名