← 返回模型库

unsloth/gemma-4-12b-it-GGUF

gemma-4-12b-it-GGUF:本地多模态对话与推理

由 Unsloth 发布的 Gemma 4 12B 指令微调量化版本,支持文本、图像和音频输入并输出文本,适合在消费级显卡或笔记本上做多模态对话、推理、编码与 OCR 任务。预训练覆盖 140 多种语言,长上下文可达 256K。

多模态长上下文本地部署多语言
查看模型源页面
下载量
0
参数
12B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来自 Google DeepMind 的 Gemma 4 12B Unified 基础模型,采用编码器自由的多模态架构,原生支持文本、图像、音频输入以及函数调用、思考模式等能力,并提供系统角色;本仓库为 Unsloth 提供的 GGUF 静态量化分发版,附带 MTP 多 token 预测支持,精度覆盖 IQ2 至 Q8 以及 BF16/F16;运行工具兼容 Ollama、llama.cpp 与 LM Studio。具体多模态细节与基准表现以官方模型卡为准。

更适合谁

  • 想在本地笔记本或台式机运行多模态大模型的个人开发者
  • 需要 256K 长上下文做长文档、PDF 与代码分析的研究者
  • 偏好 Apache 2.0 协议、可商用部署的中小团队
  • 同时关注语音转写、视觉问答与代码生成的复合需求用户

典型使用场景

  • 本地多模态问答、图像理解与图表识别
  • 长文档摘要、PDF/扫描件 OCR 与解析
  • 代码生成、补全与调试助手
  • 短音频自动转写与跨语种翻译

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

原生多模态

支持文本、图像、音频直接输入,无需外挂独立编码器

超长上下文

256K tokens 上下文窗口,配合滑动窗口与全局注意力混合机制

推理与编码

内置思考模式,GPQA Diamond 78.8%、LiveCodeBench v6 72%,覆盖数学与编程

多语言覆盖

预训练涵盖 140 多种语言,指令版支持 35 种以上输出语言

本地友好部署

12B 参数规模可量化到 Q2,适配消费级内存与显存

硬件怎么准备

  • Q2 系列(IQ2_M、Q2_K_XL)文件约 3GB,最低 4GB 内存或 3.5GB 显存可加载
  • Q3/Q4 系列(Q3_K_M、IQ3_XXS、IQ4_NL、Q4_0)文件约 4.5–6GB,推荐 8GB 内存或 6GB 以上显存
  • Q5/Q6/Q8 量化文件约 7.5–12GB,建议显存 9.5–14.5GB 的消费级或工作站显卡
  • BF16/F16 满精度文件约 7.5GB,需 9GB 内存或 8GB 显存起步

量化版本怎么选

  • 资源紧张优先选 IQ2_M 或 Q2_K_XL,约 3GB 文件可在 8GB 内存机器上运行
  • 平衡质量与体积可选 Q3_K_M 或 IQ4_NL,文件约 4.5–6GB
  • 显存充裕推荐 Q6_K 或 Q8_0,质量更接近原始 BF16
  • 长上下文任务需额外预留 KV 缓存空间,建议显存高于文件本身指示值

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ22.8 GB3.5 GB4.5 GB8 GB文件 ↗
Q22.8 GB3.5 GB4.5 GB8 GB文件 ↗
Q34.2 GB5 GB6 GB8 GB文件 ↗
IQ34.2 GB5 GB6 GB8 GB文件 ↗
IQ45.6 GB6.5 GB7.5 GB8.5 GB文件 ↗
Q45.6 GB6.5 GB7.5 GB8.5 GB文件 ↗
BF167.0 GB8 GB9.5 GB10.5 GB文件 ↗
F167.0 GB8 GB9.5 GB10.5 GB文件 ↗
Q57.0 GB8 GB9.5 GB10.5 GB文件 ↗
GGUF7.0 GB8 GB9.5 GB10.5 GB文件 ↗
Q68.4 GB9.5 GB11 GB13 GB文件 ↗
Q811 GB12.5 GB14.5 GB17 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 3.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4.5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • 通过 Ollama 拉取并直接运行 GGUF 量化版本
  • 使用 LM Studio 加载 GGUF 文件进行图形化对话
  • 通过 llama.cpp 命令行做纯 CPU 或 GPU 混合推理
  • 配合 Transformers 加载原始权重用于开发与微调

采用前要知道的限制

  • 音频输入最长支持 30 秒,视频最长 60 秒(按 1 帧/秒处理)
  • 模型卡未说明针对中文手写与场景文字识别的具体效果
  • 量化版本的推理速度与质量未经来源材料实测验证
  • 12B 规模在复杂推理上弱于同系列 31B 与 26B A4B MoE