下载量
0
参数
12B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
Gemma 4 12B 由 Google DeepMind 发布,采用无编码器的 Unified 架构,将图像块与音频波形直接投影到 LLM 嵌入空间,原生支持文本、图像、音频三模态输入与文本输出,256K 上下文,可启用思考模式与函数调用,适合 Agentic 任务与长文档处理。本仓库为 Unsloth 打包的 QAT 量化 GGUF 集合,附 MTP 多令牌预测草稿模型以加速推理,兼容 llama.cpp、Ollama 与 LM Studio。模型卡未提供相对其他量化仓库的直接质量对比数据。
更适合谁
- 想在本地消费级显卡运行多模态模型的个人开发者
- 需要长上下文处理文档、代码或多轮对话的研究者与作者
- 偏好单文件 GGUF 部署与量化感知训练质量的轻量化用户
- 需要本地函数调用与 Agentic 能力的原型开发者
典型使用场景
- 本地图像理解、文档解析与多模态问答
- 长文档摘要、代码生成与补全
- 带函数调用的 Agentic 流程与工具使用
- 短音频自动语音识别与跨语言翻译
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
多模态统一架构
12B Unified 采用无编码器设计,图像与音频直接投影进 LLM 嵌入空间
超长上下文
原生 256K token 上下文窗口,适合长文档与多轮对话
思考与函数调用
内置可配置思考模式与原生函数调用,面向 Agentic 工作流
QAT 保持质量
通过量化感知训练,Q4_0 可在显著降低显存的同时接近 BF16 输出
MTP 投机解码
仓库附带 MTP 多令牌预测草稿,可与新版 llama.cpp 协同加速
硬件怎么准备
- 纯文本与轻量多模态 Q4_0:约 7GB 内存或 6.5GB 显存即可加载
- 完整多模态体验:建议 10GB 以上显存运行 BF16 或 F16 版本
- Q8_0 更高保真:约 12.5GB 显存起步,推荐 14.5GB 以上显存
- 启用 MTP 草稿模型时需额外显存容纳 drafter
量化版本怎么选
- 显存紧张选 Q4_0:文件约 6GB,平衡内存占用与输出质量
- 显存充足选 BF16 或 F16:文件约 7.5GB,更接近原生质量
- 追求更高保真选 Q8_0:文件约 12GB,需要 14GB 以上内存
- 多模态需配合 mmproj-F32.gguf 作为视觉与音频投影文件
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 6.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 7.5GB。
阅读 8GB 显存选型指南 →可以怎样运行
- 使用 llama.cpp 命令行加载 GGUF 文件进行推理
- 通过 Ollama 拉取并运行该仓库模型
- 使用 LM Studio 桌面端导入 GGUF 文件
- 新版 llama.cpp 可自动从 -hf 仓库发现并启用 MTP 草稿模型
采用前要知道的限制
- 仅支持文本输出,无法生成图像或音频
- 音频输入最长 30 秒,视频输入最长 60 秒(按 1 帧/秒计)
- 12B Unified 无专用视觉与音频编码器,依赖统一线性投影层
- 模型卡未提供相对同尺寸竞品的速度与质量排名