下载量
0
参数
12B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力来自 Google DeepMind 的 Gemma 4 12B Unified 基础模型,采用编码器自由的多模态架构,原生支持文本、图像、音频输入以及函数调用、思考模式等能力,并提供系统角色;本仓库为 Unsloth 提供的 GGUF 静态量化分发版,附带 MTP 多 token 预测支持,精度覆盖 IQ2 至 Q8 以及 BF16/F16;运行工具兼容 Ollama、llama.cpp 与 LM Studio。具体多模态细节与基准表现以官方模型卡为准。
更适合谁
- 想在本地笔记本或台式机运行多模态大模型的个人开发者
- 需要 256K 长上下文做长文档、PDF 与代码分析的研究者
- 偏好 Apache 2.0 协议、可商用部署的中小团队
- 同时关注语音转写、视觉问答与代码生成的复合需求用户
典型使用场景
- 本地多模态问答、图像理解与图表识别
- 长文档摘要、PDF/扫描件 OCR 与解析
- 代码生成、补全与调试助手
- 短音频自动转写与跨语种翻译
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
原生多模态
支持文本、图像、音频直接输入,无需外挂独立编码器
超长上下文
256K tokens 上下文窗口,配合滑动窗口与全局注意力混合机制
推理与编码
内置思考模式,GPQA Diamond 78.8%、LiveCodeBench v6 72%,覆盖数学与编程
多语言覆盖
预训练涵盖 140 多种语言,指令版支持 35 种以上输出语言
本地友好部署
12B 参数规模可量化到 Q2,适配消费级内存与显存
硬件怎么准备
- Q2 系列(IQ2_M、Q2_K_XL)文件约 3GB,最低 4GB 内存或 3.5GB 显存可加载
- Q3/Q4 系列(Q3_K_M、IQ3_XXS、IQ4_NL、Q4_0)文件约 4.5–6GB,推荐 8GB 内存或 6GB 以上显存
- Q5/Q6/Q8 量化文件约 7.5–12GB,建议显存 9.5–14.5GB 的消费级或工作站显卡
- BF16/F16 满精度文件约 7.5GB,需 9GB 内存或 8GB 显存起步
量化版本怎么选
- 资源紧张优先选 IQ2_M 或 Q2_K_XL,约 3GB 文件可在 8GB 内存机器上运行
- 平衡质量与体积可选 Q3_K_M 或 IQ4_NL,文件约 4.5–6GB
- 显存充裕推荐 Q6_K 或 Q8_0,质量更接近原始 BF16
- 长上下文任务需额外预留 KV 缓存空间,建议显存高于文件本身指示值
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ2 | 2.8 GB | 3.5 GB | 4.5 GB | 8 GB | 文件 ↗ |
| Q2 | 2.8 GB | 3.5 GB | 4.5 GB | 8 GB | 文件 ↗ |
| Q3 | 4.2 GB | 5 GB | 6 GB | 8 GB | 文件 ↗ |
| IQ3 | 4.2 GB | 5 GB | 6 GB | 8 GB | 文件 ↗ |
| IQ4 | 5.6 GB | 6.5 GB | 7.5 GB | 8.5 GB | 文件 ↗ |
| Q4 | 5.6 GB | 6.5 GB | 7.5 GB | 8.5 GB | 文件 ↗ |
| BF16 | 7.0 GB | 8 GB | 9.5 GB | 10.5 GB | 文件 ↗ |
| F16 | 7.0 GB | 8 GB | 9.5 GB | 10.5 GB | 文件 ↗ |
| Q5 | 7.0 GB | 8 GB | 9.5 GB | 10.5 GB | 文件 ↗ |
| GGUF | 7.0 GB | 8 GB | 9.5 GB | 10.5 GB | 文件 ↗ |
| Q6 | 8.4 GB | 9.5 GB | 11 GB | 13 GB | 文件 ↗ |
| Q8 | 11 GB | 12.5 GB | 14.5 GB | 17 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 3.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4.5GB。
阅读 8GB 显存选型指南 →可以怎样运行
- 通过 Ollama 拉取并直接运行 GGUF 量化版本
- 使用 LM Studio 加载 GGUF 文件进行图形化对话
- 通过 llama.cpp 命令行做纯 CPU 或 GPU 混合推理
- 配合 Transformers 加载原始权重用于开发与微调
采用前要知道的限制
- 音频输入最长支持 30 秒,视频最长 60 秒(按 1 帧/秒处理)
- 模型卡未说明针对中文手写与场景文字识别的具体效果
- 量化版本的推理速度与质量未经来源材料实测验证
- 12B 规模在复杂推理上弱于同系列 31B 与 26B A4B MoE