下载量
0
参数
26B
上下文
未说明
架构 / 任务
gemma4
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本仓库为 Unsloth 发布的 Gemma 4 26B A4B 指令微调版 GGUF 量化仓库,源自 Google DeepMind 开源模型。模型能力来自官方模型卡:支持文本生成、代码、推理、256K 长上下文、140 多种语言、图文多模态理解(不含音频)、原生函数调用与可配置思考模式;架构为 MoE,128 个专家中激活 8 个加 1 个共享。仓库本身仅做量化与分发,模型卡未说明相对其他量化仓库的速度对比。运行工具覆盖 Ollama、llama.cpp 与 LM Studio。
更适合谁
- 拥有 16GB 以上显存的消费级 GPU 用户
- 需要图文理解与 256K 长上下文的本地推理用户
- 兼顾响应速度与模型能力的 MoE 部署者
- 在本地运行 26B 级对话与编码 Agent 的开发者
典型使用场景
- 本地多轮对话与虚拟助手
- 图文混合问答、文档与图表解析
- 代码生成、补全与 Agent 工作流
- 长文本摘要与研究报告问答
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
MoE 高效推理
总参数 26B 但仅激活约 4B,接近 4B 模型的推理开销
长上下文支持
上下文窗口达 256K tokens,适合长文档与多轮对话
多模态图文理解
支持文本与图像输入,覆盖文档解析、图表、OCR 等视觉任务
原生函数调用与思考模式
支持结构化工具调用与可配置逐步推理
多语言输出
预训练覆盖 140 多种语言,开箱即用多语种对话
硬件怎么准备
- IQ2_M 与 Q2_K_XL:约 6.5GB 文件,最低 8GB 内存或 7GB 显存,推荐 9.5GB/8GB
- IQ3_S 与 Q3_K_M:约 9.75GB 文件,最低 11.5GB 内存或 10GB 显存,推荐 14GB/11.5GB
- IQ4_NL 与 Q4_K_M:约 13GB 文件,最低 15.5GB 内存或 13.5GB 显存,推荐 18.5GB/15.5GB
- Q5_K_M、BF16、F16、MXFP4_MOE:约 16.25GB 文件,最低 19GB 内存或 16.5GB 显存,推荐 23GB/19GB
量化版本怎么选
- 显存或内存紧张时可先尝试 IQ2_M 或 Q2_K_XL 极低量化
- 显存 12–16GB 建议选 IQ4_NL 或 Q4_K_M 平衡质量与体积
- 显存 16GB 以上且追求质量可选 Q5_K_M、F16 或 BF16 档位
- Q6_K 与 Q8_0 适合 24GB 及以上显存或大内存工作站
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ2 | 6.1 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| Q2 | 6.1 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| IQ3 | 9.1 GB | 10 GB | 11.5 GB | 14 GB | 文件 ↗ |
| Q3 | 9.1 GB | 10 GB | 11.5 GB | 14 GB | 文件 ↗ |
| IQ4 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
| Q4 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
| BF16 | 15 GB | 16.5 GB | 19 GB | 23 GB | 文件 ↗ |
| F16 | 15 GB | 16.5 GB | 19 GB | 23 GB | 文件 ↗ |
| GGUF | 15 GB | 16.5 GB | 19 GB | 23 GB | 文件 ↗ |
| Q5 | 15 GB | 16.5 GB | 19 GB | 23 GB | 文件 ↗ |
| Q6 | 18 GB | 20 GB | 23 GB | 27.5 GB | 文件 ↗ |
| Q8 | 24 GB | 26.5 GB | 30.5 GB | 36.5 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- 通过 llama.cpp 命令行加载 GGUF 文件运行
- 在 Ollama 中拉取并启动本地推理服务
- 在 LM Studio 中选择对应量化档位加载
- 使用 Unsloth Studio 进行工具调用与微调示例
采用前要知道的限制
- 模型卡未说明具体生成速度与吞吐表现
- 26B A4B 变体不支持音频输入,仅 E2B/E4B 支持音频
- IQ2 与 Q2 等低比特量化可能影响长上下文与复杂推理质量
- 视频需按帧序列传入,多模态仅覆盖文本与图像