← 返回模型库

unsloth/gemma-4-26B-A4B-it-GGUF

gemma-4-26B-A4B-it-GGUF:本地推理多模态MoE对话模型

Google Gemma 4 26B A4B 是 MoE 架构的多模态模型,总参数 26B、激活约 4B,支持文本与图像输入、文本输出,256K 上下文窗口,覆盖 140 多种语言。适合在消费级 GPU 或工作站做本地对话、代码、推理与图文理解。Apache 2.

多模态对话本地推理图文理解
查看模型源页面
下载量
0
参数
26B
上下文
未说明
架构 / 任务
gemma4
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库为 Unsloth 发布的 Gemma 4 26B A4B 指令微调版 GGUF 量化仓库,源自 Google DeepMind 开源模型。模型能力来自官方模型卡:支持文本生成、代码、推理、256K 长上下文、140 多种语言、图文多模态理解(不含音频)、原生函数调用与可配置思考模式;架构为 MoE,128 个专家中激活 8 个加 1 个共享。仓库本身仅做量化与分发,模型卡未说明相对其他量化仓库的速度对比。运行工具覆盖 Ollama、llama.cpp 与 LM Studio。

更适合谁

  • 拥有 16GB 以上显存的消费级 GPU 用户
  • 需要图文理解与 256K 长上下文的本地推理用户
  • 兼顾响应速度与模型能力的 MoE 部署者
  • 在本地运行 26B 级对话与编码 Agent 的开发者

典型使用场景

  • 本地多轮对话与虚拟助手
  • 图文混合问答、文档与图表解析
  • 代码生成、补全与 Agent 工作流
  • 长文本摘要与研究报告问答

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

MoE 高效推理

总参数 26B 但仅激活约 4B,接近 4B 模型的推理开销

长上下文支持

上下文窗口达 256K tokens,适合长文档与多轮对话

多模态图文理解

支持文本与图像输入,覆盖文档解析、图表、OCR 等视觉任务

原生函数调用与思考模式

支持结构化工具调用与可配置逐步推理

多语言输出

预训练覆盖 140 多种语言,开箱即用多语种对话

硬件怎么准备

  • IQ2_M 与 Q2_K_XL:约 6.5GB 文件,最低 8GB 内存或 7GB 显存,推荐 9.5GB/8GB
  • IQ3_S 与 Q3_K_M:约 9.75GB 文件,最低 11.5GB 内存或 10GB 显存,推荐 14GB/11.5GB
  • IQ4_NL 与 Q4_K_M:约 13GB 文件,最低 15.5GB 内存或 13.5GB 显存,推荐 18.5GB/15.5GB
  • Q5_K_M、BF16、F16、MXFP4_MOE:约 16.25GB 文件,最低 19GB 内存或 16.5GB 显存,推荐 23GB/19GB

量化版本怎么选

  • 显存或内存紧张时可先尝试 IQ2_M 或 Q2_K_XL 极低量化
  • 显存 12–16GB 建议选 IQ4_NL 或 Q4_K_M 平衡质量与体积
  • 显存 16GB 以上且追求质量可选 Q5_K_M、F16 或 BF16 档位
  • Q6_K 与 Q8_0 适合 24GB 及以上显存或大内存工作站

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ26.1 GB7 GB8 GB9.5 GB文件 ↗
Q26.1 GB7 GB8 GB9.5 GB文件 ↗
IQ39.1 GB10 GB11.5 GB14 GB文件 ↗
Q39.1 GB10 GB11.5 GB14 GB文件 ↗
IQ412 GB13.5 GB15.5 GB18.5 GB文件 ↗
Q412 GB13.5 GB15.5 GB18.5 GB文件 ↗
BF1615 GB16.5 GB19 GB23 GB文件 ↗
F1615 GB16.5 GB19 GB23 GB文件 ↗
GGUF15 GB16.5 GB19 GB23 GB文件 ↗
Q515 GB16.5 GB19 GB23 GB文件 ↗
Q618 GB20 GB23 GB27.5 GB文件 ↗
Q824 GB26.5 GB30.5 GB36.5 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • 通过 llama.cpp 命令行加载 GGUF 文件运行
  • 在 Ollama 中拉取并启动本地推理服务
  • 在 LM Studio 中选择对应量化档位加载
  • 使用 Unsloth Studio 进行工具调用与微调示例

采用前要知道的限制

  • 模型卡未说明具体生成速度与吞吐表现
  • 26B A4B 变体不支持音频输入,仅 E2B/E4B 支持音频
  • IQ2 与 Q2 等低比特量化可能影响长上下文与复杂推理质量
  • 视频需按帧序列传入,多模态仅覆盖文本与图像