← 返回模型库

unsloth/gemma-4-26B-A4B-it-qat-GGUF

gemma-4-26B-A4B-it-qat-GGUF:面向图文与长上下文的26B MoE量化版

gemma-4-26B-A4B是Google DeepMind推出的多模态指令模型,总参数25.2B、激活约3.8B的MoE架构,支持256K长上下文、图文理解、可配置思考模式与原生函数调用。Unsloth在此基础上发布QAT量化GGUF仓库,Q4_0可在16GB级消费GPU本地运行。

长上下文多模态MoE本地部署GGUF量化推理Agent函数调用
查看模型源页面
下载量
0
参数
26B
上下文
未说明
架构 / 任务
gemma4
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来自Google DeepMind的Gemma 4系列26B A4B指令版本,支持文本与图像输入、256K上下文、可配置思考模式、原生函数调用与代码生成,采用8激活/128总专家加1共享专家的MoE结构,激活参数约3.8B但总参数25.2B。Unsloth在原QAT基础上发布GGUF仓库,提供Q4_0、Q8_0、BF16、F16精度及MTP推测解码草案用于加速推理。运行依赖llama.cpp生态,Ollama、LM Studio与最新版llama.cpp可加载并自动识别MTP drafter。模型卡未提供具体推理速度与详细训练数据说明。

更适合谁

  • 想要在本地部署26B级多模态模型的中高级开发者
  • 需要256K长上下文处理长文档、代码与推理任务的用户
  • 构建Agent与函数调用工作流的工程团队
  • 显存有限但希望接近BF16质量的消费级GPU使用者

典型使用场景

  • 长文档摘要、多文档问答与上下文检索
  • 图像OCR、图表理解、UI与截屏解析
  • 代码生成、调试与自动补全
  • 多语言翻译与图文混合推理

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

256K超长上下文窗口与混合滑动窗注意力

全局层统一KV并使用p-RoPE,优化长上下文内存占用

26B总参数仅激活约3.8B的MoE架构

8激活专家加1共享专家,推理显存与速度接近4B级模型

原生图文多模态理解

支持变分辨率输入、OCR、文档解析、UI截屏与图表理解等视觉任务

QAT量化保留接近BF16质量

在显著降低显存占用的同时维持原模型表现

原生思考模式与系统提示支持

适配Agent、工具调用与可控对话场景

硬件怎么准备

  • Q4_0主模型约13GB,最低约13.5GB显存,建议16GB消费级GPU
  • Q8_0主模型约26GB,最低约26.5GB显存,建议32GB以上专业卡
  • BF16/F16主模型约16.25GB,最低约16.5GB显存,建议19GB以上
  • 仅CPU运行需至少16GB内存,推荐24GB或更高配置

量化版本怎么选

  • 显存紧张时优先选择Q4_0,QAT训练保留接近BF16质量
  • 显存充足且追求精度时选Q8_0或BF16/F16
  • 想加速推理可搭配MTP推测解码草案使用
  • F16与BF16占用显存相同,可任选其一

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q412 GB13.5 GB15.5 GB18.5 GB文件 ↗
BF1615 GB16.5 GB19 GB23 GB文件 ↗
F1615 GB16.5 GB19 GB23 GB文件 ↗
GGUF15 GB16.5 GB19 GB23 GB文件 ↗
Q824 GB26.5 GB30.5 GB36.5 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 13.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 15.5GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • Ollama直接拉取仓库运行
  • LM Studio加载GGUF文件
  • llama.cpp通过-hf参数自动加载并启用MTP drafter
  • Unsloth Studio用于本地微调与推理

采用前要知道的限制

  • 26B A4B仅支持文本与图像输入,不支持音频处理
  • 模型卡未提供本地推理速度与吞吐数据
  • 量化版本相比原BF16可能存在轻微质量损失
  • MTP草案需要较新版本的llama.cpp才能自动识别