下载量
0
参数
26B
上下文
未说明
架构 / 任务
gemma4
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力来自Google DeepMind的Gemma 4系列26B A4B指令版本,支持文本与图像输入、256K上下文、可配置思考模式、原生函数调用与代码生成,采用8激活/128总专家加1共享专家的MoE结构,激活参数约3.8B但总参数25.2B。Unsloth在原QAT基础上发布GGUF仓库,提供Q4_0、Q8_0、BF16、F16精度及MTP推测解码草案用于加速推理。运行依赖llama.cpp生态,Ollama、LM Studio与最新版llama.cpp可加载并自动识别MTP drafter。模型卡未提供具体推理速度与详细训练数据说明。
更适合谁
- 想要在本地部署26B级多模态模型的中高级开发者
- 需要256K长上下文处理长文档、代码与推理任务的用户
- 构建Agent与函数调用工作流的工程团队
- 显存有限但希望接近BF16质量的消费级GPU使用者
典型使用场景
- 长文档摘要、多文档问答与上下文检索
- 图像OCR、图表理解、UI与截屏解析
- 代码生成、调试与自动补全
- 多语言翻译与图文混合推理
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
256K超长上下文窗口与混合滑动窗注意力
全局层统一KV并使用p-RoPE,优化长上下文内存占用
26B总参数仅激活约3.8B的MoE架构
8激活专家加1共享专家,推理显存与速度接近4B级模型
原生图文多模态理解
支持变分辨率输入、OCR、文档解析、UI截屏与图表理解等视觉任务
QAT量化保留接近BF16质量
在显著降低显存占用的同时维持原模型表现
原生思考模式与系统提示支持
适配Agent、工具调用与可控对话场景
硬件怎么准备
- Q4_0主模型约13GB,最低约13.5GB显存,建议16GB消费级GPU
- Q8_0主模型约26GB,最低约26.5GB显存,建议32GB以上专业卡
- BF16/F16主模型约16.25GB,最低约16.5GB显存,建议19GB以上
- 仅CPU运行需至少16GB内存,推荐24GB或更高配置
量化版本怎么选
- 显存紧张时优先选择Q4_0,QAT训练保留接近BF16质量
- 显存充足且追求精度时选Q8_0或BF16/F16
- 想加速推理可搭配MTP推测解码草案使用
- F16与BF16占用显存相同,可任选其一
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 13.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 15.5GB。
阅读 24GB 显存选型指南 →可以怎样运行
- Ollama直接拉取仓库运行
- LM Studio加载GGUF文件
- llama.cpp通过-hf参数自动加载并启用MTP drafter
- Unsloth Studio用于本地微调与推理
采用前要知道的限制
- 26B A4B仅支持文本与图像输入,不支持音频处理
- 模型卡未提供本地推理速度与吞吐数据
- 量化版本相比原BF16可能存在轻微质量损失
- MTP草案需要较新版本的llama.cpp才能自动识别