HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP:去审查多模态长文推理与创作
基于 Google Gemma 4 26B-A4B 的去审查微调版本,26B 总参数配 4B 激活 MoE 架构,原生支持 256K 上下文与图像输入。适合需要开放式回答的智能体编程、创意写作、角色扮演与长文档推理用户,建议单卡约 16 GB 显存或 18.5 GB 内存起步,搭配 MTP 草稿头可在 llama.
MODEL POSITIONING
这个模型解决什么问题?
模型能力来自 Gemma 4 官方 26B-A4B MoE 基座与 image-text-to-text 任务标签,涵盖多模态、智能体、编程、创意写作与角色扮演方向。HauhauCS 仓库只做去审查与配套采样参数调整,未改动原数据集与能力,并只发布 Q4_K_M 一种文本量化,同时附带 mmproj 视觉与 MTP 投机解码草稿头两个配套文件。运行时主要面向 llama.cpp 体系,模型卡明确在该工具下验证 MTP 加速效果,并提醒 LM Studio 多卡 tensor-split 模式可能崩溃。模型卡未提供基准跑分与训练数据细节。
更适合谁
- 需要长上下文与图像理解的中文本地用户
- 智能体编程、长文档推理与创意写作开发者
- 希望获得开放式回答的角色扮演与对话用户
- 拥有 16 GB 以上显存并希望启用 MTP 加速的玩家
典型使用场景
- 智能体编程与多步代码推理
- 长文档摘要、检索增强与多轮分析
- 创意写作与角色扮演开放对话
- 图像理解与图文混合问答
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
256K 超长上下文
模型卡声明 262144 token 上下文,适合长文档与多轮任务
多模态图像输入
通过 mmproj 文件支持图片输入,归类为 image-text-to-text
MoE 稀疏激活
26B 总参数每 token 仅激活 4B,128 专家中 8 个激活,平衡算力与能力
QAT 4-bit 友好
基于 QAT 权重发布,模型卡把 Q4_K_M 视为甜点档位
MTP 投机解码
附带 MTP 草稿头,模型卡称在 llama.cpp 下生成速度提升约 35%
硬件怎么准备
- 单卡运行 Q4_K_M 文本模型约需 13.5 GB 显存,加载视觉与 MTP 后建议约 16.5 GB 显存
- 纯内存推理建议至少 18.5 GB 系统内存,完整加载视觉与 MTP 后约需 23 GB
- 模型卡未承诺具体生成速度,MTP 加速效果仅在 llama.cpp 下验证
- LM Studio 多卡 tensor-split 模式可能崩溃,建议单卡或 layer-split
量化版本怎么选
- 模型卡声明 Gemma 4 为 QAT 训练,Q4_K_M 是推荐甜点档位
- 仓库只提供 Q4_K_M 一种文本量化,没有更高或更低精度版本
- 启用图像输入需搭配 mmproj 视觉文件
- 启用投机解码加速需搭配 MTP 草稿头文件
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 13.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 15.5GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp(llama-server / llama-cli),模型卡在此验证 MTP 加速
- Ollama、LM Studio、Jan、koboldcpp 等 GGUF 运行时
- LM Studio 多卡建议 layer-split 或 priority order
- 加载时按文本、mmproj、MTP 三文件分别指定
采用前要知道的限制
- 模型卡未提供基准评测与训练数据说明
- 仅 Q4_K_M 一种文本量化,不适合追求更高精度的用户
- 极少数边缘 prompt 首问仍可能回避,需换问法
- 26B 模型对显存与内存要求较高,低端设备难以运行完整 256K