← 返回模型库

HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP

Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP:去审查多模态长文推理与创作

基于 Google Gemma 4 26B-A4B 的去审查微调版本,26B 总参数配 4B 激活 MoE 架构,原生支持 256K 上下文与图像输入。适合需要开放式回答的智能体编程、创意写作、角色扮演与长文档推理用户,建议单卡约 16 GB 显存或 18.5 GB 内存起步,搭配 MTP 草稿头可在 llama.

多模态长上下文MoE 去审查智能体编程角色扮演写作
查看模型源页面
下载量
0
参数
26B
上下文
未说明
架构 / 任务
未分类
许可证
gemma

MODEL POSITIONING

这个模型解决什么问题?

模型能力来自 Gemma 4 官方 26B-A4B MoE 基座与 image-text-to-text 任务标签,涵盖多模态、智能体、编程、创意写作与角色扮演方向。HauhauCS 仓库只做去审查与配套采样参数调整,未改动原数据集与能力,并只发布 Q4_K_M 一种文本量化,同时附带 mmproj 视觉与 MTP 投机解码草稿头两个配套文件。运行时主要面向 llama.cpp 体系,模型卡明确在该工具下验证 MTP 加速效果,并提醒 LM Studio 多卡 tensor-split 模式可能崩溃。模型卡未提供基准跑分与训练数据细节。

更适合谁

  • 需要长上下文与图像理解的中文本地用户
  • 智能体编程、长文档推理与创意写作开发者
  • 希望获得开放式回答的角色扮演与对话用户
  • 拥有 16 GB 以上显存并希望启用 MTP 加速的玩家

典型使用场景

  • 智能体编程与多步代码推理
  • 长文档摘要、检索增强与多轮分析
  • 创意写作与角色扮演开放对话
  • 图像理解与图文混合问答

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

256K 超长上下文

模型卡声明 262144 token 上下文,适合长文档与多轮任务

多模态图像输入

通过 mmproj 文件支持图片输入,归类为 image-text-to-text

MoE 稀疏激活

26B 总参数每 token 仅激活 4B,128 专家中 8 个激活,平衡算力与能力

QAT 4-bit 友好

基于 QAT 权重发布,模型卡把 Q4_K_M 视为甜点档位

MTP 投机解码

附带 MTP 草稿头,模型卡称在 llama.cpp 下生成速度提升约 35%

硬件怎么准备

  • 单卡运行 Q4_K_M 文本模型约需 13.5 GB 显存,加载视觉与 MTP 后建议约 16.5 GB 显存
  • 纯内存推理建议至少 18.5 GB 系统内存,完整加载视觉与 MTP 后约需 23 GB
  • 模型卡未承诺具体生成速度,MTP 加速效果仅在 llama.cpp 下验证
  • LM Studio 多卡 tensor-split 模式可能崩溃,建议单卡或 layer-split

量化版本怎么选

  • 模型卡声明 Gemma 4 为 QAT 训练,Q4_K_M 是推荐甜点档位
  • 仓库只提供 Q4_K_M 一种文本量化,没有更高或更低精度版本
  • 启用图像输入需搭配 mmproj 视觉文件
  • 启用投机解码加速需搭配 MTP 草稿头文件

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q412 GB13.5 GB15.5 GB18.5 GB文件 ↗
BF1615 GB16.5 GB19 GB23 GB文件 ↗
GGUF15 GB16.5 GB19 GB23 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 13.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 15.5GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp(llama-server / llama-cli),模型卡在此验证 MTP 加速
  • Ollama、LM Studio、Jan、koboldcpp 等 GGUF 运行时
  • LM Studio 多卡建议 layer-split 或 priority order
  • 加载时按文本、mmproj、MTP 三文件分别指定

采用前要知道的限制

  • 模型卡未提供基准评测与训练数据说明
  • 仅 Q4_K_M 一种文本量化,不适合追求更高精度的用户
  • 极少数边缘 prompt 首问仍可能回避,需换问法
  • 26B 模型对显存与内存要求较高,低端设备难以运行完整 256K