← 返回模型库

HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced

Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced:去审查多模态长上下文编程写作模型

基于 Gemma4 12B 的去审查衍生版本,保留图像识别与 256K 长上下文,面向代理式编程、推理与创意写作调优。Q4_K_M 文本权重为仓库标定的甜点量化,附加 mmproj 视觉投影器后建议约 10GB 显存与 10GB 内存起步。需要长上下文、无明显拒答偏置或本地图片问答能力的开发者与创作者可直接试用。

去审查多模态长上下文编程写作
查看模型源页面
下载量
0
参数
12B
上下文
未说明
架构 / 任务
未分类
许可证
gemma

MODEL POSITIONING

这个模型解决什么问题?

模型能力来自去审查调优后的 Gemma4 12B 指令底座,Balanced 变体强调先推理再回答,在代理式编码、复杂推理、创意写作与角色对话下保持可靠。仓库仅提供面向 4 比特的 Q4_K_M 文本权重、BF16 的视觉 mmproj,以及来自 Unsloth 团队的 MTP 投机解码草稿头,可通过 llama.cpp 等支持 speculative decoding 的后端提速,运行工具覆盖 llama.cpp、LM Studio、Jan、koboldcpp 等 GGUF 生态。作者明确提示 LM Studio 的 tensor-split 多卡模式在该模型上会崩溃,建议改用单卡切分。模型卡未说明具体的上下文窗口实测或训练语料分布。

更适合谁

  • 希望在本地获得无明显拒答偏置的中文或英文用户
  • 需要 256K 长上下文处理大型文档或代码库的开发者
  • 偏好 Gemma4 生态并希望利用 MTP 提速的爱好者
  • 专注代理式编程、推理与长篇创意写作的实践者

典型使用场景

  • 本地代理式编程与代码调试
  • 长篇创意写作、角色扮演与剧情推演
  • 大文档摘要与跨章节问答
  • 图片识别配合文字生成的多模态对话

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

无审查指令遵循

Balanced 调优显著降低主动拒答,边缘案例可经复述化解

Q4_K_M 接近原精度

基于 Gemma4 QAT 权重,4 比特即甜点,高精度收益有限

MTP 投机加速

随仓库附 Unsloth 的多令牌预测草稿头,显著提速长输出

多模态视觉输入

通过 mmproj 投影器支持图片理解与图文问答

256K 超长上下文

12B 稠密架构,单会话可容纳大型资料或代码工程

硬件怎么准备

  • 纯文本 Q4_K_M 推理最低约 6.5GB 显存与 7GB 内存即可加载
  • 启用 mmproj 视觉与 MTP 加速时建议至少 8GB 显存、9GB 内存
  • 长上下文到 256K 需预留更高显存与内存,建议显存 10GB 以上
  • 仅支持 GGUF 后端,并避免在 LM Studio 上使用 tensor-split 多卡模式

量化版本怎么选

  • 主模型仅提供 Q4_K_M 文本权重,作者明确其为最优量化
  • 视觉 mmproj 为 168MB 的 BF16 单独文件,按需加载
  • MTP 草稿头为 GGUF 格式,需后端支持 speculative decoding
  • 模型卡未提供更高精度量化或对比实测

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q45.6 GB6.5 GB7.5 GB8.5 GB文件 ↗
BF167.0 GB8 GB9.5 GB10.5 GB文件 ↗
GGUF7.0 GB8 GB9.5 GB10.5 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 6.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 7.5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp 的 llama-server 或 llama-cli 命令行
  • LM Studio 单卡 GPU 加载避免多卡拆分
  • Ollama、Jan 等兼容 GGUF 的桌面前端
  • koboldcpp 与其他 llama.cpp 衍生前端

采用前要知道的限制

  • 模型卡未给出上下文长度外的生成速度实测数据
  • 仓库仅发布 Q4_K_M 一种文本量化,缺少更高精度对照
  • LM Studio 的 tensor-split 多卡模式会导致崩溃
  • 少数边缘提示仍会先拒答,需重述或调整提问策略