下载量
0
参数
31B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本仓库是ReadyArt发布的GGUF量化合集,原始模型为Google的gemma-4-31B-it。scotoma-2采用γ-fold方式应用heretic abliteration并叠加三轮DPO微调,专门针对写作中的句式套语做减法,但仍保留与原模型基本一致的拒绝能力,并非uncensored版本,作者明确标注为研究产物。仓库提供从IQ3到Q8共九个主量化文件以及BF16/F16多模态投影文件,支持llama.cpp、Ollama与LM Studio运行。模型卡未说明上下文长度与具体架构细节。
更适合谁
- 角色扮演与对话续写爱好者
- 注重行文变化的创意写作者
- 想在本地对比gemma-4-31B-it微调效果的实验用户
- 拥有16GB以上显存或24GB以上内存的本地推理玩家
典型使用场景
- 长篇角色扮演对话的句式多样化生成
- 创意小说片段与场景描写写作
- 本地部署下的句式风格对比实验
- 对gemma系列微调方法感兴趣的研究人员测试
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
去套语写作
三轮DPO分别针对反义否定、破折号插入语、堆叠形容词进行偏好训练
部分消偏处理
γ-fold叠加heretic abliteration,bf16保真度1.000合并
保留基础智能
微调目标是句式而非知识与推理能力
完整量化谱系
涵盖IQ3、Q3、IQ4、Q4、Q5、Q6、Q8及BF16/F16投影
开放授权
采用Apache-2.0协议
硬件怎么准备
- Q3_K_M与IQ3_M文件约11.6GB,最低14GB内存或12GB显存,推荐16.5GB内存或14GB显存
- Q4_K_M与IQ4_XS文件约15.5GB,最低18.5GB内存或16GB显存,推荐22GB内存或18.5GB显存
- Q5_K_M文件约19.4GB,最低23GB内存或19.5GB显存,推荐27.5GB内存或22.5GB显存
- Q8_0文件约31GB,最低36.5GB内存或31.5GB显存,普通消费级硬件难以胜任
量化版本怎么选
- 显存12至16GB建议优先Q3_K_M或IQ3_M以确保可加载
- 显存18至20GB建议选择Q4_K_M平衡体积与质量
- 显存24GB以上可考虑Q5_K_M或Q6_K获得更稳定输出
- mmproj投影文件为BF16与F16格式,需配合主模型使用
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ3 | 11 GB | 12 GB | 14 GB | 16.5 GB | 文件 ↗ |
| Q3 | 11 GB | 12 GB | 14 GB | 16.5 GB | 文件 ↗ |
| IQ4 | 14 GB | 16 GB | 18.5 GB | 22 GB | 文件 ↗ |
| Q4 | 14 GB | 16 GB | 18.5 GB | 22 GB | 文件 ↗ |
| Q5 | 18 GB | 19.5 GB | 22.5 GB | 27.5 GB | 文件 ↗ |
| GGUF | 18 GB | 19.5 GB | 22.5 GB | 27.5 GB | 文件 ↗ |
| BF16 | 18 GB | 19.5 GB | 22.5 GB | 27.5 GB | 文件 ↗ |
| F16 | 18 GB | 19.5 GB | 22.5 GB | 27.5 GB | 文件 ↗ |
| Q6 | 22 GB | 23.5 GB | 27 GB | 32.5 GB | 文件 ↗ |
| Q8 | 29 GB | 31.5 GB | 36 GB | 43.5 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 12GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 14GB。
阅读 24GB 显存选型指南 →可以怎样运行
- Ollama直接拉取对应量化标签运行
- LM Studio加载GGUF文件进行本地推理
- llama.cpp命令行工具调用gguf文件
- 其他兼容llama.cpp格式的推理前端
采用前要知道的限制
- 模型卡未说明上下文长度与底层架构
- 并非uncensored版本,拒绝能力与原模型基本一致
- 31B参数量对显存与内存要求较高
- 行为受提示词与上下文影响,输出可能不稳定