← 返回模型库

ReadyArt/gemma-4-31B-it-scotoma-2-GGUF

gemma-4-31B-it-scotoma-2-GGUF:31B参数去套语写作微调

这是基于Google gemma-4-31B-it的DPO偏好微调量化版本,通过三轮共9.3k对的训练减少角色扮演写作中的重复套语,包括堆叠形容词、破折号插入语与反义否定结构。适合中文角色扮演、创意写作与文本生成用户。Q3量化至少需要14GB内存或12GB显存,Q4量化需18.

角色扮演去套语微调DPO微调31B参数
查看模型源页面
下载量
0
参数
31B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库是ReadyArt发布的GGUF量化合集,原始模型为Google的gemma-4-31B-it。scotoma-2采用γ-fold方式应用heretic abliteration并叠加三轮DPO微调,专门针对写作中的句式套语做减法,但仍保留与原模型基本一致的拒绝能力,并非uncensored版本,作者明确标注为研究产物。仓库提供从IQ3到Q8共九个主量化文件以及BF16/F16多模态投影文件,支持llama.cpp、Ollama与LM Studio运行。模型卡未说明上下文长度与具体架构细节。

更适合谁

  • 角色扮演与对话续写爱好者
  • 注重行文变化的创意写作者
  • 想在本地对比gemma-4-31B-it微调效果的实验用户
  • 拥有16GB以上显存或24GB以上内存的本地推理玩家

典型使用场景

  • 长篇角色扮演对话的句式多样化生成
  • 创意小说片段与场景描写写作
  • 本地部署下的句式风格对比实验
  • 对gemma系列微调方法感兴趣的研究人员测试

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

去套语写作

三轮DPO分别针对反义否定、破折号插入语、堆叠形容词进行偏好训练

部分消偏处理

γ-fold叠加heretic abliteration,bf16保真度1.000合并

保留基础智能

微调目标是句式而非知识与推理能力

完整量化谱系

涵盖IQ3、Q3、IQ4、Q4、Q5、Q6、Q8及BF16/F16投影

开放授权

采用Apache-2.0协议

硬件怎么准备

  • Q3_K_M与IQ3_M文件约11.6GB,最低14GB内存或12GB显存,推荐16.5GB内存或14GB显存
  • Q4_K_M与IQ4_XS文件约15.5GB,最低18.5GB内存或16GB显存,推荐22GB内存或18.5GB显存
  • Q5_K_M文件约19.4GB,最低23GB内存或19.5GB显存,推荐27.5GB内存或22.5GB显存
  • Q8_0文件约31GB,最低36.5GB内存或31.5GB显存,普通消费级硬件难以胜任

量化版本怎么选

  • 显存12至16GB建议优先Q3_K_M或IQ3_M以确保可加载
  • 显存18至20GB建议选择Q4_K_M平衡体积与质量
  • 显存24GB以上可考虑Q5_K_M或Q6_K获得更稳定输出
  • mmproj投影文件为BF16与F16格式,需配合主模型使用

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ311 GB12 GB14 GB16.5 GB文件 ↗
Q311 GB12 GB14 GB16.5 GB文件 ↗
IQ414 GB16 GB18.5 GB22 GB文件 ↗
Q414 GB16 GB18.5 GB22 GB文件 ↗
Q518 GB19.5 GB22.5 GB27.5 GB文件 ↗
GGUF18 GB19.5 GB22.5 GB27.5 GB文件 ↗
BF1618 GB19.5 GB22.5 GB27.5 GB文件 ↗
F1618 GB19.5 GB22.5 GB27.5 GB文件 ↗
Q622 GB23.5 GB27 GB32.5 GB文件 ↗
Q829 GB31.5 GB36 GB43.5 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 12GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 14GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • Ollama直接拉取对应量化标签运行
  • LM Studio加载GGUF文件进行本地推理
  • llama.cpp命令行工具调用gguf文件
  • 其他兼容llama.cpp格式的推理前端

采用前要知道的限制

  • 模型卡未说明上下文长度与底层架构
  • 并非uncensored版本,拒绝能力与原模型基本一致
  • 31B参数量对显存与内存要求较高
  • 行为受提示词与上下文影响,输出可能不稳定