← 返回模型库

outsourc-e/Qwen3.8-27B-Unleashed-GGUF

Qwen3.8-27B-Unleashed-GGUF:去审查27B长文本生成

基于 Qwen3.8-27B 的去审查 GGUF 版本,采用按张量动态比特分配(Unsloth Dynamic 3.0 配方),共 9 个档位。基础为 27B 混合 DeltaNet(65 层仅 17 层全注意力),支持 262k 上下文与视觉。推荐 UD-Q3_K_XL(13.

长文本生成去审查大模型Qwen3.8量化27B本地部署
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

能力来源:模型卡显示本仓库是 JonathanColetti/Qwen3.8-27B-Uncensored 的二次封装,原始能力来自 Qwen3.8-27B 的 27B 参数设计;本仓库核心贡献是 Unsloth Dynamic 3.0 动态量化策略的复刻,并附带 mmproj 视觉投影。 量化仓库:覆盖从 IQ1_M 到 Q6_K 共 9 个文本档位,加 mmproj-Unleashed-f16.gguf;模型卡明确指出 IQ1_M 档仅供完整发布参考(25.83% MMLU,近随机),UD-Q3_K_XL 为推荐档。 运行工具:模型卡显示支持 Ollama、llama.cpp(含 DFlash2 投机解码与 llama-mtmd-cli 多模态入口)、LM Studio。

更适合谁

  • 有 16–24 GB 显存并希望本地部署 27B 模型的用户
  • 需要 250k 以上超长上下文做检索、摘要与生成的研究者
  • 希望降低拒答率用于角色创作或敏感话题写作的本地玩家

典型使用场景

  • 超长文档摘要、检索与多轮问答
  • 小说、剧本等需要连续长生成的内容创作
  • 角色扮演与对安全边界较宽松的对话场景
  • 本地图文混合推理(需加载 mmproj)

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

按张量动态量化

采用 Unsloth Dynamic 3.0 配方,关键张量保留高位,Q3 档在 MMLU 与体积上接近 Q4 表现

27B 长上下文架构

65 层混合 DeltaNet 设计,262k 上下文可在 24 GB 单卡完整运行,KV 缓存约 5 GB

去审查稳定性

各档位测得 0% 拒答率,量化未导致审查回潮

视觉与多 token 预测

自带 mmproj 投影文件,MTP head 在所有档位保留,可叠加 DFlash2 投机解码

硬件怎么准备

  • 24 GB 显存单卡:推荐 UD-Q3_K_XL(13.2 GB),可获得完整 262k 上下文与最佳质量体积比
  • 16 GB 显存:可运行 UD-Q3_K_XL(推荐 12 GB VRAM),需缩短上下文或启用 CPU 分流
  • 12 GB 显存:建议 UD-Q2_K_XL 或 UD-IQ3_XXS(最低 10.5 GB VRAM),可接受 MMLU 约下降 8 个百分点
  • 8 GB 及以下:仅 UD-IQ2_S(8.5 GB,最低 7 GB VRAM)可用,避免 IQ1_M 档

量化版本怎么选

  • 优先选择 UD-Q3_K_XL(13.2 GB):模型卡明确推荐,MMLU 82.98%,速度与质量平衡点
  • 质量优先且显存充足:考虑 UD-Q4_K_M 或 UD-Q5_K_M,模型卡提示 Q4 及以上 MMLU 无明显增益
  • 显存紧张场景:UD-IQ2_S(70.83% MMLU)为可用最低档,UD-Q2_K_XL 是 10 GB 内较优选项
  • 避开 UD-IQ1_M(25.83% MMLU,近似随机,32k 针线检索即失败)

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ13.1 GB3.5 GB4.5 GB8 GB文件 ↗
IQ26.3 GB7 GB8 GB9.5 GB文件 ↗
Q26.3 GB7 GB8 GB9.5 GB文件 ↗
IQ39.4 GB10.5 GB12 GB14.5 GB文件 ↗
Q39.4 GB10.5 GB12 GB14.5 GB文件 ↗
IQ413 GB14 GB16 GB19 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 3.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4.5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • Ollama:模型卡显示支持 GGUF 直接加载
  • llama.cpp:模型卡主推,支持 DFlash2 投机解码与 llama-mtmd-cli 多模态入口
  • LM Studio:模型卡显示支持
  • 视觉任务:额外加载 mmproj-Unleashed-f16.gguf,文本任务不触发视觉编码器

采用前要知道的限制

  • 跨硬件速度未说明,所有 tok/s 数据仅来自 RTX 4090 24 GB 单卡
  • 去审查不等于完全无对齐,模型卡提示拒答实质性减少但未完全消除
  • 检索测试仅在 32k 上下文下进行,250k 以上上下文多跳推理未测量
  • IQ1_M 档几乎随机输出,仅供完整发布参考