下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
能力来源:模型卡显示本仓库是 JonathanColetti/Qwen3.8-27B-Uncensored 的二次封装,原始能力来自 Qwen3.8-27B 的 27B 参数设计;本仓库核心贡献是 Unsloth Dynamic 3.0 动态量化策略的复刻,并附带 mmproj 视觉投影。 量化仓库:覆盖从 IQ1_M 到 Q6_K 共 9 个文本档位,加 mmproj-Unleashed-f16.gguf;模型卡明确指出 IQ1_M 档仅供完整发布参考(25.83% MMLU,近随机),UD-Q3_K_XL 为推荐档。 运行工具:模型卡显示支持 Ollama、llama.cpp(含 DFlash2 投机解码与 llama-mtmd-cli 多模态入口)、LM Studio。
更适合谁
- 有 16–24 GB 显存并希望本地部署 27B 模型的用户
- 需要 250k 以上超长上下文做检索、摘要与生成的研究者
- 希望降低拒答率用于角色创作或敏感话题写作的本地玩家
典型使用场景
- 超长文档摘要、检索与多轮问答
- 小说、剧本等需要连续长生成的内容创作
- 角色扮演与对安全边界较宽松的对话场景
- 本地图文混合推理(需加载 mmproj)
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
按张量动态量化
采用 Unsloth Dynamic 3.0 配方,关键张量保留高位,Q3 档在 MMLU 与体积上接近 Q4 表现
27B 长上下文架构
65 层混合 DeltaNet 设计,262k 上下文可在 24 GB 单卡完整运行,KV 缓存约 5 GB
去审查稳定性
各档位测得 0% 拒答率,量化未导致审查回潮
视觉与多 token 预测
自带 mmproj 投影文件,MTP head 在所有档位保留,可叠加 DFlash2 投机解码
硬件怎么准备
- 24 GB 显存单卡:推荐 UD-Q3_K_XL(13.2 GB),可获得完整 262k 上下文与最佳质量体积比
- 16 GB 显存:可运行 UD-Q3_K_XL(推荐 12 GB VRAM),需缩短上下文或启用 CPU 分流
- 12 GB 显存:建议 UD-Q2_K_XL 或 UD-IQ3_XXS(最低 10.5 GB VRAM),可接受 MMLU 约下降 8 个百分点
- 8 GB 及以下:仅 UD-IQ2_S(8.5 GB,最低 7 GB VRAM)可用,避免 IQ1_M 档
量化版本怎么选
- 优先选择 UD-Q3_K_XL(13.2 GB):模型卡明确推荐,MMLU 82.98%,速度与质量平衡点
- 质量优先且显存充足:考虑 UD-Q4_K_M 或 UD-Q5_K_M,模型卡提示 Q4 及以上 MMLU 无明显增益
- 显存紧张场景:UD-IQ2_S(70.83% MMLU)为可用最低档,UD-Q2_K_XL 是 10 GB 内较优选项
- 避开 UD-IQ1_M(25.83% MMLU,近似随机,32k 针线检索即失败)
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ1 | 3.1 GB | 3.5 GB | 4.5 GB | 8 GB | 文件 ↗ |
| IQ2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| Q2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| IQ3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| Q3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| IQ4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| Q4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| Q5 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| F16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q6 | 19 GB | 20.5 GB | 23.5 GB | 28.5 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 3.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4.5GB。
阅读 8GB 显存选型指南 →可以怎样运行
- Ollama:模型卡显示支持 GGUF 直接加载
- llama.cpp:模型卡主推,支持 DFlash2 投机解码与 llama-mtmd-cli 多模态入口
- LM Studio:模型卡显示支持
- 视觉任务:额外加载 mmproj-Unleashed-f16.gguf,文本任务不触发视觉编码器
采用前要知道的限制
- 跨硬件速度未说明,所有 tok/s 数据仅来自 RTX 4090 24 GB 单卡
- 去审查不等于完全无对齐,模型卡提示拒答实质性减少但未完全消除
- 检索测试仅在 32k 上下文下进行,250k 以上上下文多跳推理未测量
- IQ1_M 档几乎随机输出,仅供完整发布参考