DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF
Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF:去审查长文创作编程三合一本地模型
基于 Qwen3.8-27B 的 27B 参数多阶段微调模型,主打去审查与压缩思考块,支持视觉输入与 256k 上下文,并提供三种推理档位。适合需要长文创意写作、角色扮演、辅助编程且拥有 16GB 以上显存的本地用户,工具调用建议 Q4_K_M 以上量化。
MODEL POSITIONING
这个模型解决什么问题?
本仓库为 GGUF 量化分发仓库,提供常规量化与 MTP 多 token 预测量化两类文件,源自 DavidAU 团队的多阶段融合微调模型,模型卡定位其为消费级硬件上最强开源调优之一。模型能力来自其基于 Qwen3.8-27B 的多阶段合并与去审查处理;本仓库不含训练流程。运行工具方面,模型卡明确支持 ollama、llama.cpp 与 LM Studio,并提示 KoboldCpp、text-generation-webui、SillyTavern 等前端。模型卡未说明的内容包括具体架构细节、训练数据规模以及完整第三方基准成绩。
更适合谁
- 拥有 16GB 以上显存、追求本地长上下文生成的进阶用户
- 需要去审查、敢写敢编的中英双语创意写作与角色扮演作者
- 希望压缩思考 token、提升首 token 速度的 Qwen3.8 调优用户
- 尝试本地工具调用与多模态视觉问答的开发者
典型使用场景
- 长篇小说、剧本等高细节创意写作与续写
- 中英双语角色扮演与多角色剧情对话
- Python、Web 开发等编程辅助与代码生成
- 本地多模态图像理解与视觉问答
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
多阶段融合微调
模型卡声明在 4 bit 量化下保持接近 8 bit 的能力
思考块压缩
相比原版 Qwen3.8-27B 思考 token 减少 1/2 至 1/10
三档推理模式
支持 xhigh、medium、low 三种推理强度切换
视觉能力保留
通过 mmproj 文件启用图像输入
工具调用能力
模型卡提示其创下最强工具调用表现纪录
硬件怎么准备
- IQ2 与 IQ3 量化可放入 8–12GB 显存设备,最低 8GB 内存亦可尝试
- Q4_K_M 与 IQ4_NL 量化要求约 14GB 显存,推荐 16GB 显存卡
- Q5 与 Q6 量化需要 17–20.5GB 显存,适合 24GB 显存级消费卡
- Q8_0 量化需要约 27.5GB 显存,仅 32GB 显存或以上工作站可行
量化版本怎么选
- 显存紧张时优先选 IQ3_M 或 IQ4_NL 以平衡体积与质量
- 工具调用场景建议至少 Q4_K_M,推荐 Q5_K_M 或 Q6_K
- MTP 量化在温度 ≤1、rep pen 为 1 时更快,token 接受率低于 50% 时改用常规量化
- 启用视觉需额外下载一个 mmproj 文件并放置于同目录
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| IQ3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| IQ4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| Q4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| Q5 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| BF16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| F16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| GGUF | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q6 | 19 GB | 20.5 GB | 23.5 GB | 28.5 GB | 文件 ↗ |
| Q8 | 25 GB | 27.5 GB | 31.5 GB | 38 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- ollama、llama.cpp、LM Studio 等主流 GGUF 加载器
- KoboldCpp、text-generation-webui、SillyTavern 等支持平滑因子的对话前端
- 推理强度可通过修改 Jinja 模板在 xhigh、medium、low 之间切换
- MTP 量化需要支持多 token 预测的运行时
采用前要知道的限制
- 模型卡未提供完整独立基准细节,速度数字仅为作者测试示例
- 离线去审查版本,对不当提示需使用者自行把关
- 低于 Q4_K_M 量化时工具调用可能不稳定
- MTP 量化在高温度或创意任务下优势减弱,需根据场景切换