DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF:无审查全能创作与编程模型
该模型为 40B 稠密参数文本生成模型,由 Qwen3.6-27B 扩参训练而来,强调无审查、创作与编程能力,原生支持 256K 上下文与视觉输入。适合追求长篇创意写作、角色扮演、复杂代码生成与多轮深度对话的用户。最低运行门槛约 10.
MODEL POSITIONING
这个模型解决什么问题?
模型层:以 Qwen3.6-27B 为基础扩参至 40B 稠密架构(96 层 / 1275 张量),经 Unsloth 在 Claude 4.6 Opus High Reasoning 与 Deckard 五类数据集上多阶段微调,主打无审查、深度创作与编程场景。量化仓库层:作者自定义 NEO-CODE-Di-IMatrix-MAX 双 imatrix 量化方案,针对长上下文与多轮对话进行调优,并非通用社区量化。运行工具层:模型卡未说明具体推理框架速度,支持 Ollama、llama.cpp、LM Studio 等 GGUF 兼容工具;视觉能力需要额外下载 mmproj 投影文件。
更适合谁
- 接受或刻意需要无审查输出的中文与英文创作者
- 拥有大显存工作站的本地玩家与研究员
- 偏好长上下文多轮对话的角色扮演用户
- 想要在本地尝试编程与数学推理的爱好者
典型使用场景
- 长篇小说、剧本、奇幻与言情等多类型创意写作
- 角色扮演与多角色对白场景构建
- 复杂代码生成、调试与 Web 前端流程
- 长文档理解与跨轮次分析问答
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
40B 稠密扩参架构
由 27B 扩展至 40B,含 96 层与 1275 张量,提供更宽思考空间
无审查生成
通过 Heretic 去对齐,可处理通常被拒答的角色扮演与敏感题材
多阶段微调
在 Claude 4.6 Opus 高推理数据集与 Deckard 五类数据集上训练
可变长度推理
简单任务短思考,复杂任务长思考,原生支持 256K 上下文
视觉理解
图像-文本输入管道已测试通过,可配合 mmproj 文件启用
硬件怎么准备
- IQ2_M(10GB 文件):最低约 10.5GB 显存或 12GB 内存,仅适合尝鲜
- IQ3_M(15GB 文件):最低约 15.5GB 显存或 17.5GB 内存,16GB 显卡勉强可用
- IQ4_NL 或 Q4_K_M(20GB 文件):最低约 20.5GB 显存或 23.5GB 内存,建议 24GB 显卡
- Q6_K / Q8_0:分别需约 30.5GB / 40.5GB 显存,建议专业卡或多卡环境
量化版本怎么选
- 通用建议选择 IQ4_NL 或 Q4_K_M,作者声明接近 BF16 全精度 94% 水平
- 编程与工具调用建议 Q5/Q6 及以上量化
- 极低显存设备只能选 IQ2_M 或 IQ3_M,质量与稳定性会下降
- 启用视觉需额外下载同目录的 mmproj BF16/F16/F32 任一文件
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ2 | 9.3 GB | 10.5 GB | 12 GB | 14 GB | 文件 ↗ |
| IQ3 | 14 GB | 15.5 GB | 18 GB | 21 GB | 文件 ↗ |
| IQ4 | 19 GB | 20.5 GB | 23.5 GB | 28 GB | 文件 ↗ |
| Q4 | 19 GB | 20.5 GB | 23.5 GB | 28 GB | 文件 ↗ |
| BF16 | 23 GB | 25.5 GB | 29 GB | 35 GB | 文件 ↗ |
| F16 | 23 GB | 25.5 GB | 29 GB | 35 GB | 文件 ↗ |
| GGUF | 23 GB | 25.5 GB | 29 GB | 35 GB | 文件 ↗ |
| Q5 | 23 GB | 25.5 GB | 29 GB | 35 GB | 文件 ↗ |
| Q6 | 28 GB | 30.5 GB | 35 GB | 42 GB | 文件 ↗ |
| Q8 | 37 GB | 40.5 GB | 46.5 GB | 56 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 10.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 12GB。
阅读 12GB 显存选型指南 →可以怎样运行
- Ollama:模型卡标注支持,便于一键拉取与聊天
- llama.cpp:可命令行运行并自定义采样参数
- LM Studio:提供图形界面,适合本地测试
- 视觉需把 mmproj 文件与主 GGUF 放同一目录
采用前要知道的限制
- 最低量化(IQ2/IQ3)可能产生循环或重复,需加系统提示或调整 rep_penalty
- 需要大量显存或内存,普通消费级显卡难以跑高量化版本
- 模型卡未提供完整基准分数与中文评测数据
- 内容完全无审查,存在生成不当内容的风险