DavidAU/Qwen3.6-40B-Fable-Fusion-6-Core-Deckard-Eleanor-Heretic-Uncensored-NM-DAU-NEO-MAX-MTP-GGUF
Qwen3.6-40B-Fable-Fusion-6-Core-Deckard-Eleanor-Heretic-Uncensored-NM-DAU-NEO-MAX-MTP-GGUF:40B 多阶段融合全能文本视觉模型
基于 Qwen3.6 27B 多核融合并扩展到 40B 参数的多阶段微调模型,主打指令遵循、推理思考、编程写作等全用途场景。原生 256k 上下文并支持视觉输入,需 10.5GB 以上显存才能加载 IQ2 量化,24GB 显卡建议使用 IQ4 量化。适合拥有高端显卡、追求长上下文与去审核体验的本地推理和创作用户。
MODEL POSITIONING
这个模型解决什么问题?
模型能力来自 DavidAU 基于 Qwen3.6 27B Fable Fusion 多核融合的多阶段微调与 40B 扩展,强调指令遵循、推理、编程与创意写作等全用途,并支持 256k 上下文与视觉输入(需 mmproj)。仓库只发布 GGUF 量化文件,从 IQ2_XXS 到 Q8_0 覆盖 10.5GB 至 47GB 显存区间,并提供带 MTP 多 token 预测的版本;运行可通过 Ollama、llama.cpp、LM Studio 等通用 GGUF 工具。模型卡未说明具体训练数据来源与基准分数。
更适合谁
- 有 24GB 以上显存并希望本地跑 40B 级别模型的玩家
- 需要长上下文、视觉输入与深度推理的研究或创作用户
- 偏好去审核、可深度引导输出的开放权重模型使用者
- 已有 GGUF 生态(Ollama / LM Studio / llama.cpp)使用经验的人
典型使用场景
- 复杂推理与多步思考任务
- 长篇创意写作、角色扮演与小说构思
- 编程代理、代码生成与调试
- 视觉问答与图文结合的本地对话
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
指令遵循与问题解决
模型卡声称通过多阶段微调显著提升通用问题解决与指令跟随
深度推理与思考
引入 Deckard 40B 后 thinking token 数量减少到 1/10 到 1/2,输出更精炼
长上下文与视觉
原生 256k 上下文,可扩展到 1M,支持图文输入
全用途覆盖
兼顾编程代理、代码生成、创意写作、角色扮演与视觉问答
去审核设计
经 Heretic 处理降低拒绝率,可被引导生成多元内容
硬件怎么准备
- IQ2_XXS 量化最低约 10.5GB 显存或 12GB 内存,但模型卡承认该级别质量 fair
- IQ3 / IQ4 量化建议约 15.5GB 至 20.5GB 显存,推荐 24GB 显卡
- Q5/Q6 量化需 25.5GB 至 30.5GB 显存,Q8_0 需 40.5GB 显存
- MTP 版本速度更高但受 temperature 和 rep pen 设置影响,且占用额外显存
量化版本怎么选
- 16GB 显卡可勉强加载 IQ2_XXS-LOW,建议升级到 IQ4 以保证质量
- 24GB 显卡推荐 IQ4_NL 或 Q4_K_M,平衡体积与表现
- 32GB 及以上显卡可考虑 Q6_K 或 Q8_0 获得更高质量
- 建议同时下载常规版与 MTP 版对比,若 token 接受率低于 50% 则优先常规版
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ2 | 9.3 GB | 10.5 GB | 12 GB | 14 GB | 文件 ↗ |
| IQ3 | 14 GB | 15.5 GB | 18 GB | 21 GB | 文件 ↗ |
| IQ4 | 19 GB | 20.5 GB | 23.5 GB | 28 GB | 文件 ↗ |
| Q4 | 19 GB | 20.5 GB | 23.5 GB | 28 GB | 文件 ↗ |
| Q5 | 23 GB | 25.5 GB | 29 GB | 35 GB | 文件 ↗ |
| BF16 | 23 GB | 25.5 GB | 29 GB | 35 GB | 文件 ↗ |
| F16 | 23 GB | 25.5 GB | 29 GB | 35 GB | 文件 ↗ |
| GGUF | 23 GB | 25.5 GB | 29 GB | 35 GB | 文件 ↗ |
| Q6 | 28 GB | 30.5 GB | 35 GB | 42 GB | 文件 ↗ |
| Q8 | 37 GB | 40.5 GB | 46.5 GB | 56 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 10.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 12GB。
阅读 12GB 显存选型指南 →可以怎样运行
- Ollama 直接加载 GGUF 模型
- LM Studio 支持常规与 MTP 量化
- llama.cpp / KoboldCpp / text-generation-webui 等通用 GGUF 推理工具
- 视觉支持需额外下载 mmproj 文件并放置在同一目录
采用前要知道的限制
- 模型卡未提供基准分数,仅有定性描述与第三方经验
- IQ2_XXS-LOW 量化质量 fair,高质量需求建议至少 IQ4
- MTP 版本对 temperature 与 rep pen 设置敏感,参数需保持 1
- 视觉支持需额外 mmproj 文件并占用额外显存与内存