← 返回模型库

DavidAU/Qwen3.6-40B-Fable-Fusion-6-Core-Deckard-Eleanor-Heretic-Uncensored-NM-DAU-NEO-MAX-MTP-GGUF

Qwen3.6-40B-Fable-Fusion-6-Core-Deckard-Eleanor-Heretic-Uncensored-NM-DAU-NEO-MAX-MTP-GGUF:40B 多阶段融合全能文本视觉模型

基于 Qwen3.6 27B 多核融合并扩展到 40B 参数的多阶段微调模型,主打指令遵循、推理思考、编程写作等全用途场景。原生 256k 上下文并支持视觉输入,需 10.5GB 以上显存才能加载 IQ2 量化,24GB 显卡建议使用 IQ4 量化。适合拥有高端显卡、追求长上下文与去审核体验的本地推理和创作用户。

全用途对话长上下文推理创意写作视觉问答
查看模型源页面
下载量
0
参数
40B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来自 DavidAU 基于 Qwen3.6 27B Fable Fusion 多核融合的多阶段微调与 40B 扩展,强调指令遵循、推理、编程与创意写作等全用途,并支持 256k 上下文与视觉输入(需 mmproj)。仓库只发布 GGUF 量化文件,从 IQ2_XXS 到 Q8_0 覆盖 10.5GB 至 47GB 显存区间,并提供带 MTP 多 token 预测的版本;运行可通过 Ollama、llama.cpp、LM Studio 等通用 GGUF 工具。模型卡未说明具体训练数据来源与基准分数。

更适合谁

  • 有 24GB 以上显存并希望本地跑 40B 级别模型的玩家
  • 需要长上下文、视觉输入与深度推理的研究或创作用户
  • 偏好去审核、可深度引导输出的开放权重模型使用者
  • 已有 GGUF 生态(Ollama / LM Studio / llama.cpp)使用经验的人

典型使用场景

  • 复杂推理与多步思考任务
  • 长篇创意写作、角色扮演与小说构思
  • 编程代理、代码生成与调试
  • 视觉问答与图文结合的本地对话

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

指令遵循与问题解决

模型卡声称通过多阶段微调显著提升通用问题解决与指令跟随

深度推理与思考

引入 Deckard 40B 后 thinking token 数量减少到 1/10 到 1/2,输出更精炼

长上下文与视觉

原生 256k 上下文,可扩展到 1M,支持图文输入

全用途覆盖

兼顾编程代理、代码生成、创意写作、角色扮演与视觉问答

去审核设计

经 Heretic 处理降低拒绝率,可被引导生成多元内容

硬件怎么准备

  • IQ2_XXS 量化最低约 10.5GB 显存或 12GB 内存,但模型卡承认该级别质量 fair
  • IQ3 / IQ4 量化建议约 15.5GB 至 20.5GB 显存,推荐 24GB 显卡
  • Q5/Q6 量化需 25.5GB 至 30.5GB 显存,Q8_0 需 40.5GB 显存
  • MTP 版本速度更高但受 temperature 和 rep pen 设置影响,且占用额外显存

量化版本怎么选

  • 16GB 显卡可勉强加载 IQ2_XXS-LOW,建议升级到 IQ4 以保证质量
  • 24GB 显卡推荐 IQ4_NL 或 Q4_K_M,平衡体积与表现
  • 32GB 及以上显卡可考虑 Q6_K 或 Q8_0 获得更高质量
  • 建议同时下载常规版与 MTP 版对比,若 token 接受率低于 50% 则优先常规版

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ29.3 GB10.5 GB12 GB14 GB文件 ↗
IQ314 GB15.5 GB18 GB21 GB文件 ↗
IQ419 GB20.5 GB23.5 GB28 GB文件 ↗
Q419 GB20.5 GB23.5 GB28 GB文件 ↗
Q523 GB25.5 GB29 GB35 GB文件 ↗
BF1623 GB25.5 GB29 GB35 GB文件 ↗
F1623 GB25.5 GB29 GB35 GB文件 ↗
GGUF23 GB25.5 GB29 GB35 GB文件 ↗
Q628 GB30.5 GB35 GB42 GB文件 ↗
Q837 GB40.5 GB46.5 GB56 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 10.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 12GB。

阅读 12GB 显存选型指南 →

可以怎样运行

  • Ollama 直接加载 GGUF 模型
  • LM Studio 支持常规与 MTP 量化
  • llama.cpp / KoboldCpp / text-generation-webui 等通用 GGUF 推理工具
  • 视觉支持需额外下载 mmproj 文件并放置在同一目录

采用前要知道的限制

  • 模型卡未提供基准分数,仅有定性描述与第三方经验
  • IQ2_XXS-LOW 量化质量 fair,高质量需求建议至少 IQ4
  • MTP 版本对 temperature 与 rep pen 设置敏感,参数需保持 1
  • 视觉支持需额外 mmproj 文件并占用额外显存与内存