← 返回模型库

DavidAU/Qwen3.6-40B-Grand-Intelligence-Fable-Fusion-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF

Qwen3.6-40B-Grand-Intelligence-Fable-Fusion-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF:40B级多阶段融合的全能本地对话模型

40B 参数多阶段微调的开源大模型,由 Qwen3.6 27B 通过多版本融合扩展而成,强化指令遵循与深度思考,并经 Heretic 处理降低拒绝率。支持 256k 长上下文和视觉输入,提供 IQ2 至 Q8 多档 GGUF 与 MTP 加速版本。

本地大模型多模态角色扮演
查看模型源页面
下载量
0
参数
40B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力:基础结构来自 Qwen3.6 27B,经过多阶段微调、模型融合与扩张后扩展至 40B,集成 Heretic 去审查处理,原生支持视觉输入(需配合 mmproj 文件)与 256k 上下文,强化指令遵循、推理与开放式输出。模型卡未说明该 40B 变体对中文任务的具体表现差异。 量化仓库:仅发布 GGUF 量化文件,覆盖 IQ2_XXS、IQ3_M、IQ4_NL、Q4_K_M、Q5_K_M、Q6_K 与 Q8_0,并提供针对 16GB 显存的 IQ2_XXS-LOW 极低端版本,附带 BF16、FP16、FP32 多精度 mmproj 视觉投影文件。 运行工具:模型卡声明兼容 Ollama、llama.

更适合谁

  • 拥有 24GB 以上显存或 32GB 以上内存、希望本地部署大模型的用户
  • 需要 256k 长上下文的写作、阅读、代码与综合问答场景用户
  • 对传统模型拒绝敏感话题不满意、希望获得更开放输出的中文用户
  • 想要单一模型兼顾创意写作、推理与编程的多用途本地使用者

典型使用场景

  • 长文写作、创意故事与剧本创作
  • 多轮对话与角色扮演场景
  • 编程辅助与代码生成
  • 长文档阅读、总结与综合问答

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

多阶段微调与多版本融合的 40B 扩展

整合多个 27B Fable Fusion 内核,强化指令遵循与综合能力

原生 256k 长上下文

可处理超长文档、代码库或多轮对话场景

视觉输入支持

多模态能力已激活,需配合单独下载的 mmproj 文件使用

开放式回答风格

经过 Heretic 处理,去审查化程度中等且保留基础性能

硬件怎么准备

  • 内存约 12GB 或显存约 10.5GB 起步:选择 IQ2_XXS(约 10GB 文件),适配 16GB 显卡
  • 内存约 17.5GB 或显存约 15.5GB:选择 IQ3_M(约 15GB)
  • 内存约 23.5GB 或显存约 20.5GB:选择 IQ4_NL 或 Q4_K_M(约 20GB)
  • 内存约 30GB 以上或显存约 25GB 以上:选择 Q5_K_M、Q6_K 以获得更高质量

量化版本怎么选

  • 显存紧张时建议优先 IQ2_XXS,但质量妥协明显,可搭配部分 CPU 卸载
  • 推荐至少 IQ4_NL 或 Q4_K_M 以平衡文件体积与生成质量
  • 显存充足可考虑 Q6_K 或 Q8_0 以获得接近原模型的表现
  • 可同时下载普通版与 MTP 版进行对比测试,根据任务类型选择速度更优者

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ29.3 GB10.5 GB12 GB14 GB文件 ↗
IQ314 GB15.5 GB18 GB21 GB文件 ↗
IQ419 GB20.5 GB23.5 GB28 GB文件 ↗
Q419 GB20.5 GB23.5 GB28 GB文件 ↗
Q523 GB25.5 GB29 GB35 GB文件 ↗
BF1623 GB25.5 GB29 GB35 GB文件 ↗
F1623 GB25.5 GB29 GB35 GB文件 ↗
GGUF23 GB25.5 GB29 GB35 GB文件 ↗
Q628 GB30.5 GB35 GB42 GB文件 ↗
Q837 GB40.5 GB46.5 GB56 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 10.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 12GB。

阅读 12GB 显存选型指南 →

可以怎样运行

  • LM Studio(模型卡示例所用的推理前端)
  • Ollama(兼容列表中已标注)
  • llama.cpp(兼容列表中已标注)

采用前要知道的限制

  • IQ2_XXS 档位质量明显下降,仅建议在 16GB 显卡以下设备使用
  • 部分敏感或开放性话题仍需明确指令引导才能输出预期内容
  • 视觉能力必须额外下载 mmproj 文件,并放置在 GGUF 同目录下使用
  • MTP 加速版本在温度偏高或创意场景下可能不如普通版稳定