← 返回模型库

DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF

Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF:无审查全能创作与编程模型

该模型为 40B 稠密参数文本生成模型,由 Qwen3.6-27B 扩参训练而来,强调无审查、创作与编程能力,原生支持 256K 上下文与视觉输入。适合追求长篇创意写作、角色扮演、复杂代码生成与多轮深度对话的用户。最低运行门槛约 10.

无审查创作长上下文角色扮演本地代码生成多模态视觉理解
查看模型源页面
下载量
0
参数
40B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型层:以 Qwen3.6-27B 为基础扩参至 40B 稠密架构(96 层 / 1275 张量),经 Unsloth 在 Claude 4.6 Opus High Reasoning 与 Deckard 五类数据集上多阶段微调,主打无审查、深度创作与编程场景。量化仓库层:作者自定义 NEO-CODE-Di-IMatrix-MAX 双 imatrix 量化方案,针对长上下文与多轮对话进行调优,并非通用社区量化。运行工具层:模型卡未说明具体推理框架速度,支持 Ollama、llama.cpp、LM Studio 等 GGUF 兼容工具;视觉能力需要额外下载 mmproj 投影文件。

更适合谁

  • 接受或刻意需要无审查输出的中文与英文创作者
  • 拥有大显存工作站的本地玩家与研究员
  • 偏好长上下文多轮对话的角色扮演用户
  • 想要在本地尝试编程与数学推理的爱好者

典型使用场景

  • 长篇小说、剧本、奇幻与言情等多类型创意写作
  • 角色扮演与多角色对白场景构建
  • 复杂代码生成、调试与 Web 前端流程
  • 长文档理解与跨轮次分析问答

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

40B 稠密扩参架构

由 27B 扩展至 40B,含 96 层与 1275 张量,提供更宽思考空间

无审查生成

通过 Heretic 去对齐,可处理通常被拒答的角色扮演与敏感题材

多阶段微调

在 Claude 4.6 Opus 高推理数据集与 Deckard 五类数据集上训练

可变长度推理

简单任务短思考,复杂任务长思考,原生支持 256K 上下文

视觉理解

图像-文本输入管道已测试通过,可配合 mmproj 文件启用

硬件怎么准备

  • IQ2_M(10GB 文件):最低约 10.5GB 显存或 12GB 内存,仅适合尝鲜
  • IQ3_M(15GB 文件):最低约 15.5GB 显存或 17.5GB 内存,16GB 显卡勉强可用
  • IQ4_NL 或 Q4_K_M(20GB 文件):最低约 20.5GB 显存或 23.5GB 内存,建议 24GB 显卡
  • Q6_K / Q8_0:分别需约 30.5GB / 40.5GB 显存,建议专业卡或多卡环境

量化版本怎么选

  • 通用建议选择 IQ4_NL 或 Q4_K_M,作者声明接近 BF16 全精度 94% 水平
  • 编程与工具调用建议 Q5/Q6 及以上量化
  • 极低显存设备只能选 IQ2_M 或 IQ3_M,质量与稳定性会下降
  • 启用视觉需额外下载同目录的 mmproj BF16/F16/F32 任一文件

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ29.3 GB10.5 GB12 GB14 GB文件 ↗
IQ314 GB15.5 GB18 GB21 GB文件 ↗
IQ419 GB20.5 GB23.5 GB28 GB文件 ↗
Q419 GB20.5 GB23.5 GB28 GB文件 ↗
BF1623 GB25.5 GB29 GB35 GB文件 ↗
F1623 GB25.5 GB29 GB35 GB文件 ↗
GGUF23 GB25.5 GB29 GB35 GB文件 ↗
Q523 GB25.5 GB29 GB35 GB文件 ↗
Q628 GB30.5 GB35 GB42 GB文件 ↗
Q837 GB40.5 GB46.5 GB56 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 10.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 12GB。

阅读 12GB 显存选型指南 →

可以怎样运行

  • Ollama:模型卡标注支持,便于一键拉取与聊天
  • llama.cpp:可命令行运行并自定义采样参数
  • LM Studio:提供图形界面,适合本地测试
  • 视觉需把 mmproj 文件与主 GGUF 放同一目录

采用前要知道的限制

  • 最低量化(IQ2/IQ3)可能产生循环或重复,需加系统提示或调整 rep_penalty
  • 需要大量显存或内存,普通消费级显卡难以跑高量化版本
  • 模型卡未提供完整基准分数与中文评测数据
  • 内容完全无审查,存在生成不当内容的风险