← 返回模型库

DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF

Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF:去审查长文创作编程三合一本地模型

基于 Qwen3.8-27B 的 27B 参数多阶段微调模型,主打去审查与压缩思考块,支持视觉输入与 256k 上下文,并提供三种推理档位。适合需要长文创意写作、角色扮演、辅助编程且拥有 16GB 以上显存的本地用户,工具调用建议 Q4_K_M 以上量化。

27B 去审查创意写作编程长上下文本地部署多阶段调优
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库为 GGUF 量化分发仓库,提供常规量化与 MTP 多 token 预测量化两类文件,源自 DavidAU 团队的多阶段融合微调模型,模型卡定位其为消费级硬件上最强开源调优之一。模型能力来自其基于 Qwen3.8-27B 的多阶段合并与去审查处理;本仓库不含训练流程。运行工具方面,模型卡明确支持 ollama、llama.cpp 与 LM Studio,并提示 KoboldCpp、text-generation-webui、SillyTavern 等前端。模型卡未说明的内容包括具体架构细节、训练数据规模以及完整第三方基准成绩。

更适合谁

  • 拥有 16GB 以上显存、追求本地长上下文生成的进阶用户
  • 需要去审查、敢写敢编的中英双语创意写作与角色扮演作者
  • 希望压缩思考 token、提升首 token 速度的 Qwen3.8 调优用户
  • 尝试本地工具调用与多模态视觉问答的开发者

典型使用场景

  • 长篇小说、剧本等高细节创意写作与续写
  • 中英双语角色扮演与多角色剧情对话
  • Python、Web 开发等编程辅助与代码生成
  • 本地多模态图像理解与视觉问答

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

多阶段融合微调

模型卡声明在 4 bit 量化下保持接近 8 bit 的能力

思考块压缩

相比原版 Qwen3.8-27B 思考 token 减少 1/2 至 1/10

三档推理模式

支持 xhigh、medium、low 三种推理强度切换

视觉能力保留

通过 mmproj 文件启用图像输入

工具调用能力

模型卡提示其创下最强工具调用表现纪录

硬件怎么准备

  • IQ2 与 IQ3 量化可放入 8–12GB 显存设备,最低 8GB 内存亦可尝试
  • Q4_K_M 与 IQ4_NL 量化要求约 14GB 显存,推荐 16GB 显存卡
  • Q5 与 Q6 量化需要 17–20.5GB 显存,适合 24GB 显存级消费卡
  • Q8_0 量化需要约 27.5GB 显存,仅 32GB 显存或以上工作站可行

量化版本怎么选

  • 显存紧张时优先选 IQ3_M 或 IQ4_NL 以平衡体积与质量
  • 工具调用场景建议至少 Q4_K_M,推荐 Q5_K_M 或 Q6_K
  • MTP 量化在温度 ≤1、rep pen 为 1 时更快,token 接受率低于 50% 时改用常规量化
  • 启用视觉需额外下载一个 mmproj 文件并放置于同目录

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ26.3 GB7 GB8 GB9.5 GB文件 ↗
IQ39.4 GB10.5 GB12 GB14.5 GB文件 ↗
IQ413 GB14 GB16 GB19 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
GGUF16 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • ollama、llama.cpp、LM Studio 等主流 GGUF 加载器
  • KoboldCpp、text-generation-webui、SillyTavern 等支持平滑因子的对话前端
  • 推理强度可通过修改 Jinja 模板在 xhigh、medium、low 之间切换
  • MTP 量化需要支持多 token 预测的运行时

采用前要知道的限制

  • 模型卡未提供完整独立基准细节,速度数字仅为作者测试示例
  • 离线去审查版本,对不当提示需使用者自行把关
  • 低于 Q4_K_M 量化时工具调用可能不稳定
  • MTP 量化在高温度或创意任务下优势减弱,需根据场景切换