← 返回模型库

DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF

Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF:冷融合加速推理创作全能模型

基于 Qwen3.8-27B 的第三方冷融合微调 GGUF 仓库,使用 GAIN 加 Unsloth 复合训练方法,号称 4bit 量化可保留近 99% BF16 性能,思考 token 压缩至常规版的 1/2 至 1/10。

冷融合推理长上下文代码MTP 量化创意角色写作
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
qwen3_5
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

该仓库是 Qwen3.8-27B 的微调 GGUF 量化仓库,作者为 DavidAU。模型能力层面:继承原生 256k 上下文与可扩展至 1M tokens 的窗口,支持视觉理解(需单独下载 mmproj 文件),官方定位覆盖代码、Agent、长链路任务、科研、创意写作等多场景;本微调重点在于压缩思考 token、加快推理速度、提升低量化稳定性。量化仓库层面:同时发布常规 GGUF 与 MTP GGUF 两套,IQ 到 Q8 各档位齐全,另含 BF16、F16、F32 三种 mmproj 投影文件。运行工具层面:兼容 Ollama、llama.cpp、LM Studio 等主流本地推理框架。模型卡未提供权威第三方基准数据与速度承诺。

更适合谁

  • 拥有 24GB 以上显存并追求高保真推理的本地玩家
  • 需要长上下文、低思考开销的代码与 Agent 任务开发者
  • 玩创意写作、故事续写与角色扮演的内容创作者
  • 想对比常规量化与 MTP 量化速度差异的研究型用户

典型使用场景

  • 长文档摘要与多轮深度对话
  • 软件工程代码生成与 Agent 自动化任务
  • 创意写作、故事续写与角色扮演
  • 复杂多步推理与科研类问答

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

冷融合训练保真

GAIN 加 Unsloth 训练方法号称让 4bit 与 8bit 保留约 99% BF16 性能

思考 token 压缩

在三种推理模式下将思考块压缩至常规版的 1/2 至 1/10

MTP 多 token 预测

提供 MTP 张量优化版本,参数合适时吞吐高于常规量化

原生长上下文

继承 256k 原生窗口并支持扩展至 1M tokens

视觉多模态

支持图像与视频理解,需配合 mmproj 文件启用

硬件怎么准备

  • 8GB 显存或 9.5GB 内存可尝试 IQ2_M 量化(模型卡未给出实测速度)
  • 12GB 显存或 14.5GB 内存可选 IQ3_M 量化
  • 16GB 显存或 19GB 内存推荐 IQ4_NL 或 Q4_K_M 量化
  • 20GB 以上显存与 24GB 内存建议选择 Q5_K_M 或更高量化以提升稳定性

量化版本怎么选

  • 低显存入门优先 IQ2_M 或 IQ3_M 以保证可加载
  • 平衡性能与体积推荐 IQ4_NL 或 Q4_K_M
  • 高显存用户可选择 Q5_K_M 或 Q6_K 获得更稳输出
  • 建议同时下载一份常规 GGUF 与一份 MTP GGUF 进行本地测试对比

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ26.3 GB7 GB8 GB9.5 GB文件 ↗
IQ39.4 GB10.5 GB12 GB14.5 GB文件 ↗
IQ413 GB14 GB16 GB19 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
GGUF16 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • LM Studio 桌面端直接加载 GGUF 与 mmproj 文件
  • Ollama 通过 Modelfile 或导入方式运行
  • llama.cpp 命令行或兼容前端推理
  • KoboldCpp、text-generation-webui、SillyTavern 等前端启用 smoothing 因子

采用前要知道的限制

  • 模型卡未提供权威第三方基准数据,仅引用作者自述
  • 27B 参数与 Q5 以上量化对显存要求较高,普通消费显卡难以舒适运行
  • MTP 量化在温度高于 1 或 token 接受率低于 50% 时性能会下降
  • 视觉能力需要额外下载并正确放置 mmproj 文件