← 返回模型库

mudler/Qwen3.8-27B-APEX-GGUF

Qwen3.8-27B-APEX-GGUF:27B 混合注意力量化变体

Qwen3.8-27B-APEX-GGUF 是基于 Qwen3.8-27B 的 APEX 测量式量化仓库,提供 Mini 与 Nano 两档 GGUF 文件并附带视觉投影器。模型为 27B 稠密架构,交错线性与全注意力层。适合想用 12–16GB VRAM 跑 27B 模型、尝试混合注意力与投机解码的中高级用户。

混合注意力27B 量化投机解码多模态视觉
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

该仓库提供同一基础模型的两档量化,定位差异化清晰:Mini 13.94GB 面向 16GB VRAM,Nano 11.24GB 面向 12GB VRAM,两者都内嵌 MTP/NextN 头可直接投机解码。APEX 是作者 mudler 的测量式比特分配方案,针对该架构发现 token_embd 与 output 同形但敏感度差 15.3 倍、FFN 边缘层比中间层贵 2.63 倍等现象,因此在 Mini 与 Nano 段相比扁平分配有 22–25% 的 KL 优势。但作者明确说明 Q6_K 及以上时优势消失,因此仓库不发布更大量化档。视觉支持需额外加载 0.93GB 的 mmproj F16 文件。模型卡未说明上下文长度、训练数据与具体任务基准。

更适合谁

  • 有 12–16GB VRAM 显卡想跑 27B 模型的用户
  • 想尝试混合注意力架构与投机解码的进阶玩家
  • 需要视觉多模态并能自行挂载投影器的用户
  • 认可 APEX 测量式分配、愿意尝试非常规量化档的用户

典型使用场景

  • 16GB VRAM 本地推理 27B 稠密大模型
  • 12GB 显存下体验混合注意力架构
  • 搭配视觉投影器进行图文对话
  • 测试投机解码的速度与质量权衡

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

混合注意力架构

64 层中交错 3 层线性注意力与 1 层全注意力,结构独特

APEX 测量式量化

基于 KL 测量的逐张量比特分配,小体积档位相比扁平分配 KL 更低

内置 MTP/NextN 投机头

blk.64 处保留 Q8_0 头,可直接用于 draft-mtp 投机解码

视觉多模态可选

提供 F16 mmproj 投影器,可与任一量化搭配开启视觉

量化档位差异化

Mini 与 Nano 针对不同显存场景提供独立取舍

硬件怎么准备

  • Mini 版建议至少 16GB VRAM
  • Nano 版可在 12GB VRAM 下尝试
  • 视觉投影器约 0.93GB,需额外预留显存或内存
  • 需使用 2026-08-13 之后的较新 llama.cpp(qwen3_5 支持)

量化版本怎么选

  • 显存约 16GB 时选 Mini(13.94GB),KL 与体积较平衡
  • 显存约 12GB 时选 Nano(11.24GB),接受更高 KL 换更小体积
  • 想要视觉能力需额外下载 mmproj-F16.gguf 文件
  • 仓库不发布 Q6_K 及以上档位,因 APEX 优势在该段消失

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
GGUF16 GB17 GB19.5 GB24 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 17GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 19.5GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp(需支持 qwen3_5 的较新构建)
  • LocalAI(作者所属团队项目)

采用前要知道的限制

  • 吞吐量未测量,作者明确不承诺速度,+35–52% tok/s 来自第三方报告
  • 量化质量数据仅适用于该混合注意力架构,不宜外推其他模型
  • token_embd 受 imatrix 限制,极低比特如 IQ2_XXS 无法量化
  • 模型卡未说明上下文长度与训练数据来源