下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
该仓库提供同一基础模型的两档量化,定位差异化清晰:Mini 13.94GB 面向 16GB VRAM,Nano 11.24GB 面向 12GB VRAM,两者都内嵌 MTP/NextN 头可直接投机解码。APEX 是作者 mudler 的测量式比特分配方案,针对该架构发现 token_embd 与 output 同形但敏感度差 15.3 倍、FFN 边缘层比中间层贵 2.63 倍等现象,因此在 Mini 与 Nano 段相比扁平分配有 22–25% 的 KL 优势。但作者明确说明 Q6_K 及以上时优势消失,因此仓库不发布更大量化档。视觉支持需额外加载 0.93GB 的 mmproj F16 文件。模型卡未说明上下文长度、训练数据与具体任务基准。
更适合谁
- 有 12–16GB VRAM 显卡想跑 27B 模型的用户
- 想尝试混合注意力架构与投机解码的进阶玩家
- 需要视觉多模态并能自行挂载投影器的用户
- 认可 APEX 测量式分配、愿意尝试非常规量化档的用户
典型使用场景
- 16GB VRAM 本地推理 27B 稠密大模型
- 12GB 显存下体验混合注意力架构
- 搭配视觉投影器进行图文对话
- 测试投机解码的速度与质量权衡
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
混合注意力架构
64 层中交错 3 层线性注意力与 1 层全注意力,结构独特
APEX 测量式量化
基于 KL 测量的逐张量比特分配,小体积档位相比扁平分配 KL 更低
内置 MTP/NextN 投机头
blk.64 处保留 Q8_0 头,可直接用于 draft-mtp 投机解码
视觉多模态可选
提供 F16 mmproj 投影器,可与任一量化搭配开启视觉
量化档位差异化
Mini 与 Nano 针对不同显存场景提供独立取舍
硬件怎么准备
- Mini 版建议至少 16GB VRAM
- Nano 版可在 12GB VRAM 下尝试
- 视觉投影器约 0.93GB,需额外预留显存或内存
- 需使用 2026-08-13 之后的较新 llama.cpp(qwen3_5 支持)
量化版本怎么选
- 显存约 16GB 时选 Mini(13.94GB),KL 与体积较平衡
- 显存约 12GB 时选 Nano(11.24GB),接受更高 KL 换更小体积
- 想要视觉能力需额外下载 mmproj-F16.gguf 文件
- 仓库不发布 Q6_K 及以上档位,因 APEX 优势在该段消失
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 17GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 19.5GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp(需支持 qwen3_5 的较新构建)
- LocalAI(作者所属团队项目)
采用前要知道的限制
- 吞吐量未测量,作者明确不承诺速度,+35–52% tok/s 来自第三方报告
- 量化质量数据仅适用于该混合注意力架构,不宜外推其他模型
- token_embd 受 imatrix 限制,极低比特如 IQ2_XXS 无法量化
- 模型卡未说明上下文长度与训练数据来源