下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本仓库仅承载三元量化 GGUF 文件与配套多模态、投机解码组件,模型能力继承自 Qwen3.6-27B 27B 混合注意力基座。量化层面采用 1.71 bits/weight 的真三元权重({−1, 0, +1}),配合 FP16 分组缩放,可在约 7.2 GB 部署体积下保留约 95% 的 FP16 推理表现。运行依赖 llama.cpp 自定义低比特内核(CUDA、Metal、CPU),亦可通过 Ollama、LM Studio 或 Apple Silicon MLX 加载;DSpark 投机解码 drafter 默认仅在 CUDA 路径开启。模型卡未说明具体的工具调用实现细节与多语言覆盖范围。
更适合谁
- 想在笔记本本地离线跑 27B 推理的用户
- 需要 262K 长上下文做整库代码或长文档分析的研究者
- 关注数据隐私、不希望数据外发的开发者
- 拥有 24 GB 级单卡、追求高密度智能的部署者
典型使用场景
- 笔记本本地的 27B 智能体与工具调用场景
- 长文档、全仓库代码理解与分析
- 隐私敏感或离线环境下的对话与推理
- 单张 24 GB 级 GPU 的高效推理服务
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
三元权重量化
1.71 bits/weight 真三元权重,部署约 7.2 GB,相对 FP16 约 9.4 倍体积缩减
长上下文原生支持
262K token 全窗口,配合 4-bit KV 缓存峰值约 12.8 GB
推理能力保留
数学 93.40、代码 85.96、工具调用 74.01,思维链与代理行为在亚 4-bit 区间仍完整
可选多模态视觉
自带 HQQ 4-bit mmproj 视觉塔约 0.63 GB,按需加载
投机解码加速
配套 DSpark drafter,在 CUDA 服务路径下提供约 1.34x 解码提速
硬件怎么准备
- 8 GB 内存 / 7 GB 显存即可加载 Q2_0 主模型(最低 8 GB 内存、推荐 9.5 GB)
- 16 GB 内存 / 14 GB 显存可叠加 dspark-Q4_1 drafter 启用投机解码
- 20 GB 内存 / 17 GB 显存起可运行 F16、BF16 或 PQ2_0 全精度版本
- 31.5 GB 内存 / 27.5 GB 显存以上方可按需加载 mmproj-Q8_0 视觉组件
量化版本怎么选
- 笔记本主力档优先选 Ternary-Bonsai-27B-Q2_0.gguf(约 6.75 GB)
- CUDA 单卡且显存充裕时可同时加载 dspark-Q4_1.gguf 启用投机解码
- mmproj-Q8_0.gguf 仅在需要图像输入时按需挂载
- F16/BF16 与 PQ2_0 体积约 16.9 GB,更适合 24 GB 级 GPU 与离线研究场景
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp 自定义低比特内核(CUDA / Metal / CPU)
- Ollama 拉取并直接运行
- LM Studio 加载 GGUF 文件
- Apple Silicon 通过 MLX / MLX Swift 加载对应 2-bit 版本
采用前要知道的限制
- 7.2 GB 部署体积超过 iPhone 等手机应用内存预算,移动端需改用 1-bit 伴侣版
- 相比 FP16 仍损失约 5.4% 整体能力,差距集中在指令遵循与视觉任务
- 当前以 2-bit 槽位存储三元值,部署体积尚未达到 5.9 GB 理论最优
- DSpark drafter 在 Apple Silicon 默认未启用,投机解码仅 CUDA 路径有效