← 返回模型库

prism-ml/Ternary-Bonsai-27B-gguf

Ternary-Bonsai-27B-gguf:27B三元量化笔记本可跑的长文本推理模型

Ternary Bonsai 27B 是基于 Qwen3.6-27B 的三元权重量化版本,部署约 7.2 GB,可在 8 GB 内存的笔记本上加载运行,保留数学、代码与思维链等核心推理能力,原生支持 262K 长上下文。

27B 本地推理三元量化长上下文笔记本可跑
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库仅承载三元量化 GGUF 文件与配套多模态、投机解码组件,模型能力继承自 Qwen3.6-27B 27B 混合注意力基座。量化层面采用 1.71 bits/weight 的真三元权重({−1, 0, +1}),配合 FP16 分组缩放,可在约 7.2 GB 部署体积下保留约 95% 的 FP16 推理表现。运行依赖 llama.cpp 自定义低比特内核(CUDA、Metal、CPU),亦可通过 Ollama、LM Studio 或 Apple Silicon MLX 加载;DSpark 投机解码 drafter 默认仅在 CUDA 路径开启。模型卡未说明具体的工具调用实现细节与多语言覆盖范围。

更适合谁

  • 想在笔记本本地离线跑 27B 推理的用户
  • 需要 262K 长上下文做整库代码或长文档分析的研究者
  • 关注数据隐私、不希望数据外发的开发者
  • 拥有 24 GB 级单卡、追求高密度智能的部署者

典型使用场景

  • 笔记本本地的 27B 智能体与工具调用场景
  • 长文档、全仓库代码理解与分析
  • 隐私敏感或离线环境下的对话与推理
  • 单张 24 GB 级 GPU 的高效推理服务

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

三元权重量化

1.71 bits/weight 真三元权重,部署约 7.2 GB,相对 FP16 约 9.4 倍体积缩减

长上下文原生支持

262K token 全窗口,配合 4-bit KV 缓存峰值约 12.8 GB

推理能力保留

数学 93.40、代码 85.96、工具调用 74.01,思维链与代理行为在亚 4-bit 区间仍完整

可选多模态视觉

自带 HQQ 4-bit mmproj 视觉塔约 0.63 GB,按需加载

投机解码加速

配套 DSpark drafter,在 CUDA 服务路径下提供约 1.34x 解码提速

硬件怎么准备

  • 8 GB 内存 / 7 GB 显存即可加载 Q2_0 主模型(最低 8 GB 内存、推荐 9.5 GB)
  • 16 GB 内存 / 14 GB 显存可叠加 dspark-Q4_1 drafter 启用投机解码
  • 20 GB 内存 / 17 GB 显存起可运行 F16、BF16 或 PQ2_0 全精度版本
  • 31.5 GB 内存 / 27.5 GB 显存以上方可按需加载 mmproj-Q8_0 视觉组件

量化版本怎么选

  • 笔记本主力档优先选 Ternary-Bonsai-27B-Q2_0.gguf(约 6.75 GB)
  • CUDA 单卡且显存充裕时可同时加载 dspark-Q4_1.gguf 启用投机解码
  • mmproj-Q8_0.gguf 仅在需要图像输入时按需挂载
  • F16/BF16 与 PQ2_0 体积约 16.9 GB,更适合 24 GB 级 GPU 与离线研究场景

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q26.3 GB7 GB8 GB9.5 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
GGUF16 GB17 GB19.5 GB24 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp 自定义低比特内核(CUDA / Metal / CPU)
  • Ollama 拉取并直接运行
  • LM Studio 加载 GGUF 文件
  • Apple Silicon 通过 MLX / MLX Swift 加载对应 2-bit 版本

采用前要知道的限制

  • 7.2 GB 部署体积超过 iPhone 等手机应用内存预算,移动端需改用 1-bit 伴侣版
  • 相比 FP16 仍损失约 5.4% 整体能力,差距集中在指令遵循与视觉任务
  • 当前以 2-bit 槽位存储三元值,部署体积尚未达到 5.9 GB 理论最优
  • DSpark drafter 在 Apple Silicon 默认未启用,投机解码仅 CUDA 路径有效