← 返回模型库

prism-ml/Bonsai-27B-gguf

Bonsai-27B-gguf:27B模型一比特极限压缩本地可跑

本仓库是prism-ml基于Qwen3.6-27B的1比特二值化GGUF量化版本,把27B参数混合注意力模型压到约3.9GB(每权重1.125bit),主打长文本对话、代码生成与本地离线推理。适合在普通笔记本、单卡GPU或手机上跑27B级模型的用户,最低约4GB内存即可加载主语言模型,附带视觉塔可处理图像输入。

1比特大模型27B本地推理长上下文边缘部署
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型层面:1-bit Bonsai 27B是Qwen3.6-27B的1比特二值化版本,权重覆盖嵌入、注意力、MLP投影与LM头,混合注意力设计(约75%线性加约25%全注意力)支持262K上下文,附带可选视觉塔支持多模态输入,模型卡以15项思维模式基准平均分76.11描述其能力定位。量化仓库:本仓库仅提供GGUF格式,主体语言模型为Q1_0_g128(约3.9GB),另有DSpark草稿器、参考F16与mmproj Q8_0视觉塔等组件;模型卡未说明训练数据与微调流程。运行工具:推荐使用支持自定义低比特核的llama.cpp分支(CUDA、Metal、CPU),另提供MLX与MLX Swift版本用于Apple设备与iPhone;Ollama与LM Studio已声明支持本仓库格式。

更适合谁

  • 想在普通笔记本本地跑27B级对话与推理的用户
  • 仅有约4至8GB内存或单张小显存显卡的轻量硬件玩家
  • 需要262K长上下文处理长文档、代码仓库或多轮对话的开发者
  • 注重隐私、需离线或低能耗运行大模型的从业者

典型使用场景

  • 笔记本本地27B级长文档摘要、阅读与多轮对话
  • 单张消费级GPU上的离线代码生成与编程辅助
  • 隐私敏感场景的本地问答、知识整理与数据处理
  • iPhone或Mac等Apple设备上的离线大模型推理体验

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

极致1比特压缩

把27B模型压到约3.9GB,约为FP16的1/14.2,仍保留约89.5%思维模式基准平均分

长上下文混合注意力

基于Qwen3.6-27B的混合注意力骨干,支持262K tokens长文档分析

推理能力保真

在数学(MATH-500 98.00、AIME26 87.08)与代码(HumanEval+ 89.63)类接近FP16水平

可选多模态输入

附带视觉塔mmproj支持图像理解,按需加载不占文本推理常驻内存

投机解码加速

配套DSpark草稿器在CUDA服务路径上提供约1.37倍无损解码加速

硬件怎么准备

  • 主语言模型Q1_0文件约3.4GB,最低约4GB内存或3.5GB显存即可加载,推荐8GB内存与4.5GB显存
  • 长上下文会显著增加峰值占用,模型卡实测4K约5.2GB、10K约5.6GB、100K约11.6GB
  • 加载F16或bf16参考文件需约20GB以上内存或17GB以上显存
  • 视觉塔mmproj Q8_0约27GB,需约31.5GB内存或27.5GB显存才能完整加载

量化版本怎么选

  • Q1_0(约3.4GB)是仓库原生1比特主权重,是27B类模型最激进的部署点
  • 模型卡另提供Ternary-Bonsai-27B-gguf(约7.2GB、95%FP16)作为质量取向替代点
  • DSpark草稿器Q4_1与bf16参考版本用于投机解码,需与主模型联合部署
  • 视觉塔mmproj Q8_0仅在需要图像输入时按需加载

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q13.1 GB3.5 GB4.5 GB8 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 3.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4.5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp官方分叉(CUDA、Metal、CPU)支持自定义1比特混合注意力核
  • MLX与MLX Swift版本用于Apple Silicon与iOS原生推理
  • Ollama与LM Studio已声明支持本仓库GGUF格式部署

采用前要知道的限制

  • 1比特版本保留约89.5%FP16能力,差距主要集中于指令遵循与智能体工具调用等高难度类别
  • 智能体编程(长链路、多文件、运行测试修复工作流)尚未作为本版本重点
  • 模型卡未提供训练数据集、微调流程与不同硬件速度排名等细节
  • 启用4比特KV缓存可降低长上下文峰值,但模型卡未承诺具体兼容的工具版本

COMPARISON PATH

继续对比同类方案

不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。