下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型层面:1-bit Bonsai 27B是Qwen3.6-27B的1比特二值化版本,权重覆盖嵌入、注意力、MLP投影与LM头,混合注意力设计(约75%线性加约25%全注意力)支持262K上下文,附带可选视觉塔支持多模态输入,模型卡以15项思维模式基准平均分76.11描述其能力定位。量化仓库:本仓库仅提供GGUF格式,主体语言模型为Q1_0_g128(约3.9GB),另有DSpark草稿器、参考F16与mmproj Q8_0视觉塔等组件;模型卡未说明训练数据与微调流程。运行工具:推荐使用支持自定义低比特核的llama.cpp分支(CUDA、Metal、CPU),另提供MLX与MLX Swift版本用于Apple设备与iPhone;Ollama与LM Studio已声明支持本仓库格式。
更适合谁
- 想在普通笔记本本地跑27B级对话与推理的用户
- 仅有约4至8GB内存或单张小显存显卡的轻量硬件玩家
- 需要262K长上下文处理长文档、代码仓库或多轮对话的开发者
- 注重隐私、需离线或低能耗运行大模型的从业者
典型使用场景
- 笔记本本地27B级长文档摘要、阅读与多轮对话
- 单张消费级GPU上的离线代码生成与编程辅助
- 隐私敏感场景的本地问答、知识整理与数据处理
- iPhone或Mac等Apple设备上的离线大模型推理体验
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
极致1比特压缩
把27B模型压到约3.9GB,约为FP16的1/14.2,仍保留约89.5%思维模式基准平均分
长上下文混合注意力
基于Qwen3.6-27B的混合注意力骨干,支持262K tokens长文档分析
推理能力保真
在数学(MATH-500 98.00、AIME26 87.08)与代码(HumanEval+ 89.63)类接近FP16水平
可选多模态输入
附带视觉塔mmproj支持图像理解,按需加载不占文本推理常驻内存
投机解码加速
配套DSpark草稿器在CUDA服务路径上提供约1.37倍无损解码加速
硬件怎么准备
- 主语言模型Q1_0文件约3.4GB,最低约4GB内存或3.5GB显存即可加载,推荐8GB内存与4.5GB显存
- 长上下文会显著增加峰值占用,模型卡实测4K约5.2GB、10K约5.6GB、100K约11.6GB
- 加载F16或bf16参考文件需约20GB以上内存或17GB以上显存
- 视觉塔mmproj Q8_0约27GB,需约31.5GB内存或27.5GB显存才能完整加载
量化版本怎么选
- Q1_0(约3.4GB)是仓库原生1比特主权重,是27B类模型最激进的部署点
- 模型卡另提供Ternary-Bonsai-27B-gguf(约7.2GB、95%FP16)作为质量取向替代点
- DSpark草稿器Q4_1与bf16参考版本用于投机解码,需与主模型联合部署
- 视觉塔mmproj Q8_0仅在需要图像输入时按需加载
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 3.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4.5GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp官方分叉(CUDA、Metal、CPU)支持自定义1比特混合注意力核
- MLX与MLX Swift版本用于Apple Silicon与iOS原生推理
- Ollama与LM Studio已声明支持本仓库GGUF格式部署
采用前要知道的限制
- 1比特版本保留约89.5%FP16能力,差距主要集中于指令遵循与智能体工具调用等高难度类别
- 智能体编程(长链路、多文件、运行测试修复工作流)尚未作为本版本重点
- 模型卡未提供训练数据集、微调流程与不同硬件速度排名等细节
- 启用4比特KV缓存可降低长上下文峰值,但模型卡未承诺具体兼容的工具版本
COMPARISON PATH
继续对比同类方案
不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。