下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力来源于 Qwen3.6-35B-A3B 基础模型:35B 总参数、约 3.4B 激活的 MoE 架构,原生 262K 上下文,支持中英双语与视觉输入,主打 agentic 软件工程、多轮对话与高效推理;模型卡未说明具体训练数据与详细基准。本仓库是 Unsloth 团队的 UD 动态量化 GGUF 分发,由作者 peculiar-ragdoll 加上 froggeric 改良的 chat template 和嵌入式系统提示;MTP 版本额外保留推测解码张量。运行工具支持 llama.cpp、Ollama、LM Studio 与 macOS 上的 MLX。
更适合谁
- 配备 24GB+ 显卡或 32GB+ 统一内存的本地 AI 用户
- 需要本地编程助手与 agentic 工作流的开发者
- 想跑 262K 长上下文多轮对话的重度用户
- 想尝试 MTP 推测解码提速的中高级玩家
典型使用场景
- 本地 agentic 编程与代码生成
- 长程多轮对话与文档问答
- 视觉理解与图文问答(配合 mmproj)
- 高吞吐的代码补全与推理任务
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
MTP 推测解码
保留 nextn 张量,README 称在 llama.cpp 源码版下代码生成约 1.25–1.35× 提速
35B MoE 体量
总参数 35B、激活约 3.4B,能力与显存/内存占用相对平衡
262K 原生长上下文
32GB Mac 上可跑到 92 轮 262k token,多轮马拉松强
改良 chat template
含 froggeric 改良版与压缩型嵌入式系统提示,工具调用与多轮更稳
多模态输入
通过 mmproj-F16.gguf 提供视觉问答能力
硬件怎么准备
- IQ3_S:建议至少 15.5GB 显存 / 18.5GB 内存,门槛最低但 16GB 卡余量紧张
- IQ4_XS 或 Q4_K_S:建议约 20.5GB 显存 / 24.5GB 内存,24GB 显卡常用档
- Q5_K_XL 或 Q6_K_XL:建议约 26–30.5GB 显存 / 31–37GB 内存,需 32GB+ 显存或统一内存
- BF16 双分片:单分片约 21.9GB,合计约 71GB,需 96GB+ 整机内存
量化版本怎么选
- 16GB 显卡勉强上 IQ3_S,长上下文空间受限
- 24GB 显卡优先 IQ4_XS,长上下文与 KV cache 余量更好
- 想用 Q4 档位最高保真选 Q4_K_S,但 24GB 余量偏紧
- 32GB+ 显存或统一内存可上 Q5_K_XL 或 Q6_K_XL;BF16 仅在 96GB+ 机器考虑
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 13.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 15.5GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp 源码版 b10362+ 启用 MTP 推测解码:使用 --spec-type draft-mtp
- Ollama 或 LM Studio 直接加载 GGUF(不带 MTP 加速)
- macOS MLX / oMLX 同一权重不同格式
- 视觉能力需额外加载 mmproj-F16.gguf,使用 llama-mtmd-cli
采用前要知道的限制
- README 全部基准来自 MLX 构建,非本 GGUF 实测
- 系统提示硬编码在 chat template,无法通过 API 关闭
- 当前 llama.cpp 正式版尚未支持 MTP 加速,需源码编译
- 量化由 Unsloth 完成,本仓库只改了 metadata,质量由 UD 方案决定