下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
mit
MODEL POSITIONING
这个模型解决什么问题?
模型本体基于 Qwen3.5 微调为 35B MoE,主打智能体编程,在 Terminal-Bench 2.1、SWE-bench Verified、NL2Repo 等基准上对同尺寸开源模型表现领先,支持 OpenAI 兼容的工具调用与 reasoning_content 分离输出。本仓库为 unsloth 发布的 GGUF 量化分发版,提供 IQ1 到 Q6 及 BF16 多档选择,遵循 MIT 许可。本地推理推荐 Ollama、LM Studio 或 llama.cpp 直接加载;服务端部署需 vLLM 0.19.1 以上或 SGLang 0.5.9 以上,Transformers 需 5.8.1 以上。
更适合谁
- 需要本地或私有部署编码代理的研发团队
- 追求 SWE-bench Verified 等编程基准高分的中大型模型用户
- 希望在终端或编辑器中接入 OpenAI 兼容 API 的开发者
典型使用场景
- 仓库级代码理解、改写与跨文件重构
- 终端编码代理与自动化脚本生成
- 通过 OpenAI 兼容接口接入 OpenHands、OpenClaw 等 Agent 框架
- 本地私有化部署的代码问答与调试助手
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
自主代理编程
在 Terminal-Bench 2.1 与 SWE-bench Verified 等基准上对 35B 量级开源模型具备领先得分
工具调用与链式推理
输出含 reasoning_content 与标准 tool_calls,便于 Agent 框架对接
自改进训练框架
通过强化学习联合优化生成过程与脚手架以提升解题质量
多档量化与宽松许可
MIT 许可下提供 IQ1 到 BF16 多档 GGUF,便利本地与商用部署
硬件怎么准备
- IQ1/IQ2 档约需 9–10GB 显存或 11–13GB 内存,可在单张消费级显卡或中高端内存机器上尝试
- Q4 档建议 18GB 显存或 21GB 内存,Q5/Q6 建议 26GB 以上显存或 31GB 以上内存
- BF16 原精度建议至少 26GB 显存或 31GB 内存,模型卡建议单节点 8×80GB GPU 张量并行
- 推理上下文较长,需结合实际硬件余量评估,模型卡未承诺具体生成速度
量化版本怎么选
- 显存紧张或仅做体验可优先 IQ1/IQ2_M 文件,但质量下降明显
- 兼顾质量与体积可选择 Q4_K_M 或 IQ4_NL,模型卡称其量化在同类中表现领先
- 高显存主机可选择 Q5_K_M 或 Q6_K 保留更接近原模型表现
- BF16 适合对生成质量要求严格且硬件充裕的研究或服务部署
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ1 | 4.1 GB | 4.5 GB | 5.5 GB | 8 GB | 文件 ↗ |
| IQ2 | 8.1 GB | 9 GB | 10.5 GB | 12.5 GB | 文件 ↗ |
| Q2 | 8.1 GB | 9 GB | 10.5 GB | 12.5 GB | 文件 ↗ |
| IQ3 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
| Q3 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
| IQ4 | 16 GB | 18 GB | 20.5 GB | 24.5 GB | 文件 ↗ |
| Q4 | 16 GB | 18 GB | 20.5 GB | 24.5 GB | 文件 ↗ |
| BF16 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| GGUF | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| Q5 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| F16 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| Q6 | 24 GB | 26.5 GB | 30.5 GB | 37 GB | 文件 ↗ |
| Q8 | 33 GB | 35.5 GB | 40.5 GB | 49 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 4.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 5.5GB。
阅读 8GB 显存选型指南 →可以怎样运行
- Ollama 与 LM Studio 可直接加载 GGUF 文件进行本地对话
- llama.cpp 提供命令行推理与 OpenAI 兼容 HTTP 服务
- 高吞吐服务建议使用 vLLM 0.19.1 以上或 SGLang 0.5.9 以上启动 OpenAI 兼容端点
- Transformers 5.8.1 以上可直接加载离线生成,需自行解析 reasoning_content
采用前要知道的限制
- 35B 规模对消费级硬件压力较大,低档量化质量折损明显
- 模型卡未提供中文与多语言场景的具体能力说明
- 完整服务部署依赖较新版本的 vLLM、SGLang、Transformers,旧版本可能无法运行
- 模型卡未明确给出统一的上下文长度上限,部署时需结合实际配置确认