下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
mit
MODEL POSITIONING
这个模型解决什么问题?
本模型基于 Qwen3.5 与 Gemma4 继续预训练与后训练,通过自改进循环联合优化任务、脚手架与求解轨迹,目标是端到端自训练基础模型。模型卡将其定位为编码与智能体方向的推理模型,在 SWE-bench、Terminal-Bench、MCP-Atlas 上优于同尺寸稠密模型,并原生支持 OpenAI 风格的工具调用。本仓库为 GGUF 量化分发版本,覆盖 Q4_K_M、Q5_K_M、Q6_K、Q8_0 与 BF16,可由 Ollama、llama.cpp、LM Studio 加载。模型卡未说明训练数据组成与各量化选择的依据,全精度服务建议使用 Transformers ≥ 5.8.1、vLLM ≥ 0.19.1、SGLang ≥ 0.5.9。
更适合谁
- 本地或私有化部署 AI 编码助手的开发者
- 自托管 Agent 框架、需要 OpenAI 兼容接口的工程团队
- 研究长上下文、MoE 推理与自改进训练方法的研究人员
- 已有高端消费级 GPU 想体验 35B 编码模型的个人用户
典型使用场景
- 终端式编程助手:理解大型代码库、生成补丁与自动化改动
- 智能体工作流:调用工具完成多步骤检索、文件操作与软件工程任务
- 本地代码评审、重构建议与单元测试生成
- 超长代码库或文档的阅读、问答与摘要
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
编码与 Agent 表现领先
在 Terminal-Bench、SWE-bench、MCP-Atlas 等基准上优于同尺寸稠密模型
MoE 高效推理结构
总参 35B,每 token 仅激活约 3B 参数,量化后门槛明显降低
长上下文支持
原生 262K tokens,借助 YaRN 可扩展至约 1M tokens
工具调用原生兼容
输出 OpenAI 风格 tool_calls,可对接标准 Agent 框架
自改进训练路线
模型卡描述通过任务生成、脚手架与求解三轨联合优化
硬件怎么准备
- Q4_K_M 文件约 17.5GB,建议至少 20.5GB 内存或 18GB 显存,推荐 24.5GB 内存或 20.5GB 显存
- Q5_K_M 文件约 21.9GB,建议至少 25.5GB 内存或 22.5GB 显存,推荐 31GB 内存或 26GB 显存
- Q8_0 文件约 35GB,建议至少 41GB 内存或 35.5GB 显存,推荐 49GB 内存或 40.5GB 显存
- 模型卡建议全精度推理使用 2 张 80GB GPU 以承载 256K 上下文
量化版本怎么选
- 内存或显存紧张时优先选择 Q4_K_M,可在约 20GB 内存或显存下加载
- 想要在质量与体积间折中可选 Q5_K_M 或 Q6_K
- 若以 CPU 本地推理为主、又想保留较高质量,建议 Q4_K_M
- 模型卡未给出各量化相对 BF16 的质量损失幅度
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 18GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 20.5GB。
阅读 24GB 显存选型指南 →可以怎样运行
- Ollama:可直接拉取并运行 GGUF 量化版本
- llama.cpp:通过 GGUF 文件在本地 CPU 与 GPU 混合环境下推理
- LM Studio:图形化界面加载 GGUF 进行本地体验
- vLLM 与 SGLang:模型卡推荐用于全精度生产服务,本仓库仅提供 GGUF,对应 GGUF 兼容性以官方文档为准
采用前要知道的限制
- GGUF 相对全精度可能带来质量损失,模型卡未给出幅度
- 长上下文对显存要求高,开启 YaRN 可能影响普通长度请求的质量
- 模型卡未详细披露训练数据组成与许可之外的限制
- 35B MoE 在消费级硬件上仍较重,量化后通常仍需 20GB 以上内存