下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
mit
MODEL POSITIONING
这个模型解决什么问题?
区分模型能力、量化仓库、运行工具。模型能力:35B 参数的 MoE 架构,256 专家 8 激活,原生支持中英文与图像输入,擅长代码修复与多轮对话,但通用知识与推理偏弱。量化仓库:本仓库是基于 Ornith-1.5-35B-A3B 的自有 imatrix 加 Unsloth Dynamic 量化版,携带 Sharp 聊天模板,未保留多 token 预测头。运行工具:模型卡未给出具体命令细节,已声明支持 llama.cpp、Ollama、LM Studio 运行时。
更适合谁
- 需要本地代理式代码修复与多轮编码协作的开发者
- 希望在 24 GB 组合内存或显存上跑 MoE 的本地推理用户
- 偏好简短直接回答、减少追问回合的代码协作场景
- 需要附带视觉识别能力的本地编码助手用户
典型使用场景
- 本地代理式代码修复与持续多轮编码协作
- 截图、报错堆栈、设计稿的图像理解与编码辅助
- 长上下文代码审查与对话型开发
- 轻量级日常问答与简短多轮对话(不擅长专业考试)
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
代理式编码表现突出
SWE-bench-Live 修复 12/25 题,与 Opus 4.6 medium 同档
多轮对话质量领先
Claw-Eval 多轮任务 67.2,高于同档多数对手
MoE 架构资源占用低
256 专家 8 激活,KV 占用小,可在较小显存运行
支持视觉输入
继承基座视觉塔,可识别截图、报错堆栈与设计稿
自有 imatrix 量化
使用自校准的 imatrix 文件,可由用户自行切档
硬件怎么准备
- 16 GB 组合内存可选 IQ3_XXS,Q2_K_XL 仅作最后手段
- 24 GB 组合内存可选 Q3_K_XL、IQ4_XS、Q4_K_S,建议以此为起点
- 32 GB 组合内存可舒适运行 Q4_K_XL 或 Q5_K_XL
- 48 GB 组合内存可选 Q6_K_XL 或 Q8_K_XL;模型卡未承诺速度表现
量化版本怎么选
- 不要为了塞进显存就降到 UD-Q4 以下,应让模型与上下文分布在 RAM+VRAM 合计
- 24 GB 起步推荐 UD-Q4_K_XL,是模型卡基准测试档
- 32 GB 推荐 UD-Q5_K_XL,48 GB 选 UD-Q6_K_XL 接近无损
- 自带 imatrix 文件可让用户自行切分其他未提供的量化档
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| Q2 | 8.1 GB | 9 GB | 10.5 GB | 12.5 GB | 文件 ↗ |
| IQ3 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
| Q3 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
| IQ4 | 16 GB | 18 GB | 20.5 GB | 24.5 GB | 文件 ↗ |
| Q4 | 16 GB | 18 GB | 20.5 GB | 24.5 GB | 文件 ↗ |
| Q5 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| GGUF | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| BF16 | 20 GB | 22.5 GB | 26 GB | 31 GB | 文件 ↗ |
| Q6 | 24 GB | 26.5 GB | 30.5 GB | 37 GB | 文件 ↗ |
| Q8 | 33 GB | 35.5 GB | 40.5 GB | 49 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 9GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 10.5GB。
阅读 12GB 显存选型指南 →可以怎样运行
- 使用 llama.cpp 的 llama-server 或 llama-quantize 加载 GGUF 文件
- 通过 Ollama 创建模型并替换为所需 GGUF 量化文件
- 在 LM Studio 中直接加载 GGUF 量化文件
- 启用视觉需额外加载共享的 mmproj-BF16.gguf 投影文件
采用前要知道的限制
- MMLU-Pro 仅 73.7,比同档 Nail 落后 10.3 分
- 主动追问较少,对模糊需求可能直接作答而非澄清
- 仅支持中文与英文,继承自基座限制
- 当前版本未带多 token 预测头,需要投机解码的用户需另寻版本