← 返回模型库

unsloth/Ornith-1.0-35B-GGUF

Ornith-1.0-35B-GGUF:面向编码代理的开源模型

Ornith-1.0-35B 是基于 Qwen3.5 微调的 35B MoE 模型,主打自主代理式编程,支持工具调用与代码生成。适合需要本地或私有部署智能编码助手、终端自动化脚本与 Agent 框架的开发者。提供 IQ1 到 Q6、BF16 多档 GGUF,最低约 4.

编程代理智能编码终端 AgentGGUF 量化
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
mit

MODEL POSITIONING

这个模型解决什么问题?

模型本体基于 Qwen3.5 微调为 35B MoE,主打智能体编程,在 Terminal-Bench 2.1、SWE-bench Verified、NL2Repo 等基准上对同尺寸开源模型表现领先,支持 OpenAI 兼容的工具调用与 reasoning_content 分离输出。本仓库为 unsloth 发布的 GGUF 量化分发版,提供 IQ1 到 Q6 及 BF16 多档选择,遵循 MIT 许可。本地推理推荐 Ollama、LM Studio 或 llama.cpp 直接加载;服务端部署需 vLLM 0.19.1 以上或 SGLang 0.5.9 以上,Transformers 需 5.8.1 以上。

更适合谁

  • 需要本地或私有部署编码代理的研发团队
  • 追求 SWE-bench Verified 等编程基准高分的中大型模型用户
  • 希望在终端或编辑器中接入 OpenAI 兼容 API 的开发者

典型使用场景

  • 仓库级代码理解、改写与跨文件重构
  • 终端编码代理与自动化脚本生成
  • 通过 OpenAI 兼容接口接入 OpenHands、OpenClaw 等 Agent 框架
  • 本地私有化部署的代码问答与调试助手

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

自主代理编程

在 Terminal-Bench 2.1 与 SWE-bench Verified 等基准上对 35B 量级开源模型具备领先得分

工具调用与链式推理

输出含 reasoning_content 与标准 tool_calls,便于 Agent 框架对接

自改进训练框架

通过强化学习联合优化生成过程与脚手架以提升解题质量

多档量化与宽松许可

MIT 许可下提供 IQ1 到 BF16 多档 GGUF,便利本地与商用部署

硬件怎么准备

  • IQ1/IQ2 档约需 9–10GB 显存或 11–13GB 内存,可在单张消费级显卡或中高端内存机器上尝试
  • Q4 档建议 18GB 显存或 21GB 内存,Q5/Q6 建议 26GB 以上显存或 31GB 以上内存
  • BF16 原精度建议至少 26GB 显存或 31GB 内存,模型卡建议单节点 8×80GB GPU 张量并行
  • 推理上下文较长,需结合实际硬件余量评估,模型卡未承诺具体生成速度

量化版本怎么选

  • 显存紧张或仅做体验可优先 IQ1/IQ2_M 文件,但质量下降明显
  • 兼顾质量与体积可选择 Q4_K_M 或 IQ4_NL,模型卡称其量化在同类中表现领先
  • 高显存主机可选择 Q5_K_M 或 Q6_K 保留更接近原模型表现
  • BF16 适合对生成质量要求严格且硬件充裕的研究或服务部署

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ14.1 GB4.5 GB5.5 GB8 GB文件 ↗
IQ28.1 GB9 GB10.5 GB12.5 GB文件 ↗
Q28.1 GB9 GB10.5 GB12.5 GB文件 ↗
IQ312 GB13.5 GB15.5 GB18.5 GB文件 ↗
Q312 GB13.5 GB15.5 GB18.5 GB文件 ↗
IQ416 GB18 GB20.5 GB24.5 GB文件 ↗
Q416 GB18 GB20.5 GB24.5 GB文件 ↗
BF1620 GB22.5 GB26 GB31 GB文件 ↗
GGUF20 GB22.5 GB26 GB31 GB文件 ↗
Q520 GB22.5 GB26 GB31 GB文件 ↗
F1620 GB22.5 GB26 GB31 GB文件 ↗
Q624 GB26.5 GB30.5 GB37 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 4.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 5.5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • Ollama 与 LM Studio 可直接加载 GGUF 文件进行本地对话
  • llama.cpp 提供命令行推理与 OpenAI 兼容 HTTP 服务
  • 高吞吐服务建议使用 vLLM 0.19.1 以上或 SGLang 0.5.9 以上启动 OpenAI 兼容端点
  • Transformers 5.8.1 以上可直接加载离线生成,需自行解析 reasoning_content

采用前要知道的限制

  • 35B 规模对消费级硬件压力较大,低档量化质量折损明显
  • 模型卡未提供中文与多语言场景的具体能力说明
  • 完整服务部署依赖较新版本的 vLLM、SGLang、Transformers,旧版本可能无法运行
  • 模型卡未明确给出统一的上下文长度上限,部署时需结合实际配置确认