← 返回模型库

deepreinforce-ai/Ornith-1.0-9B-GGUF

Ornith-1.0-9B-GGUF:面向代理编程的轻量9B模型

Ornith-1.0-9B 是面向智能体编程的 9B 密集模型,专为单 GPU 部署优化,擅长终端编码任务、工具调用与多步推理。模型卡未给出通用聊天定位,更适合接入代理框架或本地 OpenAI 兼容服务来自动化编码。Q4_K_M 量化约需 5GB 显存即可运行,BF16 全精度建议 8GB 以上显存或 13GB 内存。

智能体编程代码代理工具调用本地部署
查看模型源页面
下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
mit

MODEL POSITIONING

这个模型解决什么问题?

模型能力方面,Ornith-1.0-9B 是 9B 密集参数的开源智能体编程模型,源自自改进训练框架,官方在 Terminal-Bench、SWE-Bench 等编码基准上公布成绩,强调工具调用、终端代码代理和多步推理能力,默认输出含思考块。量化仓库方面,本仓库为 GGUF 量化版,提供 Q4_K_M、Q5_K_M、BF16、Q6_K、Q8_0 等版本,文件大小和显存需求对应不同精度取舍。运行工具方面,模型卡推荐 vLLM、SGLang、Hugging Face Transformers(≥5.8.1)等服务化方案,同时兼容 Ollama、llama.cpp、LM Studio 本地推理,以及 Hermes Agent、OpenHands、OpenCode 等代理框架。

更适合谁

  • 需要单 GPU 本地部署智能体编码模型的开发者
  • 想用自托管模型替代云端编码助手的个人或小团队
  • 研究 RL 自改进训练框架与代理编程的研究人员
  • 想把本地模型接入 IDE 或终端编码 CLI 的用户

典型使用场景

  • 终端代理编码任务,如理解大型代码库、自动化重复工作
  • SWE-Bench 风格的软件工程问题求解与代码修复
  • 通过 Hermes Agent、OpenHands 等框架编排多步工具调用
  • 在本地起 OpenAI 兼容服务,给 IDE 或编码 CLI 当后端

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

智能体编码能力

官方在 Terminal-Bench 2.1、SWE-bench 等基准上公布成绩,强调同尺寸领先

工具调用与函数式输出

原生输出 OpenAI 风格 tool_calls,可即插即用代理框架

思考与答案可分离

默认带 … 块,服务端可单独返回 reasoning_content

单卡部署友好

9B 密集规模,单 GPU 即可服务,兼容多种推理后端

许可证宽松

MIT 许可,无地域或商业限制

硬件怎么准备

  • Q4_K_M 版本最低 5GB 显存 / 5.5GB 内存,建议 6GB 显存或 8GB 内存
  • Q5_K_M / BF16 版本最低 6GB 显存 / 7GB 内存,建议 7GB 显存或 8GB 内存
  • Q6_K 版本最低 7GB 显存 / 8GB 内存,建议 8GB 显存或 9.5GB 内存
  • Q8_0 版本最低 9.5GB 显存 / 10.5GB 内存,建议 11GB 显存或 13GB 内存

量化版本怎么选

  • 显存吃紧或想快上手可选 Q4_K_M(约 4.5GB 文件),平衡资源占用与效果
  • 显存足够且追求质量可选 Q6_K(约 6.75GB)或 Q8_0(约 9GB)高精度量化
  • BF16 仓库条目标注约 5.6GB,但 README 描述约 19GB,两者不一致,需以本地实测为准
  • 没有独显时可走 CPU + llama.cpp 或 Ollama 路线,Q4/Q5 量化版体验更顺

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q44.2 GB5 GB6 GB8 GB文件 ↗
Q55.2 GB6 GB7 GB8 GB文件 ↗
BF165.2 GB6 GB7 GB8 GB文件 ↗
Q66.3 GB7 GB8 GB9.5 GB文件 ↗
Q88.4 GB9.5 GB11 GB13 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • vLLM 或 SGLang 启动 OpenAI 兼容 HTTP 服务,供 IDE 与代理框架调用
  • Ollama 或 LM Studio 在本地做轻量推理与快速调试
  • llama.cpp 直接加载 GGUF 文件做离线生成或脚本化测试
  • 接入 Hermes Agent、OpenHands、OpenCode、Unsloth Studio 等代理框架做端到端任务

采用前要知道的限制

  • 模型卡未提供中文通用对话、创意写作等场景的能力说明
  • 配置中上下文长度为空,模型卡也未直接给出官方上下文数值(基准里出现 128K、256K、400K)
  • BF16 仓库条目文件大小与 README 描述不一致,需以本地实测为准
  • 需要较新的 Transformers(≥5.8.1)、vLLM(≥0.19.1)、SGLang(≥0.5.9)等运行时,老版本可能不兼容

COMPARISON PATH

继续对比同类方案

不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。