← 返回模型库

ornith-ai/Ornith-1.5-9B-GGUF

Ornith-1.5-9B-GGUF:轻量代码与智能体推理模型

Ornith-1.5-9B 是一款面向终端编码与智能体场景的 9B 密集模型,在 Qwen3.5 与 Gemma4 基础上继续预训练并通过自改进循环优化。模型默认输出链式推理,支持工具调用与最长 262K 上下文,可经 YaRN 缩放扩展到约 1M tokens。

代码生成智能体推理工具调用本地部署
查看模型源页面
下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
mit

MODEL POSITIONING

这个模型解决什么问题?

模型能力方面,模型卡将 Ornith-1.5-9B 定位为面向终端编码与智能体场景的 9B 密集模型,在 Qwen3.5 与 Gemma4 基础上做继续预训练,并通过自改进循环联合优化任务生成、Scaffold 与解答回滚。模型默认输出链式推理块,支持 OpenAI 风格工具调用,可在 vLLM、SGLang、Transformers 中启用 reasoning 与 tool-call parser。原生上下文 262K tokens,可经 YaRN 缩放扩展到约 1M tokens。模型卡列出 Terminal-Bench、SWE-bench、HLE、GPQA、MCP-Atlas、Toolathlon、BrowseComp、ClawEval 等基准。 量化仓库方面,本仓库是 Ornith-1.

更适合谁

  • 需要本地或离线运行代码生成与终端代理的开发者与研究者
  • 希望在单张消费级 GPU 上做推理与工具调用实验的用户
  • 寻找 Qwen3.5 或 Gemma4 9B 量级替代并具备链式推理能力的使用者

典型使用场景

  • 终端编码代理与代码库理解
  • 函数调用与自动化工具编排
  • 长文档阅读与高 tokens 推理任务
  • 单机或边缘设备的本地 LLM 实验

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

链式推理

默认输出 think 风格推理块,可在 reasoning_content 字段中分离

工具调用

输出 OpenAI 风格 tool_calls,可与 Hermes Agent、OpenClaw 等代理框架对接

长上下文

原生 262K tokens,可经 YaRN 缩放扩展到约 1M tokens

代码与代理优化

模型卡定位为终端编码代理优化,列出 SWE-bench、Terminal-Bench、ClawEval 等基准

自改进训练

在 Qwen3.5 与 Gemma4 基础上通过任务、Scaffold、解答联合优化循环训练

硬件怎么准备

  • Q4_K_M 文件约 4.5GB,最低 5.5GB 内存或 5GB 显存,推荐 8GB 内存或 6GB 显存
  • Q5_K_M 与 BF16 文件约 5.6GB,最低 7GB 内存或 6GB 显存,推荐 8GB 或 7GB
  • Q6_K 文件约 6.75GB,最低 8GB 内存或 7GB 显存,推荐 9.5GB 或 8GB
  • Q8_0 文件约 9GB,最低 10.5GB 内存或 9.5GB 显存,推荐 13GB 或 11GB

量化版本怎么选

  • 内存或显存紧张选 Q4_K_M 以最低门槛运行
  • 显存 6GB 以上可考虑 Q5_K_M 或 Q6_K 平衡质量与体积
  • 显存 11GB 以上可选用 Q8_0 接近 BF16 精度
  • 完整 bf16 服务需约 80GB 单卡显存

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q44.2 GB5 GB6 GB8 GB文件 ↗
BF165.2 GB6 GB7 GB8 GB文件 ↗
Q55.2 GB6 GB7 GB8 GB文件 ↗
Q66.3 GB7 GB8 GB9.5 GB文件 ↗
Q88.4 GB9.5 GB11 GB13 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp 直接加载 GGUF 文件进行 CPU 或混合推理
  • LM Studio 加载 GGUF 文件做图形化本地推理
  • Ollama 通过 Modelfile 或导入 GGUF 文件部署
  • vLLM 或 SGLang 加载 transformers 检查点提供 OpenAI 兼容服务

采用前要知道的限制

  • 完整 bf16 服务需约 80GB 单卡 GPU,普通消费级显卡只能跑量化版本
  • 模型卡未给出量化版本相对于 BF16 的精度损失数据
  • 模型卡未列出训练数据规模与构成细节
  • Mobile 变体在本仓库 GGUF 文件清单中未出现