← 返回模型库

ornith-ai/Ornith-1.0-35B-GGUF

Ornith-1.0-35B-GGUF:面向代理编码的轻量推理模型

Ornith-1.0-35B 是 35B 参数规模的自改进代理编码模型家族成员,针对单卡部署优化。适合需要在本地或私有化环境运行编码代理、调用工具并完成代码理解与改写任务的开发者与团队。Q4 量化需约 18GB 显存或 20.5GB 内存,硬件门槛偏高,入门级消费显卡通常难以承载。

编码代理工具调用单卡部署开源推理模型
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
mit

MODEL POSITIONING

这个模型解决什么问题?

Ornith-1.0-35B-GGUF 是 Ornith 自改进开源家族中面向单卡部署的轻量编码代理模型,仓库定位为基于 Transformers 的文本生成模型,强调工具调用与代理式编码能力。本仓库仅发布 GGUF 格式量化文件,配套支持 Ollama、llama.cpp 与 LM Studio 三种本地运行工具;模型卡同时给出 vLLM、SGLang、Hugging Face Transformers 等服务化部署说明,但这些格式文件不在本仓库内。模型卡未明确提供上下文长度与具体架构标签,仅在介绍中提及训练基座与 Qwen 3.5、Gemma 4 相关。

更适合谁

  • 拥有中高显存单卡并希望本地运行编码代理的开发者
  • 需要私有化部署具备推理与工具调用能力开源模型的团队
  • 研究自改进强化学习与代理框架集成的工程师

典型使用场景

  • 终端编码代理,理解并改写大型代码库
  • 通过 OpenAI 兼容接口接入 MCP 工具与 Hermes Agent、OpenHands 等代理框架
  • 长上下文代码生成、多轮推理与函数调用对话

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

代理编码能力

在 Terminal-Bench 2.1、SWE-Bench、NL2Repo、OpenClaw 等编码基准上表现领先

自改进训练框架

通过强化学习联合优化脚手架与解题轨迹

工具调用兼容

输出标准 OpenAI 风格 tool_calls,便于接入 MCP 与代理框架

单卡部署优化

35B 版本专为高效单卡推理设计

MIT 许可开源

全球可用,无地区访问限制

硬件怎么准备

  • Q4_K_M 量化最低约 18GB 显存或 20.5GB 内存,建议 20.5GB 显存或 24.5GB 内存
  • Q5_K_M 与 BF16 量化最低约 22.5GB 显存或 25.5GB 内存,建议 26GB 显存或 31GB 内存
  • Q6_K 量化最低约 26.5GB 显存或 31GB 内存,建议 30.5GB 显存或 37GB 内存
  • Q8_0 量化最低约 35.5GB 显存或 41GB 内存,建议 40.5GB 显存或 49GB 内存

量化版本怎么选

  • 显存充裕且追求更高质量时优先考虑 Q5_K_M 或 Q6_K
  • 显存紧张时选择 Q4_K_M 以满足最低门槛
  • BF16 与 Q5_K_M 文件体积接近,可按精度需求权衡
  • 本仓库未提供 Q4 以下更低精度量化,极受限场景需另寻方案

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q416 GB18 GB20.5 GB24.5 GB文件 ↗
Q520 GB22.5 GB26 GB31 GB文件 ↗
BF1620 GB22.5 GB26 GB31 GB文件 ↗
Q624 GB26.5 GB30.5 GB37 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 18GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 20.5GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • 使用 Ollama 拉取并以本地 API 方式运行
  • 在 LM Studio 中直接加载 GGUF 文件进行对话
  • 通过 llama.cpp 命令行进行推理或本地服务化部署
  • 接入 vLLM、SGLang 或 Transformers 服务化推理时需使用非 GGUF 格式文件

采用前要知道的限制

  • 模型卡未提供官方上下文长度参数,需以推理框架默认窗口为准
  • 本仓库仅含 GGUF 量化版本,部署 vLLM 或 SGLang 需另寻原始权重
  • 模型卡未提供官方架构标签与训练数据细节
  • 默认输出含 推理块,调用方需正确处理 reasoning_content 字段