← 返回模型库

deepreinforce-ai/Ornith-1.0-35B-GGUF

Ornith-1.0-35B-GGUF:开源代理编码轻量模型

Ornith-1.0-35B-GGUF 是 35B 参数的代理编码开源模型,专注代码生成、工具调用与终端代理任务。模型采用自改进 RL 训练框架,适合本地搭建编程代理或 IDE 助手的开发者与研究人员。Q4_K_M 量化最低约需 18GB 显存或 20.

代理编码工具调用代码生成GGUF 本地部署
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
mit

MODEL POSITIONING

这个模型解决什么问题?

本仓库为 Ornith 1.0 系列的 GGUF 量化发布版,定位面向单卡部署的轻量成员。模型本身为 35B 文本生成模型,专精代理编码、工具调用与推理链输出,并支持 OpenAI 风格 tool_calls 字段。模型卡未给出统一上下文长度参数,不同评测分别采用 128K、256K、400K 窗口。仓库提供 Q4_K_M、Q5_K_M、Q6_K、Q8_0 与 BF16 多档量化,可经 Ollama、llama.cpp、LM Studio 等本地运行工具加载;原始模型同时支持 vLLM ≥ 0.19.1、SGLang ≥ 0.5.9、Transformers ≥ 5.8.1 服务化部署。模型卡未公开训练数据组成与具体基座细节。

更适合谁

  • 需要本地运行代码生成与工具调用模型的开发者
  • 搭建终端编码代理或 IDE 助手的研究人员
  • 在消费级单卡或工作站部署 35B 级代理模型的用户
  • 接入 OpenHands、OpenClaw、Hermes Agent 等代理框架的工程团队

典型使用场景

  • 仓库级代码理解、缺陷定位与自动化修改
  • 通过 MCP 服务器连接外部工具完成多步任务
  • 终端编码 CLI(如 OpenCode)的本地后端
  • 长上下文软件工程任务的推理与生成

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

代理编码与工具调用

模型卡定位为代理编码模型,输出支持 OpenAI 风格 tool_calls 字段

自改进 RL 训练

采用联合优化脚手架与解题路径的自改进框架

推理链输出

默认回复以 … 开头,可分离思考与最终答案

多档 GGUF 量化

仓库覆盖 Q4 至 Q8 与 BF16,适配不同显存与内存预算

硬件怎么准备

  • Q4_K_M 最低 18GB 显存或 20.5GB 内存,推荐 20.5GB 显存 / 24.5GB 内存
  • Q5_K_M 最低 22.5GB 显存或 25.5GB 内存,建议 24GB 级单卡
  • Q6_K 最低 26.5GB 显存或 31GB 内存,建议 32GB 以上显存卡
  • Q8_0 与 BF16 最低 35.5GB 显存或 41GB 内存,需专业级 GPU 或大内存工作站

量化版本怎么选

  • 24GB 显存优先选 Q4_K_M,平衡体积与质量
  • 32GB 显存可选 Q5_K_M 或 Q6_K 提升输出质量
  • 纯 CPU 推理建议 Q4_K_M,并预留 24GB 以上内存
  • BF16 与 Q5_K_M 文件体积相同,模型卡未说明在本地 CPU/GPU 路径下差异

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q416 GB18 GB20.5 GB24.5 GB文件 ↗
Q520 GB22.5 GB26 GB31 GB文件 ↗
BF1620 GB22.5 GB26 GB31 GB文件 ↗
Q624 GB26.5 GB30.5 GB37 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 18GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 20.5GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • Ollama、llama.cpp、LM Studio 直接加载 GGUF 文件
  • vLLM ≥ 0.19.1 或 SGLang ≥ 0.5.9 服务化部署为 OpenAI 兼容端点
  • Transformers ≥ 5.8.1 直接加载原始权重做离线推理
  • 接入 OpenHands、OpenClaw、Hermes Agent 等代理框架

采用前要知道的限制

  • 模型卡未给出统一上下文长度参数,不同评测窗口差异较大
  • 35B 标注为 MoE,模型卡未提供激活参数等具体架构细节
  • BF16 与 Q5_K_M 体积相同,模型卡未说明两者在本地推理下的实际差异
  • 服务化部署依赖较新推理栈版本,旧版本可能不兼容