下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
mit
MODEL POSITIONING
这个模型解决什么问题?
Ornith-1.0-35B-GGUF 是 Ornith 自改进开源家族中面向单卡部署的轻量编码代理模型,仓库定位为基于 Transformers 的文本生成模型,强调工具调用与代理式编码能力。本仓库仅发布 GGUF 格式量化文件,配套支持 Ollama、llama.cpp 与 LM Studio 三种本地运行工具;模型卡同时给出 vLLM、SGLang、Hugging Face Transformers 等服务化部署说明,但这些格式文件不在本仓库内。模型卡未明确提供上下文长度与具体架构标签,仅在介绍中提及训练基座与 Qwen 3.5、Gemma 4 相关。
更适合谁
- 拥有中高显存单卡并希望本地运行编码代理的开发者
- 需要私有化部署具备推理与工具调用能力开源模型的团队
- 研究自改进强化学习与代理框架集成的工程师
典型使用场景
- 终端编码代理,理解并改写大型代码库
- 通过 OpenAI 兼容接口接入 MCP 工具与 Hermes Agent、OpenHands 等代理框架
- 长上下文代码生成、多轮推理与函数调用对话
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
代理编码能力
在 Terminal-Bench 2.1、SWE-Bench、NL2Repo、OpenClaw 等编码基准上表现领先
自改进训练框架
通过强化学习联合优化脚手架与解题轨迹
工具调用兼容
输出标准 OpenAI 风格 tool_calls,便于接入 MCP 与代理框架
单卡部署优化
35B 版本专为高效单卡推理设计
MIT 许可开源
全球可用,无地区访问限制
硬件怎么准备
- Q4_K_M 量化最低约 18GB 显存或 20.5GB 内存,建议 20.5GB 显存或 24.5GB 内存
- Q5_K_M 与 BF16 量化最低约 22.5GB 显存或 25.5GB 内存,建议 26GB 显存或 31GB 内存
- Q6_K 量化最低约 26.5GB 显存或 31GB 内存,建议 30.5GB 显存或 37GB 内存
- Q8_0 量化最低约 35.5GB 显存或 41GB 内存,建议 40.5GB 显存或 49GB 内存
量化版本怎么选
- 显存充裕且追求更高质量时优先考虑 Q5_K_M 或 Q6_K
- 显存紧张时选择 Q4_K_M 以满足最低门槛
- BF16 与 Q5_K_M 文件体积接近,可按精度需求权衡
- 本仓库未提供 Q4 以下更低精度量化,极受限场景需另寻方案
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 18GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 20.5GB。
阅读 24GB 显存选型指南 →可以怎样运行
- 使用 Ollama 拉取并以本地 API 方式运行
- 在 LM Studio 中直接加载 GGUF 文件进行对话
- 通过 llama.cpp 命令行进行推理或本地服务化部署
- 接入 vLLM、SGLang 或 Transformers 服务化推理时需使用非 GGUF 格式文件
采用前要知道的限制
- 模型卡未提供官方上下文长度参数,需以推理框架默认窗口为准
- 本仓库仅含 GGUF 量化版本,部署 vLLM 或 SGLang 需另寻原始权重
- 模型卡未提供官方架构标签与训练数据细节
- 默认输出含 推理块,调用方需正确处理 reasoning_content 字段