下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
mit
MODEL POSITIONING
这个模型解决什么问题?
模型能力方面,Ornith-1.0-9B 是 9B 密集参数的开源智能体编程模型,源自自改进训练框架,官方在 Terminal-Bench、SWE-Bench 等编码基准上公布成绩,强调工具调用、终端代码代理和多步推理能力,默认输出含思考块。量化仓库方面,本仓库为 GGUF 量化版,提供 Q4_K_M、Q5_K_M、BF16、Q6_K、Q8_0 等版本,文件大小和显存需求对应不同精度取舍。运行工具方面,模型卡推荐 vLLM、SGLang、Hugging Face Transformers(≥5.8.1)等服务化方案,同时兼容 Ollama、llama.cpp、LM Studio 本地推理,以及 Hermes Agent、OpenHands、OpenCode 等代理框架。
更适合谁
- 需要单 GPU 本地部署智能体编码模型的开发者
- 想用自托管模型替代云端编码助手的个人或小团队
- 研究 RL 自改进训练框架与代理编程的研究人员
- 想把本地模型接入 IDE 或终端编码 CLI 的用户
典型使用场景
- 终端代理编码任务,如理解大型代码库、自动化重复工作
- SWE-Bench 风格的软件工程问题求解与代码修复
- 通过 Hermes Agent、OpenHands 等框架编排多步工具调用
- 在本地起 OpenAI 兼容服务,给 IDE 或编码 CLI 当后端
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
智能体编码能力
官方在 Terminal-Bench 2.1、SWE-bench 等基准上公布成绩,强调同尺寸领先
工具调用与函数式输出
原生输出 OpenAI 风格 tool_calls,可即插即用代理框架
思考与答案可分离
默认带 … 块,服务端可单独返回 reasoning_content
单卡部署友好
9B 密集规模,单 GPU 即可服务,兼容多种推理后端
许可证宽松
MIT 许可,无地域或商业限制
硬件怎么准备
- Q4_K_M 版本最低 5GB 显存 / 5.5GB 内存,建议 6GB 显存或 8GB 内存
- Q5_K_M / BF16 版本最低 6GB 显存 / 7GB 内存,建议 7GB 显存或 8GB 内存
- Q6_K 版本最低 7GB 显存 / 8GB 内存,建议 8GB 显存或 9.5GB 内存
- Q8_0 版本最低 9.5GB 显存 / 10.5GB 内存,建议 11GB 显存或 13GB 内存
量化版本怎么选
- 显存吃紧或想快上手可选 Q4_K_M(约 4.5GB 文件),平衡资源占用与效果
- 显存足够且追求质量可选 Q6_K(约 6.75GB)或 Q8_0(约 9GB)高精度量化
- BF16 仓库条目标注约 5.6GB,但 README 描述约 19GB,两者不一致,需以本地实测为准
- 没有独显时可走 CPU + llama.cpp 或 Ollama 路线,Q4/Q5 量化版体验更顺
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。
阅读 8GB 显存选型指南 →可以怎样运行
- vLLM 或 SGLang 启动 OpenAI 兼容 HTTP 服务,供 IDE 与代理框架调用
- Ollama 或 LM Studio 在本地做轻量推理与快速调试
- llama.cpp 直接加载 GGUF 文件做离线生成或脚本化测试
- 接入 Hermes Agent、OpenHands、OpenCode、Unsloth Studio 等代理框架做端到端任务
采用前要知道的限制
- 模型卡未提供中文通用对话、创意写作等场景的能力说明
- 配置中上下文长度为空,模型卡也未直接给出官方上下文数值(基准里出现 128K、256K、400K)
- BF16 仓库条目文件大小与 README 描述不一致,需以本地实测为准
- 需要较新的 Transformers(≥5.8.1)、vLLM(≥0.19.1)、SGLang(≥0.5.9)等运行时,老版本可能不兼容
COMPARISON PATH
继续对比同类方案
不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。