下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
mit
MODEL POSITIONING
这个模型解决什么问题?
模型能力方面,模型卡将 Ornith-1.5-9B 定位为面向终端编码与智能体场景的 9B 密集模型,在 Qwen3.5 与 Gemma4 基础上做继续预训练,并通过自改进循环联合优化任务生成、Scaffold 与解答回滚。模型默认输出链式推理块,支持 OpenAI 风格工具调用,可在 vLLM、SGLang、Transformers 中启用 reasoning 与 tool-call parser。原生上下文 262K tokens,可经 YaRN 缩放扩展到约 1M tokens。模型卡列出 Terminal-Bench、SWE-bench、HLE、GPQA、MCP-Atlas、Toolathlon、BrowseComp、ClawEval 等基准。 量化仓库方面,本仓库是 Ornith-1.
更适合谁
- 需要本地或离线运行代码生成与终端代理的开发者与研究者
- 希望在单张消费级 GPU 上做推理与工具调用实验的用户
- 寻找 Qwen3.5 或 Gemma4 9B 量级替代并具备链式推理能力的使用者
典型使用场景
- 终端编码代理与代码库理解
- 函数调用与自动化工具编排
- 长文档阅读与高 tokens 推理任务
- 单机或边缘设备的本地 LLM 实验
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
链式推理
默认输出 think 风格推理块,可在 reasoning_content 字段中分离
工具调用
输出 OpenAI 风格 tool_calls,可与 Hermes Agent、OpenClaw 等代理框架对接
长上下文
原生 262K tokens,可经 YaRN 缩放扩展到约 1M tokens
代码与代理优化
模型卡定位为终端编码代理优化,列出 SWE-bench、Terminal-Bench、ClawEval 等基准
自改进训练
在 Qwen3.5 与 Gemma4 基础上通过任务、Scaffold、解答联合优化循环训练
硬件怎么准备
- Q4_K_M 文件约 4.5GB,最低 5.5GB 内存或 5GB 显存,推荐 8GB 内存或 6GB 显存
- Q5_K_M 与 BF16 文件约 5.6GB,最低 7GB 内存或 6GB 显存,推荐 8GB 或 7GB
- Q6_K 文件约 6.75GB,最低 8GB 内存或 7GB 显存,推荐 9.5GB 或 8GB
- Q8_0 文件约 9GB,最低 10.5GB 内存或 9.5GB 显存,推荐 13GB 或 11GB
量化版本怎么选
- 内存或显存紧张选 Q4_K_M 以最低门槛运行
- 显存 6GB 以上可考虑 Q5_K_M 或 Q6_K 平衡质量与体积
- 显存 11GB 以上可选用 Q8_0 接近 BF16 精度
- 完整 bf16 服务需约 80GB 单卡显存
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp 直接加载 GGUF 文件进行 CPU 或混合推理
- LM Studio 加载 GGUF 文件做图形化本地推理
- Ollama 通过 Modelfile 或导入 GGUF 文件部署
- vLLM 或 SGLang 加载 transformers 检查点提供 OpenAI 兼容服务
采用前要知道的限制
- 完整 bf16 服务需约 80GB 单卡 GPU,普通消费级显卡只能跑量化版本
- 模型卡未给出量化版本相对于 BF16 的精度损失数据
- 模型卡未列出训练数据规模与构成细节
- Mobile 变体在本仓库 GGUF 文件清单中未出现