下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
mit
MODEL POSITIONING
这个模型解决什么问题?
本仓库为 Ornith 1.0 系列的 GGUF 量化发布版,定位面向单卡部署的轻量成员。模型本身为 35B 文本生成模型,专精代理编码、工具调用与推理链输出,并支持 OpenAI 风格 tool_calls 字段。模型卡未给出统一上下文长度参数,不同评测分别采用 128K、256K、400K 窗口。仓库提供 Q4_K_M、Q5_K_M、Q6_K、Q8_0 与 BF16 多档量化,可经 Ollama、llama.cpp、LM Studio 等本地运行工具加载;原始模型同时支持 vLLM ≥ 0.19.1、SGLang ≥ 0.5.9、Transformers ≥ 5.8.1 服务化部署。模型卡未公开训练数据组成与具体基座细节。
更适合谁
- 需要本地运行代码生成与工具调用模型的开发者
- 搭建终端编码代理或 IDE 助手的研究人员
- 在消费级单卡或工作站部署 35B 级代理模型的用户
- 接入 OpenHands、OpenClaw、Hermes Agent 等代理框架的工程团队
典型使用场景
- 仓库级代码理解、缺陷定位与自动化修改
- 通过 MCP 服务器连接外部工具完成多步任务
- 终端编码 CLI(如 OpenCode)的本地后端
- 长上下文软件工程任务的推理与生成
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
代理编码与工具调用
模型卡定位为代理编码模型,输出支持 OpenAI 风格 tool_calls 字段
自改进 RL 训练
采用联合优化脚手架与解题路径的自改进框架
推理链输出
默认回复以 … 开头,可分离思考与最终答案
多档 GGUF 量化
仓库覆盖 Q4 至 Q8 与 BF16,适配不同显存与内存预算
硬件怎么准备
- Q4_K_M 最低 18GB 显存或 20.5GB 内存,推荐 20.5GB 显存 / 24.5GB 内存
- Q5_K_M 最低 22.5GB 显存或 25.5GB 内存,建议 24GB 级单卡
- Q6_K 最低 26.5GB 显存或 31GB 内存,建议 32GB 以上显存卡
- Q8_0 与 BF16 最低 35.5GB 显存或 41GB 内存,需专业级 GPU 或大内存工作站
量化版本怎么选
- 24GB 显存优先选 Q4_K_M,平衡体积与质量
- 32GB 显存可选 Q5_K_M 或 Q6_K 提升输出质量
- 纯 CPU 推理建议 Q4_K_M,并预留 24GB 以上内存
- BF16 与 Q5_K_M 文件体积相同,模型卡未说明在本地 CPU/GPU 路径下差异
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 18GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 20.5GB。
阅读 24GB 显存选型指南 →可以怎样运行
- Ollama、llama.cpp、LM Studio 直接加载 GGUF 文件
- vLLM ≥ 0.19.1 或 SGLang ≥ 0.5.9 服务化部署为 OpenAI 兼容端点
- Transformers ≥ 5.8.1 直接加载原始权重做离线推理
- 接入 OpenHands、OpenClaw、Hermes Agent 等代理框架
采用前要知道的限制
- 模型卡未给出统一上下文长度参数,不同评测窗口差异较大
- 35B 标注为 MoE,模型卡未提供激活参数等具体架构细节
- BF16 与 Q5_K_M 体积相同,模型卡未说明两者在本地推理下的实际差异
- 服务化部署依赖较新推理栈版本,旧版本可能不兼容