← 返回模型库

ornith-ai/Ornith-1.5-35B-A3B-GGUF

Ornith-1.5-35B-A3B-GGUF:35B MoE 编码智能体长上下文

Ornith-1.5-35B-A3B 是 35B 混合专家(MoE)文本生成模型,每 token 激活约 3B 参数,面向编码与智能体任务,支持长上下文与工具调用。适合本地或私有化部署的开发者与 Agent 工程师。Q4_K_M 量化约需 20GB 内存或显存,长上下文推理建议多卡 GPU。

本地 AI 编码助手智能体与工具调用长代码库阅读MoE 推理模型
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
mit

MODEL POSITIONING

这个模型解决什么问题?

本模型基于 Qwen3.5 与 Gemma4 继续预训练与后训练,通过自改进循环联合优化任务、脚手架与求解轨迹,目标是端到端自训练基础模型。模型卡将其定位为编码与智能体方向的推理模型,在 SWE-bench、Terminal-Bench、MCP-Atlas 上优于同尺寸稠密模型,并原生支持 OpenAI 风格的工具调用。本仓库为 GGUF 量化分发版本,覆盖 Q4_K_M、Q5_K_M、Q6_K、Q8_0 与 BF16,可由 Ollama、llama.cpp、LM Studio 加载。模型卡未说明训练数据组成与各量化选择的依据,全精度服务建议使用 Transformers ≥ 5.8.1、vLLM ≥ 0.19.1、SGLang ≥ 0.5.9。

更适合谁

  • 本地或私有化部署 AI 编码助手的开发者
  • 自托管 Agent 框架、需要 OpenAI 兼容接口的工程团队
  • 研究长上下文、MoE 推理与自改进训练方法的研究人员
  • 已有高端消费级 GPU 想体验 35B 编码模型的个人用户

典型使用场景

  • 终端式编程助手:理解大型代码库、生成补丁与自动化改动
  • 智能体工作流:调用工具完成多步骤检索、文件操作与软件工程任务
  • 本地代码评审、重构建议与单元测试生成
  • 超长代码库或文档的阅读、问答与摘要

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

编码与 Agent 表现领先

在 Terminal-Bench、SWE-bench、MCP-Atlas 等基准上优于同尺寸稠密模型

MoE 高效推理结构

总参 35B,每 token 仅激活约 3B 参数,量化后门槛明显降低

长上下文支持

原生 262K tokens,借助 YaRN 可扩展至约 1M tokens

工具调用原生兼容

输出 OpenAI 风格 tool_calls,可对接标准 Agent 框架

自改进训练路线

模型卡描述通过任务生成、脚手架与求解三轨联合优化

硬件怎么准备

  • Q4_K_M 文件约 17.5GB,建议至少 20.5GB 内存或 18GB 显存,推荐 24.5GB 内存或 20.5GB 显存
  • Q5_K_M 文件约 21.9GB,建议至少 25.5GB 内存或 22.5GB 显存,推荐 31GB 内存或 26GB 显存
  • Q8_0 文件约 35GB,建议至少 41GB 内存或 35.5GB 显存,推荐 49GB 内存或 40.5GB 显存
  • 模型卡建议全精度推理使用 2 张 80GB GPU 以承载 256K 上下文

量化版本怎么选

  • 内存或显存紧张时优先选择 Q4_K_M,可在约 20GB 内存或显存下加载
  • 想要在质量与体积间折中可选 Q5_K_M 或 Q6_K
  • 若以 CPU 本地推理为主、又想保留较高质量,建议 Q4_K_M
  • 模型卡未给出各量化相对 BF16 的质量损失幅度

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q416 GB18 GB20.5 GB24.5 GB文件 ↗
BF1620 GB22.5 GB26 GB31 GB文件 ↗
Q520 GB22.5 GB26 GB31 GB文件 ↗
Q624 GB26.5 GB30.5 GB37 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 18GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 20.5GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • Ollama:可直接拉取并运行 GGUF 量化版本
  • llama.cpp:通过 GGUF 文件在本地 CPU 与 GPU 混合环境下推理
  • LM Studio:图形化界面加载 GGUF 进行本地体验
  • vLLM 与 SGLang:模型卡推荐用于全精度生产服务,本仓库仅提供 GGUF,对应 GGUF 兼容性以官方文档为准

采用前要知道的限制

  • GGUF 相对全精度可能带来质量损失,模型卡未给出幅度
  • 长上下文对显存要求高,开启 YaRN 可能影响普通长度请求的质量
  • 模型卡未详细披露训练数据组成与许可之外的限制
  • 35B MoE 在消费级硬件上仍较重,量化后通常仍需 20GB 以上内存