← 返回模型库

AtomicChat/Ornith-1.5-35B-A3B-GGUF

Ornith-1.5-35B-A3B-GGUF:多模态对话与视觉推理

Ornith-1.5-35B-A3B-GGUF 是面向本地图像—文本对话的稀疏 MoE 量化模型,支持视觉输入、262144 长上下文与思考开关。总参数约35B,每 token 激活约3B,但内存主要按 35B 估算;适合显存较大或可把专家卸载到系统内存的用户。

多模态对话长上下文稀疏 MoEGGUF 量化
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
mit

MODEL POSITIONING

这个模型解决什么问题?

这是 AtomicChat 为 Ornith-1.5-35B-A3B 制作的 GGUF 量化仓库,不是原始模型的独立训练版本。模型卡将基础模型标为 image-text-to-text、conversational,并提到可在运行时切换思考;架构为 qwen35moe,总参数约35B,主文件约34.7B、每 token 激活约3B,另有独立约1.9B 的 MTP 草稿头,上下文为262144。仓库提供 IQ2_S 到 Q8_0 等多档 GGUF 并按张量位进行 AD 布局调校,重要性矩阵用于量化。Ollama、llama.cpp、LM Studio 被标记为可用运行工具。模型卡未说明完整训练数据、中文具体表现或独立复现的全任务跑分,不能据此承诺通用质量或速度。

更适合谁

  • 需要在本地进行图像—文本对话、且能接受较高显存或系统内存占用的用户
  • 需要 262144 长上下文或研究稀疏 MoE、混合注意力架构的开发者
  • 熟悉 GGUF、llama.cpp 参数及视觉 projector 部署的本地模型用户

典型使用场景

  • 本地图像问答、图表或截图辅助对话(需配合 projector)
  • 需要 262144 上下文的文本对话与思考开关实验
  • 探索稀疏 MoE、混合注意力及多档 GGUF 部署效果的本地研究

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

图像—文本输入

基础模型标注为 image-text-to-text,提供视觉 projector 使用路径并需设置图像最小 token

长上下文与混合注意力

上下文上限262144,采用全注意力与线性注意力混合架构

稀疏 MoE 计算

总参数约35B,每 token 激活约3B,256 个路由专家中激活 8 个并包含共享专家

思考开关

模型卡说明可在运行时切换思考模式

硬件怎么准备

  • 48GB 显存:Q8_0 文件约36.90GB;文件估算最低显存约35.5GB、建议约40.5GB,最低内存约41GB、建议约49GB
  • 32GB 显存:AD-Q6_K-Q5_K 文件约26.25GB,最低显存约26.5GB、建议约30.5GB,最低内存约31GB、建议约37GB;模型卡另列 AD-Q6_K 约29.10GB
  • 24GB 显存:AD-Q5_K-Q4_K 文件约22.14GB,最低显存约22.5GB、建议约26GB,最低内存约25.5GB、建议约31GB;AD-Q4_K-IQ4_XS 约20.13GB,最低显存约18GB、建议约20.5GB,最低内存约20.5GB、建议约24.5GB
  • 16–20GB 显存:AD-IQ4_XS-IQ3_S 约17.61GB,最低显存约18GB、建议约20.5GB,最低内存约20.5GB、建议约24.5GB;AD-IQ3_XXS-IQ2_S 约15.51GB,最低显存约13.5GB、建议约15.5GB,最低内存约15.5GB、建议约18.5GB;模型卡另列 AD-IQ3

量化版本怎么选

  • 追求最高质量且显存 ≥ 35.5GB:Q8_0,约36.90GB,KLD 约0.011620、Top-1 约95.64%
  • 32GB 显存:AD-Q6_K 约29.10GB(KLD 约0.012961、Top-1 约95.31%),或更省空间的 AD-Q6_K-Q5_K 约26.25GB(KLD 约0.015793、Top-1 约94.85%)
  • 24GB 显存:AD-Q5_K-Q4_K 约22.14GB(KLD 约0.025137、Top-1 约93.52%),或更省空间的 AD-Q4_K-IQ4_XS 约20.13GB(KLD 约0.031512、Top-1 约92.71%)
  • 16–20GB 显存:AD-IQ4_XS-IQ3_S 约17.61GB(KLD 约0.057726、Top-1 约90.12%),AD-IQ3_XXS-IQ2_S 约15.51GB(KLD 约0.087334、Top-1 约88.07%),最低档 AD-IQ3_XXS-IQ2_S 约13.67GB(KLD 约0.141

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ312 GB13.5 GB15.5 GB18.5 GB文件 ↗
IQ416 GB18 GB20.5 GB24.5 GB文件 ↗
Q416 GB18 GB20.5 GB24.5 GB文件 ↗
Q520 GB22.5 GB26 GB31 GB文件 ↗
Q624 GB26.5 GB30.5 GB37 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 13.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 15.5GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • Ollama:来源运行资料标记可用,模型卡未说明其对 MTP 或视觉 projector 的具体兼容边界
  • llama.cpp:来源标记可用,支持思考开关、CPU MoE 卸载(--cpu-moe、--n-cpu-moe N)、视觉 projector 与 --image-min-tokens 1024,采样需显式设置如 --temp 0.6 --top-p 0.95 --top-k 20
  • LM Studio:来源标记可用
  • MTP 草稿头需单独加载;llama.cpp 中 MTP 与 -np > 1、--mmproj 不兼容,需在视觉投影与多实例并行之间二选一

采用前要知道的限制

  • 资源占用高:总参数约35B,模型卡明确指出内存主要按总权重估算,不能把激活的约3B 当作显存需求
  • 低比特质量下降明显:IQ2_S 至 IQ3 档位的 KLD 与 Top-1 指标明显低于 Q8,稀疏 MoE 需要更多比特保真
  • 视觉功能依赖额外文件:需 projector 并设置图像最小 token,否则可能凭先验回答;MTP 草稿头与视觉 projector、多实例并行互斥
  • 质量与速度信息不足:模型卡未提供可独立复现的全任务质量结论,未给出具体上下文资源占用与运行速度,亦未说明中文具体表现