下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
mit
MODEL POSITIONING
这个模型解决什么问题?
这是 AtomicChat 为 Ornith-1.5-35B-A3B 制作的 GGUF 量化仓库,不是原始模型的独立训练版本。模型卡将基础模型标为 image-text-to-text、conversational,并提到可在运行时切换思考;架构为 qwen35moe,总参数约35B,主文件约34.7B、每 token 激活约3B,另有独立约1.9B 的 MTP 草稿头,上下文为262144。仓库提供 IQ2_S 到 Q8_0 等多档 GGUF 并按张量位进行 AD 布局调校,重要性矩阵用于量化。Ollama、llama.cpp、LM Studio 被标记为可用运行工具。模型卡未说明完整训练数据、中文具体表现或独立复现的全任务跑分,不能据此承诺通用质量或速度。
更适合谁
- 需要在本地进行图像—文本对话、且能接受较高显存或系统内存占用的用户
- 需要 262144 长上下文或研究稀疏 MoE、混合注意力架构的开发者
- 熟悉 GGUF、llama.cpp 参数及视觉 projector 部署的本地模型用户
典型使用场景
- 本地图像问答、图表或截图辅助对话(需配合 projector)
- 需要 262144 上下文的文本对话与思考开关实验
- 探索稀疏 MoE、混合注意力及多档 GGUF 部署效果的本地研究
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
图像—文本输入
基础模型标注为 image-text-to-text,提供视觉 projector 使用路径并需设置图像最小 token
长上下文与混合注意力
上下文上限262144,采用全注意力与线性注意力混合架构
稀疏 MoE 计算
总参数约35B,每 token 激活约3B,256 个路由专家中激活 8 个并包含共享专家
思考开关
模型卡说明可在运行时切换思考模式
硬件怎么准备
- 48GB 显存:Q8_0 文件约36.90GB;文件估算最低显存约35.5GB、建议约40.5GB,最低内存约41GB、建议约49GB
- 32GB 显存:AD-Q6_K-Q5_K 文件约26.25GB,最低显存约26.5GB、建议约30.5GB,最低内存约31GB、建议约37GB;模型卡另列 AD-Q6_K 约29.10GB
- 24GB 显存:AD-Q5_K-Q4_K 文件约22.14GB,最低显存约22.5GB、建议约26GB,最低内存约25.5GB、建议约31GB;AD-Q4_K-IQ4_XS 约20.13GB,最低显存约18GB、建议约20.5GB,最低内存约20.5GB、建议约24.5GB
- 16–20GB 显存:AD-IQ4_XS-IQ3_S 约17.61GB,最低显存约18GB、建议约20.5GB,最低内存约20.5GB、建议约24.5GB;AD-IQ3_XXS-IQ2_S 约15.51GB,最低显存约13.5GB、建议约15.5GB,最低内存约15.5GB、建议约18.5GB;模型卡另列 AD-IQ3
量化版本怎么选
- 追求最高质量且显存 ≥ 35.5GB:Q8_0,约36.90GB,KLD 约0.011620、Top-1 约95.64%
- 32GB 显存:AD-Q6_K 约29.10GB(KLD 约0.012961、Top-1 约95.31%),或更省空间的 AD-Q6_K-Q5_K 约26.25GB(KLD 约0.015793、Top-1 约94.85%)
- 24GB 显存:AD-Q5_K-Q4_K 约22.14GB(KLD 约0.025137、Top-1 约93.52%),或更省空间的 AD-Q4_K-IQ4_XS 约20.13GB(KLD 约0.031512、Top-1 约92.71%)
- 16–20GB 显存:AD-IQ4_XS-IQ3_S 约17.61GB(KLD 约0.057726、Top-1 约90.12%),AD-IQ3_XXS-IQ2_S 约15.51GB(KLD 约0.087334、Top-1 约88.07%),最低档 AD-IQ3_XXS-IQ2_S 约13.67GB(KLD 约0.141
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 13.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 15.5GB。
阅读 24GB 显存选型指南 →可以怎样运行
- Ollama:来源运行资料标记可用,模型卡未说明其对 MTP 或视觉 projector 的具体兼容边界
- llama.cpp:来源标记可用,支持思考开关、CPU MoE 卸载(--cpu-moe、--n-cpu-moe N)、视觉 projector 与 --image-min-tokens 1024,采样需显式设置如 --temp 0.6 --top-p 0.95 --top-k 20
- LM Studio:来源标记可用
- MTP 草稿头需单独加载;llama.cpp 中 MTP 与 -np > 1、--mmproj 不兼容,需在视觉投影与多实例并行之间二选一
采用前要知道的限制
- 资源占用高:总参数约35B,模型卡明确指出内存主要按总权重估算,不能把激活的约3B 当作显存需求
- 低比特质量下降明显:IQ2_S 至 IQ3 档位的 KLD 与 Top-1 指标明显低于 Q8,稀疏 MoE 需要更多比特保真
- 视觉功能依赖额外文件:需 projector 并设置图像最小 token,否则可能凭先验回答;MTP 草稿头与视觉 projector、多实例并行互斥
- 质量与速度信息不足:模型卡未提供可独立复现的全任务质量结论,未给出具体上下文资源占用与运行速度,亦未说明中文具体表现