下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
能力来自模型卡与配置:混合 DeltaNet 线性注意力与 softmax 注意力(3:1),MoE 含 256 专家、每 token 路由 8+1,支持文本图像视频原生多模态,覆盖 201 种语言,强化 Hermes 智能体与函数调用,主打低拒答。量化仓库由作者基于 Genesis 算法自制,仅提供 GGUF 格式,包括 APEX-Compact、F16 多模态投影与 Q8_K_P 三档。运行工具覆盖 llama.cpp、LM Studio、Ollama 与 koboldcpp 等 GGUF 兼容前端。模型卡未说明 HermesBench 等基准得分。
更适合谁
- 拥有 24GB 以上显存或 32GB 内存的本地部署用户
- 需要超长上下文与多模态输入的进阶开发者
- 偏好低拒答、注重指令遵循的智能体场景使用者
- 尝试自定义 Hermes 函数调用流程的研究者
典型使用场景
- 本地长文档摘要、代码仓库分析与多轮对话
- 图像理解配合文本指令的多模态问答与创意写作
- Hermes 函数调用与 JSON 格式智能体任务
- 角色扮演与高自由度创作类提示
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
35B MoE 总参数下仅约 3B 激活,资源占用相对克制
模型卡说明该 MoE 配置可在不显著增加推理成本的情况下扩展容量
原生 262K 上下文,YaRN 可扩至 1M
模型卡与配置共同确认支持超长上下文,并需保持至少 128K 以保留思考能力
原生多模态支持文本图像视频
配置标注 image-text-to-text,需配合 mmproj 文件启用视觉
融合 Hermes 智能体与函数调用微调
基于 NousResearch hermes-function-calling-v1 数据集进行迁移微调
Genesis 张量修复降低训练噪声
模型卡描述自定义 SVD 处理,保留 99% 信号与梯度
硬件怎么准备
- 运行 APEX-Compact 量化约需 25GB 内存或 22GB 显存,建议 31GB 内存或 26GB 显存以获得稳定余量
- Q8_K_P 版本对硬件要求显著提高,最低约 41GB 内存或 35GB 显存,建议 49GB 或 40GB 以上
- 显存不足时可将 40 层 MoE 权重卸载至 CPU,活跃专家设为 8
- 多模态视觉还需额外加载 mmproj-F16 文件,占用与 APEX 版相当
量化版本怎么选
- 作者推荐 APEX-Compact 量化作为首选,体积最小且官方推荐
- 显存与内存充裕且追求精度时,可选择 Q8_K_P 量化
- 多模态视觉必须额外下载 mmproj-Hermes-F16 文件
- 模型卡未说明 Q4、Q5 等更小量化是否提供,需自行运行量化脚本
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 22.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26GB。
阅读 24GB 显存选型指南 →可以怎样运行
- 通过 llama.cpp 加载并使用 --jinja 标志以正确解析聊天模板
- LM Studio 可直接使用,作者提供推荐运行时讨论链接
- Ollama 支持导入 GGUF 作为模型
- KobaldCpp 等其他 GGUF 兼容前端也可使用
采用前要知道的限制
- 模型卡未提供官方基准得分与第三方评测对比
- 模型卡未明确说明各硬件配置下的实测推理速度
- GGUF 之外的格式(如 EXL2、AWQ)模型卡未说明可用情况
- 需要至少 128K 上下文才能保留完整思考能力,短上下文设置可能受限