下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力:作为 HauhauCS 35B-A3B 去审查底座的二次微调,叠加约 2000 块 Hermes 函数调用专家权重并应用 Genesis 张量后训练校准算法,定位为原生支持文本、图像、视频的多模态模型。上下文原生 262K token,可经 YaRN 扩展至 1M;架构采用 256 专家 MoE(每 token 8 路由+1 共享)与 Gated DeltaNet 线性注意力和 Softmax 混合(3:1),保留工具调用与 JSON 结构化输出能力。量化仓库:仓库仅发布 GGUF 格式,提供 APEX-Compact(约 21.9GB)、视觉投影 F16(约 21.9GB,需与主模型同目录)以及 Q8_K_P(约 35GB)三份文件,Q8 精度更高但体积更大,APEX 更适合显存吃紧场景。
更适合谁
- 拥有 24GB 以上显存的高端消费级或专业 GPU 用户
- 需要 262K 长上下文、多模态输入或 Agent 工具调用的开发者
- 偏好本地无审查推理用于创意写作与角色扮演的内容创作者
- 愿意尝试 Genesis 算法与 Hermes 智能体框架的研究者
典型使用场景
- 长文档摘要、复杂多轮推理与代码生成
- Agent 工具调用、函数式 JSON 指令执行
- 图像与视频内容的问答与理解
- 无审查创意写作、角色扮演与多轮对话
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
MoE 高效推理
总参数 35B、单次激活约 3B,兼顾能力与显存
原生多模态输入
支持文本、图像、视频,视觉需配合 mmproj 文件
超长上下文
原生 262K token,可经 YaRN 扩展至 1M,建议保留 128K 以维持思维链
智能体能力
集成 Hermes 函数调用数据集,可输出结构化 JSON
Genesis 张量修复
通过自定义 SVD 等方法降低训练噪声
硬件怎么准备
- APEX-Compact 与 mmproj F16:至少 25.5GB 内存或 22.5GB 显存,推荐 31GB 内存或 26GB 显存
- Q8_K_P:至少 41GB 内存或 35.5GB 显存,推荐 49GB 内存或 40.5GB 显存
- 启用视觉需同时加载主模型与 mmproj,总占用会叠加
- 建议 GPU 卸载 15 层、40 层 MoE 权重放 CPU、保留 8 个活跃专家
量化版本怎么选
- 显存吃紧优先选 APEX-Compact(约 21.9GB),官方推荐该量化
- 注重精度且硬件充足可选 Q8_K_P(约 35GB)
- 视觉功能必须搭配 mmproj-Hermes3.6-35B-A3B-Uncensored-Genesis-F16.gguf
- KV 缓存建议设为 Q8_0,聊天模板启用 jinja
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 22.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp 命令行,推荐加 --jinja 启用聊天模板
- LM Studio 桌面端加载 APEX 量化版本
- Ollama 拉取并运行
- koboldcpp 等其他兼容 GGUF 的推理前端
采用前要知道的限制
- Q8_K_P 量化文件达 35GB,对显存和内存门槛较高
- 模型卡未给出 HermesBench 等基准的客观跑分,无法对比其他模型质量
- 视觉支持依赖 mmproj 文件单独加载,部署步骤更复杂
- Genesis 算法的稳定性收益来自作者自述,模型卡未提供独立第三方验证证据