← 返回模型库

LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V9-GGUF

Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V9-GGUF:长上下文多模态去审查混合专家

基于 Qwen3.6-35B-A3B 的 MoE 架构微调模型,总参数 35B、单次激活约 3B,原生支持文本、图像、视频多模态与 262K token 长上下文,可经 YaRN 扩展到 100 万 token。

长上下文多模态MoE 去审查Agent 工具调用GGUF 量化
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力:作为 HauhauCS 35B-A3B 去审查底座的二次微调,叠加约 2000 块 Hermes 函数调用专家权重并应用 Genesis 张量后训练校准算法,定位为原生支持文本、图像、视频的多模态模型。上下文原生 262K token,可经 YaRN 扩展至 1M;架构采用 256 专家 MoE(每 token 8 路由+1 共享)与 Gated DeltaNet 线性注意力和 Softmax 混合(3:1),保留工具调用与 JSON 结构化输出能力。量化仓库:仓库仅发布 GGUF 格式,提供 APEX-Compact(约 21.9GB)、视觉投影 F16(约 21.9GB,需与主模型同目录)以及 Q8_K_P(约 35GB)三份文件,Q8 精度更高但体积更大,APEX 更适合显存吃紧场景。

更适合谁

  • 拥有 24GB 以上显存的高端消费级或专业 GPU 用户
  • 需要 262K 长上下文、多模态输入或 Agent 工具调用的开发者
  • 偏好本地无审查推理用于创意写作与角色扮演的内容创作者
  • 愿意尝试 Genesis 算法与 Hermes 智能体框架的研究者

典型使用场景

  • 长文档摘要、复杂多轮推理与代码生成
  • Agent 工具调用、函数式 JSON 指令执行
  • 图像与视频内容的问答与理解
  • 无审查创意写作、角色扮演与多轮对话

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

MoE 高效推理

总参数 35B、单次激活约 3B,兼顾能力与显存

原生多模态输入

支持文本、图像、视频,视觉需配合 mmproj 文件

超长上下文

原生 262K token,可经 YaRN 扩展至 1M,建议保留 128K 以维持思维链

智能体能力

集成 Hermes 函数调用数据集,可输出结构化 JSON

Genesis 张量修复

通过自定义 SVD 等方法降低训练噪声

硬件怎么准备

  • APEX-Compact 与 mmproj F16:至少 25.5GB 内存或 22.5GB 显存,推荐 31GB 内存或 26GB 显存
  • Q8_K_P:至少 41GB 内存或 35.5GB 显存,推荐 49GB 内存或 40.5GB 显存
  • 启用视觉需同时加载主模型与 mmproj,总占用会叠加
  • 建议 GPU 卸载 15 层、40 层 MoE 权重放 CPU、保留 8 个活跃专家

量化版本怎么选

  • 显存吃紧优先选 APEX-Compact(约 21.9GB),官方推荐该量化
  • 注重精度且硬件充足可选 Q8_K_P(约 35GB)
  • 视觉功能必须搭配 mmproj-Hermes3.6-35B-A3B-Uncensored-Genesis-F16.gguf
  • KV 缓存建议设为 Q8_0,聊天模板启用 jinja

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
F1620 GB22.5 GB26 GB31 GB文件 ↗
GGUF20 GB22.5 GB26 GB31 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 22.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp 命令行,推荐加 --jinja 启用聊天模板
  • LM Studio 桌面端加载 APEX 量化版本
  • Ollama 拉取并运行
  • koboldcpp 等其他兼容 GGUF 的推理前端

采用前要知道的限制

  • Q8_K_P 量化文件达 35GB,对显存和内存门槛较高
  • 模型卡未给出 HermesBench 等基准的客观跑分,无法对比其他模型质量
  • 视觉支持依赖 mmproj 文件单独加载,部署步骤更复杂
  • Genesis 算法的稳定性收益来自作者自述,模型卡未提供独立第三方验证证据