← 返回模型库

LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF

Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF:35B多模态无审查混合架构本地模型

围绕 35B 总参数、约 3B 激活的 MoE 架构,主打本地无审查角色扮演、SVG 创作与 Hermes 函数调用式 agent 任务,原生支持文本、图像、视频多模态。建议至少保留 22.5 GB 显存或 25.

无审查角色扮演多模态大模型MoE 本地部署Agent 工具调用
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库发布的是经 Genesis 信号修复流程处理后的 GGUF 量化包,底层为 HauhauCS 公开的 Qwen3.6-35B-A3B 去审查基座,并叠加 DJLougen 的 Hermes 微调权重;模型卡未提供独立基准分数。能力描述来自官方说明与 tags(uncensored、vision、multimodal、agentic、moe)。量化由作者脚本完成,提供 APEX Compact、Q8_K_P 及 mmproj F16 等文件。运行侧兼容 llama.cpp、LM Studio、Ollama、koboldcpp 等 GGUF 运行时,模型卡建议在 RTX 3060 12GB 上做特定 CPU/GPU 卸载并开启 jinja 模板。

更适合谁

  • 想在本地运行无审查对话与角色扮演的中文或多语言用户
  • 需要视觉/视频多模态输入并尝试 Hermes 函数调用 agent 流程的开发者
  • 拥有 22GB 以上显存或 25GB 以上内存、想尝试混合架构 MoE 的爱好者

典型使用场景

  • 本地无审查创意对话、角色扮演与剧情续写
  • SVG 静态与动画生成(模型卡演示了鹈鹕骑车、Pingu 等案例)
  • 基于 Hermes function calling 的 agent / 工具调用场景
  • 多模态图文问答,需配合 mmproj 文件

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

35B 总参数 / 约 3B 激活 MoE

兼顾大模型容量与单次推理成本(来源:Specs)

混合 Gated DeltaNet + 注意力架构

长上下文更高效,262K 原生可扩展到 1M(来源:Specs)

原生多模态

支持文本、图像、视频,配合 mmproj 即可启用视觉(来源:pipeline_tag、Specs)

无审查 + Hermes 函数调用

适合本地创意角色扮演与 agent 工具调用(来源:tags、说明)

248K 词表 / 201 种语言

多语言覆盖广(来源:Specs)

硬件怎么准备

  • APEX Compact 量化约 21.9 GB,最低 22.5 GB 显存或 25.5 GB 内存,推荐 26 GB 显存或 31 GB 内存
  • Q8_K_P 量化约 35 GB,最低 35.5 GB 显存或 41 GB 内存,推荐 40.5 GB 显存或 49 GB 内存
  • 视觉功能必须额外加载 mmproj-F16 文件,会进一步占用内存与磁盘
  • 模型卡建议保留至少 128K 上下文以维持思考能力,长上下文会显著增加显存占用

量化版本怎么选

  • 模型卡推荐 APEX Compact 作为默认量化,体积小且针对 RTX 3060 12GB 调优
  • Q8_K_P 提供更高精度但需约 41 GB 内存或 35.5 GB 显存起步
  • F16 仅作为 mmproj 多模态投影文件存在,不建议作为主权重加载
  • 仓库提供带 Unsloth 配置的量化脚本,用户可自行压制其他量化

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
F1620 GB22.5 GB26 GB31 GB文件 ↗
GGUF20 GB22.5 GB26 GB31 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 22.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp(建议加 --jinja 标志处理 chat template)
  • LM Studio(作者提供了推荐运行时的讨论链接)
  • koboldcpp 等其他 GGUF 兼容运行时

采用前要知道的限制

  • 模型卡未提供标准 benchmark 分数,无法直接量化水平
  • 默认推理为去审查设置,可能输出不当内容,需自行评估合规风险
  • Q8 量化几乎需要 40 GB 以上显存,普通消费级显卡难以全量加载
  • 模型卡未说明具体推理速度与生成质量