← 返回模型库

LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V7-GGUF

Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V7-GGUF:原生多模态去审查大模型

基于Qwen3.6的35B参数MoE模型(每次激活约3B),原生支持文本、图像、视频多模态与262K长上下文。经Genesis信号修复与Hermes代理数据微调,主打低拒绝率、Agent任务与创作。APEX量化约21.9GB,需25.5GB内存或22.5GB显存;Q8量化约35GB,需41GB内存或35.5GB显存。

长上下文多模态MoE去审查代理函数调用本地GGUF部署
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本模型是LuffyTheFox基于HauhauCS的Qwen3.6-35B-A3B去审查基座,通过Genesis算法对权重张量做SVD降噪与零块修复,并融合DJLougen的Hermes代理微调,约2k块FFN专家数据迁移而来。能力上强调低拒绝率、长上下文稳定、原生多模态与Agent调用。该仓库只发布GGUF量化产物,包含作者自研APEX压缩、F16视觉投影与Q8_K_P高精度版,模型卡未给出原版BF16/FP32。运行依赖llama.cpp家族,需使用--jinja聊天模板,并按推荐参数启用K/V Cache Q8_0与MoE分层卸载。

更适合谁

  • 需要长上下文(262K原生)的多模态本地推理用户
  • 本地Agent与函数调用工作流开发者
  • 希望降低模型拒绝率的创作类用户
  • 拥有中高配台式机或工作站的研究者

典型使用场景

  • 长文档摘要、代码库理解与多轮对话
  • 图像描述、视觉问答与视频帧分析(需mmproj)
  • 角色扮演、创意写作与SVG等代码生成
  • 本地Agent任务编排与结构化JSON输出

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

混合注意力架构

Gated DeltaNet线性注意力与softmax注意力3:1混合的长上下文建模

原生多模态

同时支持文本、图像、视频输入,248K词表覆盖201种语言

MoE高效推理

35B总参数下每次仅激活约3B,256专家8路由1共享

去审查与低拒绝率

基座以0/465拒绝率为标榜,配合Genesis降噪修复

Agent代理能力

基于Hermes function-calling-v1数据集微调的函数调用与JSON输出

硬件怎么准备

  • APEX-Compact量化约21.9GB,最低需25.5GB内存或22.5GB显存,建议31GB内存或26GB显存
  • Q8_K_P量化约35GB,最低需41GB内存或35.5GB显存,建议49GB内存或40.5GB显存
  • 视觉能力需额外加载mmproj F16文件(约21.9GB),独立显存与主模型分开计算
  • 推荐40层MoE权重卸载到CPU、GPU offload 15、激活专家数8以提升稳定性

量化版本怎么选

  • 推荐首选APEX-Compact压缩版本以平衡体积与质量
  • 追求更高质量可选Q8_K_P,但需准备近50GB内存或40GB以上显存
  • 视觉投影文件mmproj需单独下载,模型卡未提供其他常规量化
  • 启用K/V Cache Q8_0量化与--jinja聊天模板以获得最佳兼容

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
GGUF20 GB22.5 GB26 GB31 GB文件 ↗
F1620 GB22.5 GB26 GB31 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 22.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp(官方推荐,支持--jinja)
  • Ollama(已标记支持)
  • LM Studio(已标记支持)
  • koboldcpp(兼容性列表中提及)

采用前要知道的限制

  • 仅提供GGUF格式,模型卡未发布BF16/FP32原版权重
  • 多模态依赖mmproj文件,加载后显存与内存占用显著上升
  • 高质量Q8量化体积达35GB,普通消费级显卡难以全显存加载
  • 去审查与低拒绝率特性可能产生敏感内容,需自行评估合规与使用风险