← 返回模型库

LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF

Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF:中文多模态长上下文本地MoE模型

一款35B参数MoE架构的去审查大模型,每次推理仅激活约3B参数,支持文本、图像、视频原生多模态输入,覆盖201种语言,262K上下文可扩展至1M。经过Genesis-SVD张量修复与Hermes智能体微调,适合本地部署用于创意写作、SVG生成、代码辅助和多模态智能体任务。APEX版最低约需25GB内存或22GB显存。

多模态大模型长上下文MoE去审查本地部署GGUF量化
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力方面,基于Qwen3.6的35B MoE架构采用线性DeltaNet与标准注意力3:1混合设计,原生支持文本、图像、视频多模态输入和201种语言,262K上下文可经YaRN扩展至1M,并通过Genesis-SVD数值手术修复饱和权重与零块;去审查化处理与Hermes智能体微调让模型适合创意写作、角色扮演与函数调用。量化仓库方面,本仓库仅提供APEX紧凑版、Q8_K_P高精度版及配套mmproj-F16视觉投影文件。运行工具覆盖llama.cpp、LM Studio、Ollama与koboldcpp等GGUF兼容前端,可在llama.cpp中使用--jinja标志加载chat模板。模型卡未说明具体训练数据来源和基准测试成绩。

更适合谁

  • 希望本地部署去审查大模型的内容创作者
  • 拥有中高显存显卡或充足内存的开发者
  • 需要长上下文与多模态能力的智能体应用构建者

典型使用场景

  • 创意写作、角色扮演与无审查对话
  • SVG动画绘制、图形生成与代码辅助
  • 多模态图文理解与视觉问答
  • 长文档摘要、智能体任务与函数调用

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

35B MoE架构

256专家每token激活8路由+1共享,总参数35B仅激活约3B

超长上下文

原生262K,可通过YaRN扩展至1M

原生多模态

同时支持文本、图像、视频输入与理解

张量修复技术

Genesis-SVD数值手术改善饱和权重和零块问题

多语言覆盖

支持201种语言与248K词表

硬件怎么准备

  • APEX紧凑版约21.9GB文件,最低约25GB内存或22GB显存,建议31GB内存或26GB显存
  • Q8_K_P版约35GB文件,最低约41GB内存或35GB显存,建议49GB内存或40GB显存
  • 显存不足时可在llama.cpp中将40层MoE权重强制卸载到CPU
  • RTX 3060 12GB等中端显卡可通过限制激活专家数为8来运行APEX版

量化版本怎么选

  • 模型卡推荐优先使用APEX或Q8_K_P量化
  • APEX紧凑版体积更小,适合显存有限的设备
  • Q8_K_P高精度版适合硬件充足的本地部署
  • 视觉能力需额外下载mmproj-F16配套文件

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
GGUF20 GB22.5 GB26 GB31 GB文件 ↗
F1620 GB22.5 GB26 GB31 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 22.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp配合--jinja标志加载chat模板
  • LM Studio图形界面直接加载GGUF文件
  • Ollama一键拉取与运行
  • koboldcpp等其它GGUF兼容前端

采用前要知道的限制

  • 模型卡未提供官方基准测试成绩
  • 去审查特性可能产生不当内容,使用风险由用户自行承担
  • 模型卡未说明具体训练数据来源
  • Q8_K_P高精度版对显存和内存要求较高

COMPARISON PATH

继续对比同类方案

不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。