LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF
Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF:中文多模态长上下文本地MoE模型
一款35B参数MoE架构的去审查大模型,每次推理仅激活约3B参数,支持文本、图像、视频原生多模态输入,覆盖201种语言,262K上下文可扩展至1M。经过Genesis-SVD张量修复与Hermes智能体微调,适合本地部署用于创意写作、SVG生成、代码辅助和多模态智能体任务。APEX版最低约需25GB内存或22GB显存。
MODEL POSITIONING
这个模型解决什么问题?
模型能力方面,基于Qwen3.6的35B MoE架构采用线性DeltaNet与标准注意力3:1混合设计,原生支持文本、图像、视频多模态输入和201种语言,262K上下文可经YaRN扩展至1M,并通过Genesis-SVD数值手术修复饱和权重与零块;去审查化处理与Hermes智能体微调让模型适合创意写作、角色扮演与函数调用。量化仓库方面,本仓库仅提供APEX紧凑版、Q8_K_P高精度版及配套mmproj-F16视觉投影文件。运行工具覆盖llama.cpp、LM Studio、Ollama与koboldcpp等GGUF兼容前端,可在llama.cpp中使用--jinja标志加载chat模板。模型卡未说明具体训练数据来源和基准测试成绩。
更适合谁
- 希望本地部署去审查大模型的内容创作者
- 拥有中高显存显卡或充足内存的开发者
- 需要长上下文与多模态能力的智能体应用构建者
典型使用场景
- 创意写作、角色扮演与无审查对话
- SVG动画绘制、图形生成与代码辅助
- 多模态图文理解与视觉问答
- 长文档摘要、智能体任务与函数调用
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
35B MoE架构
256专家每token激活8路由+1共享,总参数35B仅激活约3B
超长上下文
原生262K,可通过YaRN扩展至1M
原生多模态
同时支持文本、图像、视频输入与理解
张量修复技术
Genesis-SVD数值手术改善饱和权重和零块问题
多语言覆盖
支持201种语言与248K词表
硬件怎么准备
- APEX紧凑版约21.9GB文件,最低约25GB内存或22GB显存,建议31GB内存或26GB显存
- Q8_K_P版约35GB文件,最低约41GB内存或35GB显存,建议49GB内存或40GB显存
- 显存不足时可在llama.cpp中将40层MoE权重强制卸载到CPU
- RTX 3060 12GB等中端显卡可通过限制激活专家数为8来运行APEX版
量化版本怎么选
- 模型卡推荐优先使用APEX或Q8_K_P量化
- APEX紧凑版体积更小,适合显存有限的设备
- Q8_K_P高精度版适合硬件充足的本地部署
- 视觉能力需额外下载mmproj-F16配套文件
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 22.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp配合--jinja标志加载chat模板
- LM Studio图形界面直接加载GGUF文件
- Ollama一键拉取与运行
- koboldcpp等其它GGUF兼容前端
采用前要知道的限制
- 模型卡未提供官方基准测试成绩
- 去审查特性可能产生不当内容,使用风险由用户自行承担
- 模型卡未说明具体训练数据来源
- Q8_K_P高精度版对显存和内存要求较高
COMPARISON PATH
继续对比同类方案
不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。