LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V7-GGUF
Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V7-GGUF:原生多模态去审查大模型
基于Qwen3.6的35B参数MoE模型(每次激活约3B),原生支持文本、图像、视频多模态与262K长上下文。经Genesis信号修复与Hermes代理数据微调,主打低拒绝率、Agent任务与创作。APEX量化约21.9GB,需25.5GB内存或22.5GB显存;Q8量化约35GB,需41GB内存或35.5GB显存。
MODEL POSITIONING
这个模型解决什么问题?
本模型是LuffyTheFox基于HauhauCS的Qwen3.6-35B-A3B去审查基座,通过Genesis算法对权重张量做SVD降噪与零块修复,并融合DJLougen的Hermes代理微调,约2k块FFN专家数据迁移而来。能力上强调低拒绝率、长上下文稳定、原生多模态与Agent调用。该仓库只发布GGUF量化产物,包含作者自研APEX压缩、F16视觉投影与Q8_K_P高精度版,模型卡未给出原版BF16/FP32。运行依赖llama.cpp家族,需使用--jinja聊天模板,并按推荐参数启用K/V Cache Q8_0与MoE分层卸载。
更适合谁
- 需要长上下文(262K原生)的多模态本地推理用户
- 本地Agent与函数调用工作流开发者
- 希望降低模型拒绝率的创作类用户
- 拥有中高配台式机或工作站的研究者
典型使用场景
- 长文档摘要、代码库理解与多轮对话
- 图像描述、视觉问答与视频帧分析(需mmproj)
- 角色扮演、创意写作与SVG等代码生成
- 本地Agent任务编排与结构化JSON输出
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
混合注意力架构
Gated DeltaNet线性注意力与softmax注意力3:1混合的长上下文建模
原生多模态
同时支持文本、图像、视频输入,248K词表覆盖201种语言
MoE高效推理
35B总参数下每次仅激活约3B,256专家8路由1共享
去审查与低拒绝率
基座以0/465拒绝率为标榜,配合Genesis降噪修复
Agent代理能力
基于Hermes function-calling-v1数据集微调的函数调用与JSON输出
硬件怎么准备
- APEX-Compact量化约21.9GB,最低需25.5GB内存或22.5GB显存,建议31GB内存或26GB显存
- Q8_K_P量化约35GB,最低需41GB内存或35.5GB显存,建议49GB内存或40.5GB显存
- 视觉能力需额外加载mmproj F16文件(约21.9GB),独立显存与主模型分开计算
- 推荐40层MoE权重卸载到CPU、GPU offload 15、激活专家数8以提升稳定性
量化版本怎么选
- 推荐首选APEX-Compact压缩版本以平衡体积与质量
- 追求更高质量可选Q8_K_P,但需准备近50GB内存或40GB以上显存
- 视觉投影文件mmproj需单独下载,模型卡未提供其他常规量化
- 启用K/V Cache Q8_0量化与--jinja聊天模板以获得最佳兼容
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 22.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp(官方推荐,支持--jinja)
- Ollama(已标记支持)
- LM Studio(已标记支持)
- koboldcpp(兼容性列表中提及)
采用前要知道的限制
- 仅提供GGUF格式,模型卡未发布BF16/FP32原版权重
- 多模态依赖mmproj文件,加载后显存与内存占用显著上升
- 高质量Q8量化体积达35GB,普通消费级显卡难以全显存加载
- 去审查与低拒绝率特性可能产生敏感内容,需自行评估合规与使用风险