← 返回模型库

LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V2-GGUF

Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V2-GGUF:去审查多模态长上下文量化版

基于Qwen3.6 35B总参数、约3B激活的MoE架构GGUF量化版本,主打去审查文本生成、多语言对话和原生图文视频多模态理解,融合DeltaNet线性注意力与全注意力,含256专家。

去审查多模态Qwen3.6量化长文本大模型多语言MoE
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库为第三方GGUF量化与张量修复仓库,非原始模型发布地。模型能力源自Qwen3.6-35B-A3B去审查微调,并融合Hermes代理与函数调用能力,支持文本、图像、视频原生多模态和262K原生上下文。仓库提供APEX-Compact、Q8_K_P及mmproj视觉投影共三份GGUF,附带Sig-ScaleSync-Genesis-SVD张量漂移修复。可在llama.cpp、LM Studio、Ollama、koboldcpp等GGUF兼容运行时加载。模型卡未提供上下文长度基准和推理速度测试。

更适合谁

  • 需要去审查文本与多模态生成的进阶本地用户
  • 拥有RTX 3060 12GB以上显存或大内存工作站的部署者
  • 多语言对话、长文档处理与多模态应用开发者
  • 偏好MoE高效推理并能接受较高硬件门槛的爱好者

典型使用场景

  • 长文档多语言阅读、摘要与翻译
  • 多模态图文视频问答与生成
  • 角色扮演与开放风格对话
  • 编程、精确推理及函数调用任务(需开启思维模式)

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

混合注意力架构

融合Gated DeltaNet线性注意力与全softmax注意力,长上下文更高效

原生多模态

支持文本、图像、视频统一理解,附带mmproj视觉投影文件

去审查与代理能力

基于0/465拒答微调,融合Hermes函数调用与代理特性

超大上下文窗口

262K原生支持,可通过YaRN扩展至1M tokens

多语言覆盖

248K词表支持201种语言,包含中英文及小语种

硬件怎么准备

  • APEX-Compact量化约22GB,需至少25GB内存或22GB以上显存,建议31GB内存或26GB显存
  • Q8_K_P量化约35GB,需至少41GB内存或35GB以上显存,建议49GB内存或40GB显存
  • RTX 3060 12GB可通过GPU分载约25层MoE权重到CPU运行,来源给出该配置推荐
  • 建议保留128K以上上下文窗口以维持思维模式能力

量化版本怎么选

  • 优先选择APEX-Compact量化,体积小且经SVD张量修复,适合主流高端消费级硬件
  • Q8_K_P精度更高但文件达35GB,仅适合专业级显存或大内存设备
  • 多模态视觉能力需额外下载并加载mmproj-F16.gguf视觉投影文件
  • 仓库未提供Q4/Q5等更小量化,可按来源提供的Unsloth脚本自行制作

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
GGUF20 GB22.5 GB26 GB31 GB文件 ↗
F1620 GB22.5 GB26 GB31 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 22.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp加载并使用--jinja标志以启用chat_template.jinja
  • LM Studio加载GGUF并将K Cache与V Cache设为Q8_0
  • Ollama作为兼容运行时直接调用
  • koboldcpp及其他GGUF兼容前端均可加载

采用前要知道的限制

  • Q8量化体积达35GB,对显存和内存要求较高
  • 模型卡未提供标准化基准、速度与质量评测数据
  • 温度、惩罚、上下文等参数需用户按用途自行调优
  • 去审查输出可能产生不当内容,需自行配置系统提示进行约束