← 返回模型库

LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V8-GGUF

Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V8-GGUF:多模态混合注意力去审查大模型

35B 参数 MoE 模型,每次前向约激活 3B 参数;支持文本、图像、视频多模态输入,原生 262K 上下文,YaRN 可扩至 1M。融合 Hermes 智能体与函数调用微调,并经 Genesis 张量修复,主打低拒答。

多模态大模型Hermes智能体长上下文去审查
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

能力来自模型卡与配置:混合 DeltaNet 线性注意力与 softmax 注意力(3:1),MoE 含 256 专家、每 token 路由 8+1,支持文本图像视频原生多模态,覆盖 201 种语言,强化 Hermes 智能体与函数调用,主打低拒答。量化仓库由作者基于 Genesis 算法自制,仅提供 GGUF 格式,包括 APEX-Compact、F16 多模态投影与 Q8_K_P 三档。运行工具覆盖 llama.cpp、LM Studio、Ollama 与 koboldcpp 等 GGUF 兼容前端。模型卡未说明 HermesBench 等基准得分。

更适合谁

  • 拥有 24GB 以上显存或 32GB 内存的本地部署用户
  • 需要超长上下文与多模态输入的进阶开发者
  • 偏好低拒答、注重指令遵循的智能体场景使用者
  • 尝试自定义 Hermes 函数调用流程的研究者

典型使用场景

  • 本地长文档摘要、代码仓库分析与多轮对话
  • 图像理解配合文本指令的多模态问答与创意写作
  • Hermes 函数调用与 JSON 格式智能体任务
  • 角色扮演与高自由度创作类提示

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

35B MoE 总参数下仅约 3B 激活,资源占用相对克制

模型卡说明该 MoE 配置可在不显著增加推理成本的情况下扩展容量

原生 262K 上下文,YaRN 可扩至 1M

模型卡与配置共同确认支持超长上下文,并需保持至少 128K 以保留思考能力

原生多模态支持文本图像视频

配置标注 image-text-to-text,需配合 mmproj 文件启用视觉

融合 Hermes 智能体与函数调用微调

基于 NousResearch hermes-function-calling-v1 数据集进行迁移微调

Genesis 张量修复降低训练噪声

模型卡描述自定义 SVD 处理,保留 99% 信号与梯度

硬件怎么准备

  • 运行 APEX-Compact 量化约需 25GB 内存或 22GB 显存,建议 31GB 内存或 26GB 显存以获得稳定余量
  • Q8_K_P 版本对硬件要求显著提高,最低约 41GB 内存或 35GB 显存,建议 49GB 或 40GB 以上
  • 显存不足时可将 40 层 MoE 权重卸载至 CPU,活跃专家设为 8
  • 多模态视觉还需额外加载 mmproj-F16 文件,占用与 APEX 版相当

量化版本怎么选

  • 作者推荐 APEX-Compact 量化作为首选,体积最小且官方推荐
  • 显存与内存充裕且追求精度时,可选择 Q8_K_P 量化
  • 多模态视觉必须额外下载 mmproj-Hermes-F16 文件
  • 模型卡未说明 Q4、Q5 等更小量化是否提供,需自行运行量化脚本

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
GGUF20 GB22.5 GB26 GB31 GB文件 ↗
F1620 GB22.5 GB26 GB31 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 22.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • 通过 llama.cpp 加载并使用 --jinja 标志以正确解析聊天模板
  • LM Studio 可直接使用,作者提供推荐运行时讨论链接
  • Ollama 支持导入 GGUF 作为模型
  • KobaldCpp 等其他 GGUF 兼容前端也可使用

采用前要知道的限制

  • 模型卡未提供官方基准得分与第三方评测对比
  • 模型卡未明确说明各硬件配置下的实测推理速度
  • GGUF 之外的格式(如 EXL2、AWQ)模型卡未说明可用情况
  • 需要至少 128K 上下文才能保留完整思考能力,短上下文设置可能受限