下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本仓库发布的是经 Genesis 信号修复流程处理后的 GGUF 量化包,底层为 HauhauCS 公开的 Qwen3.6-35B-A3B 去审查基座,并叠加 DJLougen 的 Hermes 微调权重;模型卡未提供独立基准分数。能力描述来自官方说明与 tags(uncensored、vision、multimodal、agentic、moe)。量化由作者脚本完成,提供 APEX Compact、Q8_K_P 及 mmproj F16 等文件。运行侧兼容 llama.cpp、LM Studio、Ollama、koboldcpp 等 GGUF 运行时,模型卡建议在 RTX 3060 12GB 上做特定 CPU/GPU 卸载并开启 jinja 模板。
更适合谁
- 想在本地运行无审查对话与角色扮演的中文或多语言用户
- 需要视觉/视频多模态输入并尝试 Hermes 函数调用 agent 流程的开发者
- 拥有 22GB 以上显存或 25GB 以上内存、想尝试混合架构 MoE 的爱好者
典型使用场景
- 本地无审查创意对话、角色扮演与剧情续写
- SVG 静态与动画生成(模型卡演示了鹈鹕骑车、Pingu 等案例)
- 基于 Hermes function calling 的 agent / 工具调用场景
- 多模态图文问答,需配合 mmproj 文件
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
35B 总参数 / 约 3B 激活 MoE
兼顾大模型容量与单次推理成本(来源:Specs)
混合 Gated DeltaNet + 注意力架构
长上下文更高效,262K 原生可扩展到 1M(来源:Specs)
原生多模态
支持文本、图像、视频,配合 mmproj 即可启用视觉(来源:pipeline_tag、Specs)
无审查 + Hermes 函数调用
适合本地创意角色扮演与 agent 工具调用(来源:tags、说明)
248K 词表 / 201 种语言
多语言覆盖广(来源:Specs)
硬件怎么准备
- APEX Compact 量化约 21.9 GB,最低 22.5 GB 显存或 25.5 GB 内存,推荐 26 GB 显存或 31 GB 内存
- Q8_K_P 量化约 35 GB,最低 35.5 GB 显存或 41 GB 内存,推荐 40.5 GB 显存或 49 GB 内存
- 视觉功能必须额外加载 mmproj-F16 文件,会进一步占用内存与磁盘
- 模型卡建议保留至少 128K 上下文以维持思考能力,长上下文会显著增加显存占用
量化版本怎么选
- 模型卡推荐 APEX Compact 作为默认量化,体积小且针对 RTX 3060 12GB 调优
- Q8_K_P 提供更高精度但需约 41 GB 内存或 35.5 GB 显存起步
- F16 仅作为 mmproj 多模态投影文件存在,不建议作为主权重加载
- 仓库提供带 Unsloth 配置的量化脚本,用户可自行压制其他量化
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 22.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp(建议加 --jinja 标志处理 chat template)
- LM Studio(作者提供了推荐运行时的讨论链接)
- koboldcpp 等其他 GGUF 兼容运行时
采用前要知道的限制
- 模型卡未提供标准 benchmark 分数,无法直接量化水平
- 默认推理为去审查设置,可能输出不当内容,需自行评估合规风险
- Q8 量化几乎需要 40 GB 以上显存,普通消费级显卡难以全量加载
- 模型卡未说明具体推理速度与生成质量