下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力源自底模 HauhauCS/Qwen3.6-35B-A3B-Uncensored 的去审查微调与 DJLougen Hermes 函数调用融合,并经作者自研 Genesis 张量修复算法降噪;原生支持文本、图像、视频多模态输入,262K 原生上下文可由 YaRN 扩展至 1M。量化仓库仅此一份,提供 APEX 紧凑版(约 21.875GB)、F16 多模态投影文件及 Q8_K_P 高精度版(约 35GB)。运行工具方面,模型卡明确支持 llama.cpp、LM Studio、koboldcpp 等 GGUF 兼容前端,仓库标签亦显示可由 Ollama 与 LM Studio 启动。
更适合谁
- 希望在本地运行无审查角色扮演与长对话的高级用户
- 需要长上下文(262K 原生或 1M YaRN)进行多文档分析或代理任务的开发者
- 需要图像、视频理解或 SVG 视觉生成测试的研究者
- 拥有 RTX 4090 级 24GB 显存或 32GB 以上内存高配机器的持有者
典型使用场景
- 本地无审查角色扮演与创意写作
- 长文档摘要、多轮对话与代理工具调用
- 图像理解与多模态问答
- SVG/2D 动画等视觉生成测试
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
多模态原生输入
模型卡标注 pipeline_tag 为 image-text-to-text,原生处理文本、图像与视频
超长上下文窗口
262K 原生上下文,YaRN 可扩展至 1M
MoE 高效架构
35B 总参数仅激活约 3B,256 专家每 token 路由 8+1 共享
函数调用与代理
融合 NousResearch/hermes-function-calling-v1 数据集的代理能力
信号修复后处理
作者 Genesis 算法通过 SVD 与分块扫描降低张量噪声
硬件怎么准备
- APEX 紧凑版(约 21.875GB):至少 25.5GB 内存与 22.5GB 显存,推荐 31GB 内存与 26GB 显存
- Q8_K_P 精度版(约 35GB):至少 41GB 内存与 35.5GB 显存,推荐 49GB 内存与 40.5GB 显存
- 显存不足时可将 40 层 MoE 权重强制卸载到 CPU 并降低激活专家数
- 启用多模态需额外加载 mmproj F16 投影文件,会进一步占用显存
量化版本怎么选
- 模型卡推荐 APEX 紧凑版为首选量化,体积约 21.875GB
- 追求质量且硬件充足可选择 Q8_K_P 精度版(约 35GB)
- 多模态功能必须保留 mmproj-F16 投影文件,否则视觉能力无法启用
- 仓库未提供更低精度量化,用户可按模型卡附带的脚本自行量化
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 22.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp(建议使用 --jinja 加载正确 chat template)
- LM Studio(仓库标签确认支持)
- Ollama(仓库标签确认支持)
- koboldcpp(模型卡明确列出)
采用前要知道的限制
- 模型卡未提供公开基准数据,无法确认具体质量水平
- 模型卡注明同等规模下编码任务更推荐 27B Genesis 版本
- 去审查输出可能涉及争议内容,使用者需自行承担合规风险
- 仅以 GGUF 形式分发,未提供原始权重或其他格式