下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本仓库为第三方GGUF量化与张量修复仓库,非原始模型发布地。模型能力源自Qwen3.6-35B-A3B去审查微调,并融合Hermes代理与函数调用能力,支持文本、图像、视频原生多模态和262K原生上下文。仓库提供APEX-Compact、Q8_K_P及mmproj视觉投影共三份GGUF,附带Sig-ScaleSync-Genesis-SVD张量漂移修复。可在llama.cpp、LM Studio、Ollama、koboldcpp等GGUF兼容运行时加载。模型卡未提供上下文长度基准和推理速度测试。
更适合谁
- 需要去审查文本与多模态生成的进阶本地用户
- 拥有RTX 3060 12GB以上显存或大内存工作站的部署者
- 多语言对话、长文档处理与多模态应用开发者
- 偏好MoE高效推理并能接受较高硬件门槛的爱好者
典型使用场景
- 长文档多语言阅读、摘要与翻译
- 多模态图文视频问答与生成
- 角色扮演与开放风格对话
- 编程、精确推理及函数调用任务(需开启思维模式)
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
混合注意力架构
融合Gated DeltaNet线性注意力与全softmax注意力,长上下文更高效
原生多模态
支持文本、图像、视频统一理解,附带mmproj视觉投影文件
去审查与代理能力
基于0/465拒答微调,融合Hermes函数调用与代理特性
超大上下文窗口
262K原生支持,可通过YaRN扩展至1M tokens
多语言覆盖
248K词表支持201种语言,包含中英文及小语种
硬件怎么准备
- APEX-Compact量化约22GB,需至少25GB内存或22GB以上显存,建议31GB内存或26GB显存
- Q8_K_P量化约35GB,需至少41GB内存或35GB以上显存,建议49GB内存或40GB显存
- RTX 3060 12GB可通过GPU分载约25层MoE权重到CPU运行,来源给出该配置推荐
- 建议保留128K以上上下文窗口以维持思维模式能力
量化版本怎么选
- 优先选择APEX-Compact量化,体积小且经SVD张量修复,适合主流高端消费级硬件
- Q8_K_P精度更高但文件达35GB,仅适合专业级显存或大内存设备
- 多模态视觉能力需额外下载并加载mmproj-F16.gguf视觉投影文件
- 仓库未提供Q4/Q5等更小量化,可按来源提供的Unsloth脚本自行制作
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 22.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 26GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp加载并使用--jinja标志以启用chat_template.jinja
- LM Studio加载GGUF并将K Cache与V Cache设为Q8_0
- Ollama作为兼容运行时直接调用
- koboldcpp及其他GGUF兼容前端均可加载
采用前要知道的限制
- Q8量化体积达35GB,对显存和内存要求较高
- 模型卡未提供标准化基准、速度与质量评测数据
- 温度、惩罚、上下文等参数需用户按用途自行调优
- 去审查输出可能产生不当内容,需自行配置系统提示进行约束