下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本仓库是 Qwen3.8-27B 基础模型的第三方 GGUF 量化发行版,由 dealign.ai 制作。模型能力包括原生视觉与视频理解、262K 上下文、可控推理强度(low/medium/xhigh)以及内置 MTP 推测解码头;定位为去审查研究产物,仅供授权红队测试与安全研究使用。仓库提供 IQ2 到 Q8 的多种 GGUF 量化与一个 mmproj 视觉投影文件,运行依赖 llama.cpp 生态,Ollama 与 LM Studio 也可直接加载。模型卡未说明该模型在常规对话、代码或写作任务上的官方能力定位。
更适合谁
- 授权红队测试与 AI 安全研究人员
- 越狱与对齐研究方向的学术工作者
- 配备 24GB 及以上显存显卡的本地部署者
- 需要多模态与超长上下文的研究使用者
典型使用场景
- 对抗性提示的合规度评估
- 安全护栏绕过机制研究
- 视觉与视频多模态越狱测试
- 长上下文与 MTP 推测解码性能验证
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
多模态原生能力
同时支持图像与视频理解,配套 mmproj 投影文件
超长上下文
原生 262K token 上下文窗口
混合线性注意力架构
48 层 GatedDeltaNet 加 16 层全注意力,hidden 5120
可控推理强度
支持 low、medium、xhigh 三档推理努力
MTP 推测解码
内置 blk.64 多 token 预测头,可启用 draft-mtp 加速
硬件怎么准备
- IQ2_M:最少 8GB RAM 或 7GB VRAM,建议 9.5GB RAM 或 8GB VRAM
- IQ3_M:最少 12GB RAM 或 10.5GB VRAM,建议 14.5GB RAM 或 12GB VRAM
- Q4_K_M 与 IQ4_XS:最少 16GB RAM 或 14GB VRAM,建议 19GB RAM 或 16GB VRAM
- Q6_K 需 24GB 以上显存,Q8_0 需 32GB 级显卡
量化版本怎么选
- Q4_K_M 与 IQ4_XS 被模型卡标为推荐档,在知识保留与体积间较平衡
- IQ2_M 是体积最小的 2-bit 档,但相对知识损失较大
- Q8_0 为近无损参考,Q6_K 适合需要较高质量且显存充足的场景
- 必须额外下载 mmproj F16 视觉投影文件才能启用图像与视频理解
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp 直接加载(推荐 temperature 1.0、top_p 0.95、top_k 20)
- LM Studio 直接加载 GGUF 文件
- Ollama 加载(依据模型卡适配)
- 启用 MTP 推测解码需在 llama.cpp 使用 --spec-type draft-mtp 参数
采用前要知道的限制
- 模型卡明确声明安全护栏已降低,会执行原版模型拒绝的指令
- 仅限授权研究与红队测试,使用者需自行承担合规与法律风险
- 视觉理解需额外加载 mmproj 文件,否则仅作纯文本模型运行
- 模型卡未提供常规对话、代码、写作等场景的官方能力说明