← 返回模型库

zerodigest/Qwen3.8-27B-Uncensored-YMQ-MTP-GGUF

Qwen3.8-27B-Uncensored-YMQ-MTP-GGUF:27B混合架构无审查代码助手

基于 Qwen3.8-27B 去审查权重,zerodigest 用 YMQ-Compiler 输出 GGUF 混合精度量化版,主打本地代码智能体与 RooCode/Aider 类工具。提供约 9.

本地代码大模型27B混合架构GGUF量化智能体编程
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来自 JonathanColetti 发布的去审查 Qwen3.8-27B 权重,是 Mamba SSM 与 Attention 混合架构,原生支持多令牌预测(MTP)推测解码,针对 RooCode/Aider 类智能体循环做了重点适配。本仓库不是底座模型发布处,而是 zerodigest 单独维护的量化分发仓库,YMQ-Compiler 在对数空间做层重要性扫描后按层分配比特,因此其分档(XXS-Pro 到 XL)与标准 Q4/Q6/Q8 不能直接换算。模型卡未提供训练数据规模、原始上下文窗口上限等具体说明。运行工具层面,卡片显示支持 llama.cpp、ollama、LM Studio 与 llama-server,多模态视觉需额外加载 mmproj 文件,不在底座权重内。

更适合谁

  • 在 12GB–24GB 单卡显存上跑 27B 代码模型的本地开发者
  • 使用 RooCode/Aider 等智能体进行多轮代码重构的工程师
  • 希望本地部署去审查大模型用于研究或写作的实验者
  • 看重 Mamba + Attention 混合架构长上下文耐力的项目

典型使用场景

  • 本地代码生成与多文件协同编辑
  • 长上下文代码库检索与重构
  • 智能体循环内的 API 调用与脚本编写
  • 配合 mmproj 文件的视觉问答

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

27B 体量与 YMQ 混合精度结合

在 12–24GB 显存区间保留长上下文稳定性

Mamba SSM + Attention 混合架构

对智能体循环中的上下文跟踪有专门优化

原生多令牌预测 MTP 推测解码

适合搭配 RooCode/Aider 智能体加速

去审查 M 档 perplexity 6.8176

模型卡声称优于原底座 6.8413

10 档预设加视觉 mmproj 量化

覆盖约 9.3GB 到 19GB 的设备范围

硬件怎么准备

  • 12GB 显存 GPU:XS-TI 或 XS-Pro 档,文件约 10.2–11GB,留少量 KV 缓存空间
  • 16GB 显存 GPU:M-TI 或 S-Pro 档,文件约 12.5–13GB
  • 24GB 显存 GPU:M 或 L-TI 档,文件约 14–14.5GB,仍可承担一定上下文
  • XL 档约 19GB,需接近或超过 24GB 显存方可装下完整模型与上下文

量化版本怎么选

  • YMQ 按层重要性分配比特,与标准 Q4/Q6/Q8 不能直接对应,需结合 perplexity 选档
  • 想要速度与低显存选 XS-TI/XS-Pro;想要高保真选 L 或 XL
  • 模型卡自我推荐 M 档(文件约 14.5GB,perplexity 6.8176)
  • 启用视觉需额外下载 mmproj 下的 Q4_K_S(约 478MB)、Q6_K(约 587MB)或 Q8_0 投影

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q413 GB14 GB16 GB19 GB文件 ↗
GGUF16 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 14GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 16GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp 或 llama-server 命令行启动,可加 --mmproj 加载视觉塔
  • Ollama 直接拉取对应预设名称
  • LM Studio 导入 GGUF 文件
  • 多模态需把 Vision Tower 单独加载到 llama-server

采用前要知道的限制

  • 模型卡未说明训练数据规模与最大上下文窗口长度
  • 极低显存档(XXS、XXS-Pro)可能引发 context amnesia 与格式化回环
  • 去审查权重的安全边界由上游决定,模型卡未承诺对齐或审查行为
  • YMQ 混合精度为经验性层重要性分析,未提供与原厂的标准化对照