下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力来自 JonathanColetti 发布的去审查 Qwen3.8-27B 权重,是 Mamba SSM 与 Attention 混合架构,原生支持多令牌预测(MTP)推测解码,针对 RooCode/Aider 类智能体循环做了重点适配。本仓库不是底座模型发布处,而是 zerodigest 单独维护的量化分发仓库,YMQ-Compiler 在对数空间做层重要性扫描后按层分配比特,因此其分档(XXS-Pro 到 XL)与标准 Q4/Q6/Q8 不能直接换算。模型卡未提供训练数据规模、原始上下文窗口上限等具体说明。运行工具层面,卡片显示支持 llama.cpp、ollama、LM Studio 与 llama-server,多模态视觉需额外加载 mmproj 文件,不在底座权重内。
更适合谁
- 在 12GB–24GB 单卡显存上跑 27B 代码模型的本地开发者
- 使用 RooCode/Aider 等智能体进行多轮代码重构的工程师
- 希望本地部署去审查大模型用于研究或写作的实验者
- 看重 Mamba + Attention 混合架构长上下文耐力的项目
典型使用场景
- 本地代码生成与多文件协同编辑
- 长上下文代码库检索与重构
- 智能体循环内的 API 调用与脚本编写
- 配合 mmproj 文件的视觉问答
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
27B 体量与 YMQ 混合精度结合
在 12–24GB 显存区间保留长上下文稳定性
Mamba SSM + Attention 混合架构
对智能体循环中的上下文跟踪有专门优化
原生多令牌预测 MTP 推测解码
适合搭配 RooCode/Aider 智能体加速
去审查 M 档 perplexity 6.8176
模型卡声称优于原底座 6.8413
10 档预设加视觉 mmproj 量化
覆盖约 9.3GB 到 19GB 的设备范围
硬件怎么准备
- 12GB 显存 GPU:XS-TI 或 XS-Pro 档,文件约 10.2–11GB,留少量 KV 缓存空间
- 16GB 显存 GPU:M-TI 或 S-Pro 档,文件约 12.5–13GB
- 24GB 显存 GPU:M 或 L-TI 档,文件约 14–14.5GB,仍可承担一定上下文
- XL 档约 19GB,需接近或超过 24GB 显存方可装下完整模型与上下文
量化版本怎么选
- YMQ 按层重要性分配比特,与标准 Q4/Q6/Q8 不能直接对应,需结合 perplexity 选档
- 想要速度与低显存选 XS-TI/XS-Pro;想要高保真选 L 或 XL
- 模型卡自我推荐 M 档(文件约 14.5GB,perplexity 6.8176)
- 启用视觉需额外下载 mmproj 下的 Q4_K_S(约 478MB)、Q6_K(约 587MB)或 Q8_0 投影
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 14GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 16GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp 或 llama-server 命令行启动,可加 --mmproj 加载视觉塔
- Ollama 直接拉取对应预设名称
- LM Studio 导入 GGUF 文件
- 多模态需把 Vision Tower 单独加载到 llama-server
采用前要知道的限制
- 模型卡未说明训练数据规模与最大上下文窗口长度
- 极低显存档(XXS、XXS-Pro)可能引发 context amnesia 与格式化回环
- 去审查权重的安全边界由上游决定,模型卡未承诺对齐或审查行为
- YMQ 混合精度为经验性层重要性分析,未提供与原厂的标准化对照