MODEL POSITIONING
这个模型解决什么问题?
模型本体来自BottleCapAI对Qwen3.6-27B的简短推理微调,保留精度的同时将思考token压缩约40-46%,定位为需要高效链式思考的中高端推理底座。GGUF仓库由protoLabsAI重新打包,核心贡献有两点:一是每档量化都内嵌MTP推测解码草稿头,免去额外配对;二是新增Blackwell专属NVFP4文件以发挥RTX 50系与RTX PRO 6000的FP4张量核。同一上游权重提供IQ2到Q8_0加bf16无损版的完整梯度。运行时需支持nextn块的较新llama.cpp(带--spec-type draft-mtp)或Ollama 0.31+,LM Studio亦可加载。模型卡未给出上下文长度与具体任务标签。
更适合谁
- 拥有RTX 50系列或RTX PRO 6000等Blackwell显卡的本地推理用户
- 追求减少思考token、降低推理时延的链式思考场景使用者
- 需要在16至24GB消费级显卡部署27B级思考模型的用户
- 已熟悉llama.cpp或Ollama并希望开箱获得推测解码加速的进阶玩家
典型使用场景
- 数学、逻辑、代码等需要链式思考的本地推理任务
- 长链路推理中希望降低延迟与token消耗的场景
- 27B级别思考模型的本地部署与对比基准
- Blackwell架构显卡的量化与加速实验
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
精简思考
相比Qwen3.6-27B基座平均减少约46%思考token,量化后仍保持该特性
内嵌MTP加速
每个量化文件自带MTP草稿头,draft acceptance约62-91%,免去二次配对
NVFP4原生支持
专为Blackwell FP4张量核优化,RTX 50系与PRO 6000上效率最佳
完整量化梯度
从IQ2到Q8_0再到bf16无损主版本,覆盖约10GB到54GB的显存区间
低档位完整性
Q3_K_M与IQ3_M通过quant_sensitivity与function_call校验,与NVFP4参照持平
硬件怎么准备
- 16GB显存显卡可尝试IQ3_M-MTP(约12.8GB),最低约10.5GB显存、推荐14.5GB
- 24GB单卡或双12GB Blackwell可选NVFP4-Q4_K_M-MTP(约15.7GB),最低14GB、推荐16GB显存
- RTX 50系或RTX PRO 6000建议选NVFP4-MTP旗舰版(约18.2GB),最低17GB、推荐19.5GB显存
- 高保真需求选Q8_0-MTP(约29GB)或bf16-MTP(约54.7GB),分别需约27.5GB与17GB以上显存
量化版本怎么选
- 想获得免费推测解码:任一带MTP后缀的档位均可直接启用
- 显存充裕且追求无损:bf16-MTP(约54.7GB)或Q8_0-MTP(约29GB)
- 24GB Blackwell双卡有限预算:NVFP4-Q4_K_M-MTP(约15.7GB)是该档唯一显著缩小的选项
- 16GB以下显卡:IQ3_M-MTP或Q3_K_M-MTP(均约12.8-13.5GB),已通过imatrix完整性校验
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 10.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 12GB。
阅读 12GB 显存选型指南 →可以怎样运行
- llama.cpp近期版本加--spec-type draft-mtp开启MTP推测解码
- Ollama 0.31及以上版本可直接加载MTP内嵌量化
- LM Studio可加载,但MTP支持情况需自行验证
- vLLM部署NVFP4需使用--linear-backend marlin并设置--max-num-seqs 256与--gpu-memory-utilization 0.85
采用前要知道的限制
- 必须使用模型推荐采样(temp 0.6、top_p 0.95、top_k 20),贪心解码易导致无限循环不输出答案
- 模型卡未给出明确的上下文长度与训练数据细节
- 较旧版本llama.cpp或Ollama(早于0.31)会因缺失nextn块加载失败
- NVFP4路径在vLLM的FlashInfer FP4 kernel下存在CUDA-graph捕获挂起问题
COMPARISON PATH
继续对比同类方案
不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。