nerkyor/Qwen3.8-27B-EfficientThink-Uncensored-K3-Opus5-Grok4.6-GPT5.6Sol-SFT-SimPO-DFlash2-GGUF
Qwen3.8-27B-EfficientThink-Uncensored-K3-Opus5-Grok4.6-GPT5.6Sol-SFT-SimPO-DFlash2-GGUF:高效思考与多模态推理量化版
主要用途是基于 Qwen3.8-27B 基座的高效思考模式与去审查微调版本,提供 GGUF 多档量化以适配不同显存。适合需要长上下文、推理增强与多模态输入的研究者,或中英文双语应用开发者。硬件门槛跨度大,从 8GB 显存运行 Q2 量化到 31.5GB 以上显存运行 Q8_0 全精度。
MODEL POSITIONING
这个模型解决什么问题?
模型能力源自 Qwen3.8-27B 基座,叠加能力保留 SFT、终端行为 SimPO 对齐训练,加入 EfficientThink 高效思考并提供去审查分支。模型卡未明确披露原生训练数据规模。能力评估覆盖 GPQA、MMLU、LCB 三套基准,6 档量化分数差距不大。仓库发布 GGUF v3 文本主文件(64 层、851 张量)与独立的视觉投影、DFlash2 草稿、MTP 多 token 预测侧车。运行端支持 llama.cpp、Ollama、LM Studio 三类运行时,DFlash2 路径需要 2026-08-27 之后含对应支持的 llama.cpp 构建。模型卡未明确标注原生上下文窗口,实测布局为 8 槽 × 32768 tokens、共 262144 tokens。
更适合谁
- 拥有 8GB 以上显存或 16GB 以上内存的中高端硬件用户
- 需要本地部署多模态对话与高效思考模式的研究者
- 熟悉 llama.cpp 服务端命令行配置并希望使用 DFlash2 投机解码的进阶用户
- 对去审查版本有需求的中英文双语应用开发者
典型使用场景
- 本地长上下文推理与代码生成任务部署
- 视觉问答与图文理解应用集成
- DFlash2 投机解码配置与并发吞吐量测试
- 多语言对话助手与无审查内容生成实验
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
高效思考模式
模型卡显示主打 EfficientThink,兼顾思考深度与生成效率
去审查对齐
经过 K3/Opus5/Grok4.6/GPT5.6 系列去审查微调,减少回避类输出
双语多模态
同时支持中英文,配有 mmproj 视觉投影器,可处理图文混合输入
投机解码加速
内置 DFlash2 与 MTP 双路径草稿,可降低顺序解码开销
多档量化选择
从 Q2-LynnStyle 到 Q8_0 共 6 档,平衡显存占用与能力保留
硬件怎么准备
- Q2-LynnStyle 约 13GB 文件,来源建议至少 7GB 显存或 8GB 内存
- Q3-LynnStyle 约 17GB 文件,来源建议至少 10.5GB 显存或 12GB 内存
- Q4-LynnStyle 约 19.4GB 文件,来源建议至少 14GB 显存或 16GB 内存
- Q8_0 约 28.6GB 文件,来源建议至少 27.5GB 显存或 31.5GB 内存
量化版本怎么选
- 显存紧张优先选 Q2-LynnStyle(GSQ-RCO 混合精度),但来源建议内存允许时升级到 Q3 或更高
- 显存充裕且要求接近 BF16 主干质量,选 Q8_0 并搭配 Q8_0 或 Q4_K_M DFlash2 草稿
- 平衡选择 Q4-LynnStyle 或 Q5-LynnStyle,配备敏感层保护与全注意力审计
- MTP 草稿与 DFlash2 草稿二选一启动,不要混用
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp 服务端部署,需含 DFlash2 支持的官方构建或对应 commit
- Ollama 直接加载 GGUF 文件运行
- LM Studio 桌面端加载 GGUF 文件
- 启用 DFlash2 时配 --spec-type draft-dflash 与 --spec-draft-n-max 7;纯文本服务省略 mmproj 行
采用前要知道的限制
- 模型卡未明确说明原生上下文窗口,仅给出 8 槽 × 32K 共 262144 的实测布局
- Q2-LynnStyle 该精确构建无冻结 TPS 结果,不能复用旧工程数据
- DFlash2 与 MTP 不能同时启用,必须二选一
- 去审查分支可能生成敏感内容,使用者需自行把关