← 返回模型库

nerkyor/Qwen3.8-27B-EfficientThink-Uncensored-K3-Opus5-Grok4.6-GPT5.6Sol-SFT-SimPO-DFlash2-GGUF

Qwen3.8-27B-EfficientThink-Uncensored-K3-Opus5-Grok4.6-GPT5.6Sol-SFT-SimPO-DFlash2-GGUF:高效思考与多模态推理量化版

主要用途是基于 Qwen3.8-27B 基座的高效思考模式与去审查微调版本,提供 GGUF 多档量化以适配不同显存。适合需要长上下文、推理增强与多模态输入的研究者,或中英文双语应用开发者。硬件门槛跨度大,从 8GB 显存运行 Q2 量化到 31.5GB 以上显存运行 Q8_0 全精度。

高效思考多模态GGUF27B推理投机解码
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力源自 Qwen3.8-27B 基座,叠加能力保留 SFT、终端行为 SimPO 对齐训练,加入 EfficientThink 高效思考并提供去审查分支。模型卡未明确披露原生训练数据规模。能力评估覆盖 GPQA、MMLU、LCB 三套基准,6 档量化分数差距不大。仓库发布 GGUF v3 文本主文件(64 层、851 张量)与独立的视觉投影、DFlash2 草稿、MTP 多 token 预测侧车。运行端支持 llama.cpp、Ollama、LM Studio 三类运行时,DFlash2 路径需要 2026-08-27 之后含对应支持的 llama.cpp 构建。模型卡未明确标注原生上下文窗口,实测布局为 8 槽 × 32768 tokens、共 262144 tokens。

更适合谁

  • 拥有 8GB 以上显存或 16GB 以上内存的中高端硬件用户
  • 需要本地部署多模态对话与高效思考模式的研究者
  • 熟悉 llama.cpp 服务端命令行配置并希望使用 DFlash2 投机解码的进阶用户
  • 对去审查版本有需求的中英文双语应用开发者

典型使用场景

  • 本地长上下文推理与代码生成任务部署
  • 视觉问答与图文理解应用集成
  • DFlash2 投机解码配置与并发吞吐量测试
  • 多语言对话助手与无审查内容生成实验

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

高效思考模式

模型卡显示主打 EfficientThink,兼顾思考深度与生成效率

去审查对齐

经过 K3/Opus5/Grok4.6/GPT5.6 系列去审查微调,减少回避类输出

双语多模态

同时支持中英文,配有 mmproj 视觉投影器,可处理图文混合输入

投机解码加速

内置 DFlash2 与 MTP 双路径草稿,可降低顺序解码开销

多档量化选择

从 Q2-LynnStyle 到 Q8_0 共 6 档,平衡显存占用与能力保留

硬件怎么准备

  • Q2-LynnStyle 约 13GB 文件,来源建议至少 7GB 显存或 8GB 内存
  • Q3-LynnStyle 约 17GB 文件,来源建议至少 10.5GB 显存或 12GB 内存
  • Q4-LynnStyle 约 19.4GB 文件,来源建议至少 14GB 显存或 16GB 内存
  • Q8_0 约 28.6GB 文件,来源建议至少 27.5GB 显存或 31.5GB 内存

量化版本怎么选

  • 显存紧张优先选 Q2-LynnStyle(GSQ-RCO 混合精度),但来源建议内存允许时升级到 Q3 或更高
  • 显存充裕且要求接近 BF16 主干质量,选 Q8_0 并搭配 Q8_0 或 Q4_K_M DFlash2 草稿
  • 平衡选择 Q4-LynnStyle 或 Q5-LynnStyle,配备敏感层保护与全注意力审计
  • MTP 草稿与 DFlash2 草稿二选一启动,不要混用

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q26.3 GB7 GB8 GB9.5 GB文件 ↗
Q39.4 GB10.5 GB12 GB14.5 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp 服务端部署,需含 DFlash2 支持的官方构建或对应 commit
  • Ollama 直接加载 GGUF 文件运行
  • LM Studio 桌面端加载 GGUF 文件
  • 启用 DFlash2 时配 --spec-type draft-dflash 与 --spec-draft-n-max 7;纯文本服务省略 mmproj 行

采用前要知道的限制

  • 模型卡未明确说明原生上下文窗口,仅给出 8 槽 × 32K 共 262144 的实测布局
  • Q2-LynnStyle 该精确构建无冻结 TPS 结果,不能复用旧工程数据
  • DFlash2 与 MTP 不能同时启用,必须二选一
  • 去审查分支可能生成敏感内容,使用者需自行把关