下载量
0
参数
27B
上下文
未说明
架构 / 任务
qwen3_5
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
该仓库是 Qwen3.8-27B 的微调 GGUF 量化仓库,作者为 DavidAU。模型能力层面:继承原生 256k 上下文与可扩展至 1M tokens 的窗口,支持视觉理解(需单独下载 mmproj 文件),官方定位覆盖代码、Agent、长链路任务、科研、创意写作等多场景;本微调重点在于压缩思考 token、加快推理速度、提升低量化稳定性。量化仓库层面:同时发布常规 GGUF 与 MTP GGUF 两套,IQ 到 Q8 各档位齐全,另含 BF16、F16、F32 三种 mmproj 投影文件。运行工具层面:兼容 Ollama、llama.cpp、LM Studio 等主流本地推理框架。模型卡未提供权威第三方基准数据与速度承诺。
更适合谁
- 拥有 24GB 以上显存并追求高保真推理的本地玩家
- 需要长上下文、低思考开销的代码与 Agent 任务开发者
- 玩创意写作、故事续写与角色扮演的内容创作者
- 想对比常规量化与 MTP 量化速度差异的研究型用户
典型使用场景
- 长文档摘要与多轮深度对话
- 软件工程代码生成与 Agent 自动化任务
- 创意写作、故事续写与角色扮演
- 复杂多步推理与科研类问答
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
冷融合训练保真
GAIN 加 Unsloth 训练方法号称让 4bit 与 8bit 保留约 99% BF16 性能
思考 token 压缩
在三种推理模式下将思考块压缩至常规版的 1/2 至 1/10
MTP 多 token 预测
提供 MTP 张量优化版本,参数合适时吞吐高于常规量化
原生长上下文
继承 256k 原生窗口并支持扩展至 1M tokens
视觉多模态
支持图像与视频理解,需配合 mmproj 文件启用
硬件怎么准备
- 8GB 显存或 9.5GB 内存可尝试 IQ2_M 量化(模型卡未给出实测速度)
- 12GB 显存或 14.5GB 内存可选 IQ3_M 量化
- 16GB 显存或 19GB 内存推荐 IQ4_NL 或 Q4_K_M 量化
- 20GB 以上显存与 24GB 内存建议选择 Q5_K_M 或更高量化以提升稳定性
量化版本怎么选
- 低显存入门优先 IQ2_M 或 IQ3_M 以保证可加载
- 平衡性能与体积推荐 IQ4_NL 或 Q4_K_M
- 高显存用户可选择 Q5_K_M 或 Q6_K 获得更稳输出
- 建议同时下载一份常规 GGUF 与一份 MTP GGUF 进行本地测试对比
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| IQ2 | 6.3 GB | 7 GB | 8 GB | 9.5 GB | 文件 ↗ |
| IQ3 | 9.4 GB | 10.5 GB | 12 GB | 14.5 GB | 文件 ↗ |
| IQ4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| Q4 | 13 GB | 14 GB | 16 GB | 19 GB | 文件 ↗ |
| Q5 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| BF16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| F16 | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| GGUF | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
| Q6 | 19 GB | 20.5 GB | 23.5 GB | 28.5 GB | 文件 ↗ |
| Q8 | 25 GB | 27.5 GB | 31.5 GB | 38 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- LM Studio 桌面端直接加载 GGUF 与 mmproj 文件
- Ollama 通过 Modelfile 或导入方式运行
- llama.cpp 命令行或兼容前端推理
- KoboldCpp、text-generation-webui、SillyTavern 等前端启用 smoothing 因子
采用前要知道的限制
- 模型卡未提供权威第三方基准数据,仅引用作者自述
- 27B 参数与 Q5 以上量化对显存要求较高,普通消费显卡难以舒适运行
- MTP 量化在温度高于 1 或 token 接受率低于 50% 时性能会下降
- 视觉能力需要额外下载并正确放置 mmproj 文件