← 返回模型库

unsloth/Qwen3.8-27B-GGUF

Qwen3.8-27B-GGUF:27B多模态推理与代理任务密集模型

Qwen3.8-27B-GGUF 是 27B 参数的原生视觉语言密集模型,支持图像与视频理解,擅长编码、专业写作、研究与长链路代理任务;原生上下文 262144 tokens,可经 RoPE 扩展至 1000000 tokens。思考模式默认开启且可按请求关闭,并支持工具调用与多 token 预测。

多模态长上下文代理任务视觉理解
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
qwen3_5
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型本身为 Qwen3.8-27B,由 Qwen 基于 Qwen3.5 架构构建的 27B 密集参数视觉语言模型,原生支持图像、视频与超长文本理解,并内置 MTP 多 token 预测与可调节的思考开关;编码、代理规划、工具调用等能力说明均来自模型卡描述。量化仓库由 unsloth 维护为 GGUF 格式,自称同体积下精度优于其他供应方。运行层面同时支持 Ollama、llama.cpp 与 LM Studio 等本地推理框架,量化档位从 IQ1 到 Q6_K 及 BF16 全精度全覆盖。模型卡未说明的内容:训练数据规模与具体任务跑分。

更适合谁

  • 需要本地部署 27B 规模的多模态项目开发者
  • 希望在单卡或双卡消费级显卡上跑视觉语言模型的用户
  • 从事长文档摘要、代码生成或代理式任务的研究者
  • 想精细调节思考深度与上下文长度的进阶玩家

典型使用场景

  • 代码编写与程序调试辅助
  • 长篇研究报告、文档的阅读与摘要
  • 图表、截图与视频内容的多模态问答
  • 多轮代理式自动化任务执行

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

原生视觉语言

原生支持图像与视频理解,覆盖 STEM 图表、文档到小时级视频

超长上下文

原生 262144 tokens,可通过 YaRN 等 RoPE 扩展到 1000000 tokens

灵活思考控制

默认开启思考模式,可按请求关闭并以 reasoning_effort 调节深度

代理与工具调用

强化自主规划与环境反馈适配,支持 Codex 等代理框架

MTP 多 token 预测

模型卡注明经过多步训练,可改善生成效率

硬件怎么准备

  • 8GB 内存仅够 IQ2_S 或 Q2_K_XL 等低量化版本入门
  • 12GB 内存可尝试 IQ3_S 或 Q3_K_XL 量化档位
  • 16GB 显存可承载 Q4_K_M 或 IQ4_XS 量化版
  • 20GB 以上显存建议 Q5_K_M、Q6_K 或 BF16 全精度

量化版本怎么选

  • 显存紧张时选 IQ2_S 或 Q2_K_XL 起步,但需评估质量损失
  • 追求平衡可选 Q4_K_M 或 IQ4_XS,所需显存约 16GB
  • 硬件充足且重视质量推荐 Q6_K 或 BF16 全精度
  • 仅作功能验证可用 IQ1_M 极限压缩版本

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ13.1 GB3.5 GB4.5 GB8 GB文件 ↗
Q26.3 GB7 GB8 GB9.5 GB文件 ↗
IQ26.3 GB7 GB8 GB9.5 GB文件 ↗
IQ39.4 GB10.5 GB12 GB14.5 GB文件 ↗
Q39.4 GB10.5 GB12 GB14.5 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
IQ413 GB14 GB16 GB19 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
GGUF16 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 3.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4.5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp 直接加载 GGUF 文件
  • Ollama 拉取并运行对应模型
  • LM Studio 导入 GGUF 推理
  • Unsloth Desktop 提供图形界面与微调支持

采用前要知道的限制

  • 模型卡未给出训练数据构成与具体基准分数
  • 27B 体量在普通笔记本上仍难流畅运行高量化档位
  • 视频与超长上下文场景需自行调节 longest_edge 等参数
  • IQ1、IQ2 等极低量化版本质量损失较大,需实测取舍