← 返回模型库

Jackrong/Qwopus3.8-27B-Flash-GGUF

Qwopus3.8-27B-Flash-GGUF:MTP加速的Agent微调模型

基于Qwen3.8-27B微调的27B参数多模态模型,专为本地Agent工作流优化。通过MTP推测解码降低推理时延与生成成本,减少异常长尾推理。适合需要本地部署、多轮工具调用、长期Agent循环和代码生成的用户。模型卡明确说明存在Python代码缩进已知问题,修复中。

Agent工作流MTP推测解码工具调用本地推理
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

能力层面,模型卡显示其保留Qwen3.8-27B的多模态、对话、代码生成、工具调用与函数调用能力,并强调Agent场景下的推理效率优化。量化仓库为GGUF格式,涵盖Q2_K到Q8_0以及BF16全精度档位,并附带mmproj-F32视觉投影文件用于多模态推理。运行工具支持Ollama、llama.cpp和LM Studio,llama.cpp侧可启用MTP推测解码。模型卡未明确说明上下文长度参数。模型卡未提供权威第三方基准,所有表格结果为作者本地测试。

更适合谁

  • 本地部署Agent工作流并关注解码速度的开发者
  • 需要反复工具调用、文件读写与代码改写的用户
  • 关心生成token成本与端到端耗时的资源敏感型部署
  • 持有RTX 5090或同级显存显卡的本地推理用户

典型使用场景

  • 本地MTP推测解码以提升解码吞吐与草案接受率
  • 多轮工具调用、文件编辑与持久化的Agent任务
  • 长上下文代码生成与网页生成工作流
  • 资源受限硬件上的推理效率优化实验

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

MTP推测解码

模型卡报告加权MTP草案接受率约80.7%,相对Qwen3.8基线提升14.6个百分点

Agent长链路优化

微调目标面向多轮Agent任务,减少异常长尾推理并缩短端到端耗时

工具调用与代码生成

标签包含agentic、tool-use、function-calling、code-generation

多模态输入

pipeline_tag为image-text-to-text,附带mmproj-F32视觉投影文件

多语言支持

模型卡声明支持英语、中文、西班牙语、俄语、日语

硬件怎么准备

  • Q2_K档位建议至少约8GB内存或7GB显存,推荐9.5GB内存或8GB显存
  • Q3_K_L档位建议至少约12GB内存或10.5GB显存,推荐14.5GB内存或12GB显存
  • Q4_K_M与IQ4_XS档位建议至少约16GB内存或14GB显存,推荐19GB内存或16GB显存
  • Q5_K_M与BF16档位建议至少约20GB内存或17GB显存,推荐24GB内存或19.5GB显存

量化版本怎么选

  • 显存紧张或内存有限的设备优先选择Q2_K或Q3_K_L小量化
  • 主流消费级显卡建议使用Q4_K_M平衡容量与质量
  • 本地Agent部署兼顾速度与质量可考虑Q5_K_M
  • 多模态推理需在加载主模型之外额外挂载mmproj-F32视觉投影文件

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q26.3 GB7 GB8 GB9.5 GB文件 ↗
Q39.4 GB10.5 GB12 GB14.5 GB文件 ↗
IQ413 GB14 GB16 GB19 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
GGUF16 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp启用--spec-type draft-mtp进行MTP推测解码
  • Ollama与LM Studio加载对应GGUF变体即可使用
  • 模型卡报告的Agent基准采用Q5_K_M + MTP + q8_0 KV cache配置

采用前要知道的限制

  • MMLU-Pro混合题准确率91.28%,相对基线92.73%下降1.45个百分点,存在精度换效率的权衡
  • 部分Python编码任务可能出现缩进错误,模型卡声明修复中
  • 边缘场景仍可能存在推理漂移、循环或低效轨迹
  • 作为实验性发布未经过广泛安全评估与通用Agent可靠性测试