下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
能力层面,模型卡显示其保留Qwen3.8-27B的多模态、对话、代码生成、工具调用与函数调用能力,并强调Agent场景下的推理效率优化。量化仓库为GGUF格式,涵盖Q2_K到Q8_0以及BF16全精度档位,并附带mmproj-F32视觉投影文件用于多模态推理。运行工具支持Ollama、llama.cpp和LM Studio,llama.cpp侧可启用MTP推测解码。模型卡未明确说明上下文长度参数。模型卡未提供权威第三方基准,所有表格结果为作者本地测试。
更适合谁
- 本地部署Agent工作流并关注解码速度的开发者
- 需要反复工具调用、文件读写与代码改写的用户
- 关心生成token成本与端到端耗时的资源敏感型部署
- 持有RTX 5090或同级显存显卡的本地推理用户
典型使用场景
- 本地MTP推测解码以提升解码吞吐与草案接受率
- 多轮工具调用、文件编辑与持久化的Agent任务
- 长上下文代码生成与网页生成工作流
- 资源受限硬件上的推理效率优化实验
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
MTP推测解码
模型卡报告加权MTP草案接受率约80.7%,相对Qwen3.8基线提升14.6个百分点
Agent长链路优化
微调目标面向多轮Agent任务,减少异常长尾推理并缩短端到端耗时
工具调用与代码生成
标签包含agentic、tool-use、function-calling、code-generation
多模态输入
pipeline_tag为image-text-to-text,附带mmproj-F32视觉投影文件
多语言支持
模型卡声明支持英语、中文、西班牙语、俄语、日语
硬件怎么准备
- Q2_K档位建议至少约8GB内存或7GB显存,推荐9.5GB内存或8GB显存
- Q3_K_L档位建议至少约12GB内存或10.5GB显存,推荐14.5GB内存或12GB显存
- Q4_K_M与IQ4_XS档位建议至少约16GB内存或14GB显存,推荐19GB内存或16GB显存
- Q5_K_M与BF16档位建议至少约20GB内存或17GB显存,推荐24GB内存或19.5GB显存
量化版本怎么选
- 显存紧张或内存有限的设备优先选择Q2_K或Q3_K_L小量化
- 主流消费级显卡建议使用Q4_K_M平衡容量与质量
- 本地Agent部署兼顾速度与质量可考虑Q5_K_M
- 多模态推理需在加载主模型之外额外挂载mmproj-F32视觉投影文件
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 7GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 8GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp启用--spec-type draft-mtp进行MTP推测解码
- Ollama与LM Studio加载对应GGUF变体即可使用
- 模型卡报告的Agent基准采用Q5_K_M + MTP + q8_0 KV cache配置
采用前要知道的限制
- MMLU-Pro混合题准确率91.28%,相对基线92.73%下降1.45个百分点,存在精度换效率的权衡
- 部分Python编码任务可能出现缩进错误,模型卡声明修复中
- 边缘场景仍可能存在推理漂移、循环或低效轨迹
- 作为实验性发布未经过广泛安全评估与通用Agent可靠性测试