← 返回模型库

KyleHessling1/Qwopus3.6-27B-Fusion-GGUF

Qwopus3.6-27B-Fusion-GGUF:融合推理与代码的27B一站式代理

Qwopus3.6-27B-Fusion-GGUF 为 27B 融合模型,把推理稳定性与代码生成能力合二为一,面向希望一位代理完成规划、写码、自修闭环的本地用户。Q4_K_M 量化约 16GB 显存起跑,推荐 24GB 以上显卡,支持图像输入。适合玩单文件应用、研究任务向量融合的本地开发者与代理式编程实验者。

编程代理GGUF本地推理融合视觉多模态
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
other

MODEL POSITIONING

这个模型解决什么问题?

模型本体是把 Qwen/Qwen3.6-27B 的两个微调版本(偏推理的 v2 与偏代码的 Coder)按自定义层加权 task-vector 流程合并而来的 27B 模型,架构为 qwen35 混合注意力(线性+周期全注意力)。模型卡明确说主要在 Q4_K_M 上验证,其他量化未单独评测。仓库仅提供 GGUF 权重并附带独立 mmproj 视觉投影器;运行覆盖 llama.cpp、Ollama、LM Studio 三类工具,代理式编码建议用 llama-server 并配合原生 Anthropic↔OpenAI 工具转换代理。

更适合谁

  • 希望"规划—写码—自修"一体代理的本地开发者
  • 拥有 24GB 以上显存的硬件爱好者与代理式编程研究者
  • 想体验任务向量融合与混合注意力架构的实验者

典型使用场景

  • 单文件 HTML/JS 游戏或应用的端到端构建
  • 代理式调试:解析浏览器或编译报错并自动修复
  • 长文档问答与代码检索(60K 上下文内稳定)
  • 图像输入理解(OCR、截图解析,配合 mmproj)

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

推理与代码融合

在同一 27B 权重中保留推理稳定性与代码能力

自修复代理循环

能读取报错日志并自行定位修复缺陷

长上下文

原生 262K,60K 内通过 needle+termination 双重测试

多模态输入

通过独立 mmproj 投影器支持图像理解

硬件怎么准备

  • Q3_K_M:约 10.5GB 显存起,可用于 12GB 显卡
  • Q4_K_M:16GB 显存起,24GB 显卡最稳妥
  • Q6_K:约 20.5GB 显存起,建议 32GB 显卡
  • Q8/BF16:约 27.5GB 显存起,属高端工作站或数据中心配置

量化版本怎么选

  • 默认推荐 Q4_K_M,模型卡验证最充分
  • 显存紧张降到 Q3_K_M,能力会受损失
  • 显存充足可升 Q6_K,质量更接近 BF16
  • Q8/BF16 仅在追求最高一致性且显存富余时考虑

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q39.4 GB10.5 GB12 GB14.5 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 10.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 12GB。

阅读 12GB 显存选型指南 →

可以怎样运行

  • llama.cpp(推荐,含 llama-server OpenAI 兼容接口)
  • Ollama 拉取并运行
  • LM Studio 桌面端加载

采用前要知道的限制

  • 模型卡未说明大规模安全对齐与红队评估
  • 仅在 astropy 子集上做了 SWE-bench 测试,其他子集模型卡未说明
  • 极端代理任务可能过度推理并撞到 max_tokens 上限
  • 视觉通道继承自基座,未单独参与本次基准评测