← 返回模型库

Jackrong/Qwopus3.6-27B-Fusion-GGUF

Qwopus3.6-27B-Fusion-GGUF:融合推理与代码的27B单代理

Qwopus3.6-27B-Fusion-GGUF 是 27B 参数、qwen35 混合线性与全注意力架构的 GGUF 量化版本,把多步推理与代码执行能力合并到一个模型里,面向希望本地运行闭环创作编程代理的开发者。默认开启思考模式,最低 Q3_K_M 需约 12GB 内存与 10.

27B 代码代理GGUF 本地部署混合注意力模型推理代码融合
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
other

MODEL POSITIONING

这个模型解决什么问题?

模型本身:27B 参数的 qwen35 混合注意力架构,将推理微调与代码微调按层加权任务向量方式合并,强调在 build→run→self-fix 闭环中由单一代理完成计划、编码与自调试;原生上下文 262144,已自报验证到 60K 稳定。能力分数全部来自模型卡自报,未经独立大规模复测。仓库层:只发布 GGUF 权重,覆盖 Q3_K_M 至 Q6_K 四档;除 Q4_K_M 外其余量化档位作者未单独评测。运行工具:llama.cpp 为作者主推路径并提供 OpenAI 兼容接口,Ollama 与 LM Studio 在仓库运行时刻出兼容;接入 Claude Code 需配套原生 Anthropic↔OpenAI 工具翻译代理,具体细节模型卡未说明。

更适合谁

  • 本地拥有 16GB 以上显存、想跑闭环创作编程代理的开发者
  • 希望用一个模型同时覆盖多步推理与代码自调试的玩家
  • 在 Ollama / LM Studio / llama.cpp 上实验混合注意力架构的研究者

典型使用场景

  • 端到端生成单文件 HTML/JS 游戏或 Web 应用
  • 作为 Claude Code / OpenCode 等代理循环的本地后端驱动多文件项目
  • 离线长文档多步推理与代码调试
  • 混合注意力架构下的本地大模型实验

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

推理与代码融合

将 27B 推理模型与代码微调合并为单一代理,单模型即可完成计划、编码、调试闭环

闭环创作编程

在 build→run→self-fix 循环中能根据 Playwright 等报错自行根因定位并修复

长上下文与温度稳定

原生 262144 tokens,60K 内 needle+终止稳定,0.2 与 0.9 温度均无循环

思考模式默认开启

推理能力突出,模型卡自报 HumanEval 94.5%、GSM8K 95.0%、IFEval 严格 82.8%

硬件怎么准备

  • Q3_K_M:最低约 12GB 内存与 10.5GB 显存,推荐 14.5GB 内存或 12GB 显存
  • Q4_K_M:最低约 16GB 内存与 14GB 显存,推荐 19GB 内存或 16GB 显存(作者主推档位)
  • Q5_K_M:最低约 20GB 内存与 17GB 显存,推荐 24GB 内存或 19.5GB 显存
  • Q6_K:最低约 24GB 内存与 20.5GB 显存,推荐 28.5GB 内存或 23.5GB 显存

量化版本怎么选

  • 推荐 Q4_K_M,作者在此档位做了 HumanEval、MBPP、GSM8K、MATH-500、IFEval 完整验证
  • Q3_K_M、Q5_K_M、Q6_K 作者未单独跑分,应视为未验证
  • 文件体积从约 10GB 到 20GB,可按显存余量上下浮动一档

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q39.4 GB10.5 GB12 GB14.5 GB文件 ↗
Q413 GB14 GB16 GB19 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 10.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 12GB。

阅读 12GB 显存选型指南 →

可以怎样运行

  • llama.cpp / llama-server:作者主推路径,提供 OpenAI 兼容接口
  • Ollama 与 LM Studio:仓库运行时刻出兼容
  • Claude Code / OpenAI 兼容客户端:需搭配原生 Anthropic↔OpenAI 工具翻译代理

采用前要知道的限制

  • 模型卡未做大规模安全对齐与红队测试
  • 仅在 Q4_K_M 上完整评测,其余量化档位未单独验证
  • 在最难代理实例上可能过度推理触发生成上限,建议将 max_tokens 限制在约 8K
  • SWE-bench astropy 子集提升在 15 例范围内处于噪声区