下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
other
MODEL POSITIONING
这个模型解决什么问题?
模型本身:27B 参数的 qwen35 混合注意力架构,将推理微调与代码微调按层加权任务向量方式合并,强调在 build→run→self-fix 闭环中由单一代理完成计划、编码与自调试;原生上下文 262144,已自报验证到 60K 稳定。能力分数全部来自模型卡自报,未经独立大规模复测。仓库层:只发布 GGUF 权重,覆盖 Q3_K_M 至 Q6_K 四档;除 Q4_K_M 外其余量化档位作者未单独评测。运行工具:llama.cpp 为作者主推路径并提供 OpenAI 兼容接口,Ollama 与 LM Studio 在仓库运行时刻出兼容;接入 Claude Code 需配套原生 Anthropic↔OpenAI 工具翻译代理,具体细节模型卡未说明。
更适合谁
- 本地拥有 16GB 以上显存、想跑闭环创作编程代理的开发者
- 希望用一个模型同时覆盖多步推理与代码自调试的玩家
- 在 Ollama / LM Studio / llama.cpp 上实验混合注意力架构的研究者
典型使用场景
- 端到端生成单文件 HTML/JS 游戏或 Web 应用
- 作为 Claude Code / OpenCode 等代理循环的本地后端驱动多文件项目
- 离线长文档多步推理与代码调试
- 混合注意力架构下的本地大模型实验
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
推理与代码融合
将 27B 推理模型与代码微调合并为单一代理,单模型即可完成计划、编码、调试闭环
闭环创作编程
在 build→run→self-fix 循环中能根据 Playwright 等报错自行根因定位并修复
长上下文与温度稳定
原生 262144 tokens,60K 内 needle+终止稳定,0.2 与 0.9 温度均无循环
思考模式默认开启
推理能力突出,模型卡自报 HumanEval 94.5%、GSM8K 95.0%、IFEval 严格 82.8%
硬件怎么准备
- Q3_K_M:最低约 12GB 内存与 10.5GB 显存,推荐 14.5GB 内存或 12GB 显存
- Q4_K_M:最低约 16GB 内存与 14GB 显存,推荐 19GB 内存或 16GB 显存(作者主推档位)
- Q5_K_M:最低约 20GB 内存与 17GB 显存,推荐 24GB 内存或 19.5GB 显存
- Q6_K:最低约 24GB 内存与 20.5GB 显存,推荐 28.5GB 内存或 23.5GB 显存
量化版本怎么选
- 推荐 Q4_K_M,作者在此档位做了 HumanEval、MBPP、GSM8K、MATH-500、IFEval 完整验证
- Q3_K_M、Q5_K_M、Q6_K 作者未单独跑分,应视为未验证
- 文件体积从约 10GB 到 20GB,可按显存余量上下浮动一档
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 10.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 12GB。
阅读 12GB 显存选型指南 →可以怎样运行
- llama.cpp / llama-server:作者主推路径,提供 OpenAI 兼容接口
- Ollama 与 LM Studio:仓库运行时刻出兼容
- Claude Code / OpenAI 兼容客户端:需搭配原生 Anthropic↔OpenAI 工具翻译代理
采用前要知道的限制
- 模型卡未做大规模安全对齐与红队测试
- 仅在 Q4_K_M 上完整评测,其余量化档位未单独验证
- 在最难代理实例上可能过度推理触发生成上限,建议将 max_tokens 限制在约 8K
- SWE-bench astropy 子集提升在 15 例范围内处于噪声区