下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
other
MODEL POSITIONING
这个模型解决什么问题?
模型本体是把 Qwen/Qwen3.6-27B 的两个微调版本(偏推理的 v2 与偏代码的 Coder)按自定义层加权 task-vector 流程合并而来的 27B 模型,架构为 qwen35 混合注意力(线性+周期全注意力)。模型卡明确说主要在 Q4_K_M 上验证,其他量化未单独评测。仓库仅提供 GGUF 权重并附带独立 mmproj 视觉投影器;运行覆盖 llama.cpp、Ollama、LM Studio 三类工具,代理式编码建议用 llama-server 并配合原生 Anthropic↔OpenAI 工具转换代理。
更适合谁
- 希望"规划—写码—自修"一体代理的本地开发者
- 拥有 24GB 以上显存的硬件爱好者与代理式编程研究者
- 想体验任务向量融合与混合注意力架构的实验者
典型使用场景
- 单文件 HTML/JS 游戏或应用的端到端构建
- 代理式调试:解析浏览器或编译报错并自动修复
- 长文档问答与代码检索(60K 上下文内稳定)
- 图像输入理解(OCR、截图解析,配合 mmproj)
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
推理与代码融合
在同一 27B 权重中保留推理稳定性与代码能力
自修复代理循环
能读取报错日志并自行定位修复缺陷
长上下文
原生 262K,60K 内通过 needle+termination 双重测试
多模态输入
通过独立 mmproj 投影器支持图像理解
硬件怎么准备
- Q3_K_M:约 10.5GB 显存起,可用于 12GB 显卡
- Q4_K_M:16GB 显存起,24GB 显卡最稳妥
- Q6_K:约 20.5GB 显存起,建议 32GB 显卡
- Q8/BF16:约 27.5GB 显存起,属高端工作站或数据中心配置
量化版本怎么选
- 默认推荐 Q4_K_M,模型卡验证最充分
- 显存紧张降到 Q3_K_M,能力会受损失
- 显存充足可升 Q6_K,质量更接近 BF16
- Q8/BF16 仅在追求最高一致性且显存富余时考虑
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 10.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 12GB。
阅读 12GB 显存选型指南 →可以怎样运行
- llama.cpp(推荐,含 llama-server OpenAI 兼容接口)
- Ollama 拉取并运行
- LM Studio 桌面端加载
采用前要知道的限制
- 模型卡未说明大规模安全对齐与红队评估
- 仅在 astropy 子集上做了 SWE-bench 测试,其他子集模型卡未说明
- 极端代理任务可能过度推理并撞到 max_tokens 上限
- 视觉通道继承自基座,未单独参与本次基准评测