← 返回模型库

yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF

gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF:低显存本地编码代理与工具调用

基于 google/gemma-4-12B-it 微调的 12B 文本生成模型,专注编码、终端与多步 Agentic 工具调用任务。Q3 量化约 4.5GB,可在约 5GB VRAM 的低配机器运行本地私有代理,Q4_K_M 被作者标为推荐甜点。通用知识略低于基模,英语为主,未做安全对齐,按 Apache 2.

本地编码助手Agentic 工具调用终端调试Gemma 4 微调
查看模型源页面
下载量
0
参数
12B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来源于 google/gemma-4-12B-it 基模的后训练强化,主攻编码和 Agentic 方向,提供多步工具调用与 Gemma 原生思考链;模型卡自述在 tau2-bench 电信类任务上较基模提升约 3.5 倍,但通用问答略弱于基模,属于专精取舍。仓库仅提供 GGUF 量化文件(Q3、Q4、Q6、Q8、BF16、F16)和 MTP 投机解码草稿,原始 Safetensors 主权重也已开源。运行工具以 llama.cpp 为推荐(需支持 gemma4_unified 架构的较新版本),Ollama 与 LM Studio 也可直接导入;通过 OpenAI tools 字段即可接入 agent 循环。上下文长度模型卡未说明。

更适合谁

  • 想本地跑私有编码 Agent 的开发者
  • 需要多步读、grep、编辑、运行、验证的终端任务工程师
  • 显存有限但希望体验 Agentic 工作流的爱好者
  • 已有英文为主工作流的小型本地部署用户

典型使用场景

  • 本地离线编码助手,替代部分云端 API 调用
  • 终端调试和故障排查类多步技术任务
  • 通过 OpenAI tools 字段接入 agent 框架做自动 read/grep/edit/run 循环
  • 阅读文件、检索、修改、运行后验证的工作流

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

多步工具调用与 Agent 循环

读、推理、调用工具、验证的完整链路,按 Gemma 原生协议输出

编码能力强化

Python 通过测试门控的真实思维链训练

低显存可运行

Q3_K_M 量化仅约 4.5GB,可塞入 5GB VRAM

原生思考模式

默认开启的 Gemma 4 思考链通道

投机解码加速

MTP 草稿在 llama.cpp b9553 上可提速约 1.2–1.3 倍

硬件怎么准备

  • 最低门槛:Q3_K_M 量化,最少约 5.5GB RAM 或 5GB VRAM,推荐 8GB RAM / 6GB VRAM
  • 推荐甜点:Q4_K_M 量化,最少 7GB RAM / 6.5GB VRAM,推荐 8.5GB RAM / 7.5GB VRAM
  • 接近无损:Q6_K 量化,最少约 10.5GB RAM / 9.5GB VRAM,推荐 13GB RAM / 11GB VRAM
  • 全精度附近:BF16/F16 最少 9GB RAM / 8GB VRAM;Q8_0 最少 14GB RAM / 12.5GB VRAM

量化版本怎么选

  • 推荐 Q4_K_M 作为大多数用户性价比甜点,作者明确建议
  • 显存紧张选 Q3_K_M,这是作者标注的最小可靠量化
  • 想要接近原模型质量可选 Q6_K 或 Q8_0
  • 模型卡未提供 Q2_K,作者因未过压力测试暂不发布

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q34.2 GB5 GB6 GB8 GB文件 ↗
Q45.6 GB6.5 GB7.5 GB8.5 GB文件 ↗
BF167.0 GB8 GB9.5 GB10.5 GB文件 ↗
F167.0 GB8 GB9.5 GB10.5 GB文件 ↗
Q68.4 GB9.5 GB11 GB13 GB文件 ↗
Q811 GB12.5 GB14.5 GB17 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp 加载 gemma4_unified,需较新版本;推荐 b9553 以启用 MTP 投机解码草稿
  • Ollama、LM Studio、Jan 等一键应用可直接导入 GGUF
  • 通过 OpenAI tools 字段把工具传给模型实现 Agent 循环
  • llama.cpp 配合 MTP 草稿做投机解码,据模型卡可提速约 1.2–1.3 倍

采用前要知道的限制

  • 通用知识略弱于基模,是编码专精化的取舍
  • 英语为主,其他语言能力模型卡未说明
  • 拒答降低、未做安全对齐,生产场景需自行加防护
  • 上下文长度模型卡未说明

COMPARISON PATH

继续对比同类方案

不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。