← 返回模型库

yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF

gemma-4-12B-coder-fable5-composer2.5-v1-GGUF:本地Python算法推理编码助手

基于Gemma 4 12B针对可验证Python与算法题微调的本地代码模型,融合Composer 2.5真实与Fable 5合成思维链数据蒸馏,最大256K上下文。适合希望离线私有编码助手、显存或内存约4.5GB起步的个人开发者与学习者使用。

Python代码助手本地大模型推理链CoTGemma微调
查看模型源页面
下载量
0
参数
12B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库为Gemma 4 12B指令模型的代码方向微调,仅发布GGUF量化权重,不含完整safetensors主版本。模型能力侧重可验证Python与算法题的链式思考与可执行解答,并非通用聊天或事实问答模型;通用事实问答与多语言能力模型卡未说明。量化仓库覆盖Q2_K到Q8_0共五档磁盘约4.5到11.8GB,运行工具支持llama.cpp(需较新版支持gemma4_unified架构)、Ollama、LM Studio等。原始训练token规模与公开跑分模型卡未说明。

更适合谁

  • 需要本地离线运行代码补全与算法题求解的个人开发者
  • 显存或统一内存约4.5GB起步、想跑推理链的轻量设备用户
  • 教学场景下需要展示思维链与代码组织过程的学习者
  • 希望用Apache 2.0开源权重自建私有编码助手的独立项目

典型使用场景

  • 本地Python算法题解答与函数级代码补全
  • 离线调试思路推导与小型脚本生成
  • 教学场景中演示思维链推理与代码组织
  • 个人项目替代云端API的私有编码助手

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

Python算法专精

训练数据聚焦可验证Python与算法题,先思考后给可运行解答

思维链原生

蒸馏自Composer 2.5与Fable 5真实与合成CoT,默认启用思考通道

长上下文支持

GGUF版本已修正至完整256K上下文窗口

多档量化覆盖

提供Q2_K到Q8_0共五档,最低4.5GB磁盘即可加载

硬件怎么准备

  • 4.5GB显存或统一内存:仅适合Q2_K量化,上下文约16K
  • 8GB显存:建议Q3_K_M,上下文约10K
  • 12到16GB显存:Q4_K_M可达30K到64K上下文,Q8_0约22K
  • 24GB以上显存或32GB统一内存:Q6_K与Q8_0可用,Q4_K_M可解锁满256K

量化版本怎么选

  • 显存不足8GB:从Q2_K入手换取可运行性
  • 8GB显存甜点:Q3_K_M在容量与质量间较平衡
  • 16GB显存推荐档:Q4_K_M为模型卡标定的推荐量化
  • 追求近无损:24GB以上显存或内存再考虑Q6_K或Q8_0

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q22.8 GB3.5 GB4.5 GB8 GB文件 ↗
Q34.2 GB5 GB6 GB8 GB文件 ↗
Q45.6 GB6.5 GB7.5 GB8.5 GB文件 ↗
Q68.4 GB9.5 GB11 GB13 GB文件 ↗
Q811 GB12.5 GB14.5 GB17 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 3.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4.5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp:需支持gemma4_unified架构的较新构建
  • Ollama、LM Studio、Jan:一键导入GGUF即可使用
  • 默认采样temp 1.0、top_p 0.95、top_k 64并启用enable_thinking
  • 编码场景可将temp设为0获取更确定输出

采用前要知道的限制

  • 未做安全对齐训练,回复缺少常规护栏
  • 强项限于Python与算法题,通用知识与多语言能力模型卡未说明
  • 训练语料以英文为主,非英文任务表现模型卡未说明
  • v1版本为编码推理定位而非Agentic,多轮工具调用与自主规划能力模型卡未说明