下载量
0
参数
12B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本仓库为Gemma 4 12B指令模型的代码方向微调,仅发布GGUF量化权重,不含完整safetensors主版本。模型能力侧重可验证Python与算法题的链式思考与可执行解答,并非通用聊天或事实问答模型;通用事实问答与多语言能力模型卡未说明。量化仓库覆盖Q2_K到Q8_0共五档磁盘约4.5到11.8GB,运行工具支持llama.cpp(需较新版支持gemma4_unified架构)、Ollama、LM Studio等。原始训练token规模与公开跑分模型卡未说明。
更适合谁
- 需要本地离线运行代码补全与算法题求解的个人开发者
- 显存或统一内存约4.5GB起步、想跑推理链的轻量设备用户
- 教学场景下需要展示思维链与代码组织过程的学习者
- 希望用Apache 2.0开源权重自建私有编码助手的独立项目
典型使用场景
- 本地Python算法题解答与函数级代码补全
- 离线调试思路推导与小型脚本生成
- 教学场景中演示思维链推理与代码组织
- 个人项目替代云端API的私有编码助手
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
Python算法专精
训练数据聚焦可验证Python与算法题,先思考后给可运行解答
思维链原生
蒸馏自Composer 2.5与Fable 5真实与合成CoT,默认启用思考通道
长上下文支持
GGUF版本已修正至完整256K上下文窗口
多档量化覆盖
提供Q2_K到Q8_0共五档,最低4.5GB磁盘即可加载
硬件怎么准备
- 4.5GB显存或统一内存:仅适合Q2_K量化,上下文约16K
- 8GB显存:建议Q3_K_M,上下文约10K
- 12到16GB显存:Q4_K_M可达30K到64K上下文,Q8_0约22K
- 24GB以上显存或32GB统一内存:Q6_K与Q8_0可用,Q4_K_M可解锁满256K
量化版本怎么选
- 显存不足8GB:从Q2_K入手换取可运行性
- 8GB显存甜点:Q3_K_M在容量与质量间较平衡
- 16GB显存推荐档:Q4_K_M为模型卡标定的推荐量化
- 追求近无损:24GB以上显存或内存再考虑Q6_K或Q8_0
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 3.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4.5GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp:需支持gemma4_unified架构的较新构建
- Ollama、LM Studio、Jan:一键导入GGUF即可使用
- 默认采样temp 1.0、top_p 0.95、top_k 64并启用enable_thinking
- 编码场景可将temp设为0获取更确定输出
采用前要知道的限制
- 未做安全对齐训练,回复缺少常规护栏
- 强项限于Python与算法题,通用知识与多语言能力模型卡未说明
- 训练语料以英文为主,非英文任务表现模型卡未说明
- v1版本为编码推理定位而非Agentic,多轮工具调用与自主规划能力模型卡未说明