NVIDIA · GPU
RTX 3060 12GB 能运行哪些本地 AI 模型?
RTX 3060 12GB 兼顾容量与普及度,适合高质量 7B~14B 模型、部分低量化 MoE 模型以及日常本地聊天和编程任务。12GB 显存仍需为上下文 KV Cache、桌面占用和运行框架保留余量。 适合更高质量的 7B~14B 模型,并可尝试部分 MoE 或低量化大模型。下面的结果按公开模型文件体积估算,适合作为选型起点,不替代目标设备实测。
先看结论
当前共有 83 个模型存在最低显存不超过 12GB 的版本;其中 82 个模型的推荐显存也在容量内,适合优先尝试。另有 1 个模型只能在较激进量化、短上下文或部分卸载条件下接近下限运行。
阅读 12GB 显存完整选型指南 →RTX 3060 12GB 选模型时看什么?
先看推荐显存
推荐显存不超过设备容量时,通常更容易为运行框架和上下文保留余量。
再看量化质量
Q4 常用于质量与体积平衡;IQ2、Q2 更省显存,但需要接受更明显的能力损失。
最后看任务
编程、长文本、多模态和图像生成的资源需求不同,不要只按参数量判断。
优先查看的兼容模型
按下载量与模型热度排序,首屏只展示 12 个,完整结果可继续筛选。
gemma-4-12B-it-qat-GGUF:12B多模态本地量化指令版
Gemma 4 12B 统一架构指令调优版本,支持文本、图像与音频输入,输出仅文本,原生 256K 上下文,内置可配置思考模式与原生函数调用。Unsloth 提供 QAT 量化 GGUF 并附带 MTP 投机解码草稿模型,兼容 llama.cpp、Ollama 与 LM Studio。
gemma-4-12B-coder-fable5-composer2.5-v1-GGUF:本地Python算法推理编码助手
基于Gemma 4 12B针对可验证Python与算法题微调的本地代码模型,融合Composer 2.5真实与Fable 5合成思维链数据蒸馏,最大256K上下文。适合希望离线私有编码助手、显存或内存约4.5GB起步的个人开发者与学习者使用。
Qwen-AgentWorld-35B-A3B-GGUF:智能体环境模拟世界模型
Qwen-AgentWorld-35B-A3B 是原生语言世界模型,专注智能体环境模拟,覆盖 MCP 工具调用、搜索、终端、SWE、Android、Web、OS 七个交互域,通过长链思维推理预测下一环境状态。适合智能体框架研究者、AgentWorldBench 评测用户及多工具调用 Agent 系统开发者使用。
gemma-4-26B-A4B-it-GGUF:本地推理多模态MoE对话模型
Google Gemma 4 26B A4B 是 MoE 架构的多模态模型,总参数 26B、激活约 4B,支持文本与图像输入、文本输出,256K 上下文窗口,覆盖 140 多种语言。适合在消费级 GPU 或工作站做本地对话、代码、推理与图文理解。Apache 2.
MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF:1B 本地思考模型工具调用增强版
基于 MiniCPM5-1B 的 1B 参数本地化文本生成模型,V2 版本相比 V1 强化工具调用与函数调用能力,支持思考模式推理与最长 128K 上下文,兼顾中英文对话、代码生成和指令跟随。适合想要在笔记本或低显存设备上本地跑一个能调用工具、能写代码的小模型的用户。
Qwen3.8-27B-GGUF:27B多模态推理与代理任务密集模型
Qwen3.8-27B-GGUF 是 27B 参数的原生视觉语言密集模型,支持图像与视频理解,擅长编码、专业写作、研究与长链路代理任务;原生上下文 262144 tokens,可经 RoPE 扩展至 1000000 tokens。思考模式默认开启且可按请求关闭,并支持工具调用与多 token 预测。
Qwen3.5-9B-Uncensored-HauhauCS-Aggressive:9B多模态去审查对话模型
基于Qwen3.5-9B的9B参数混合架构模型,采用线性注意力与全注意力3:1组合,作者称移除安全审查并保留原始多模态能力,支持文本、图像、视频输入及原生262K上下文。适合需要无限制生成的中文及多语言用户,需2026年3月后较新llama.cpp版本。Q4_K_M量化推荐8GB内存,Q8需13GB以上。
Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF:无审查全能创作与编程模型
该模型为 40B 稠密参数文本生成模型,由 Qwen3.6-27B 扩参训练而来,强调无审查、创作与编程能力,原生支持 256K 上下文与视觉输入。适合追求长篇创意写作、角色扮演、复杂代码生成与多轮深度对话的用户。最低运行门槛约 10.
Flux2-Klein-9B-True-V3:9B 文本生图与指令编辑模型
基于 FLUX.2-klein-9B 微调的 9B 文本生成图像模型,支持纯提示词图像编辑、LoRA 换脸换装及 Mask 区域精准编辑,V3 版本在美学与构图上有明显改进。适合需要本地部署文生图或图像编辑工作流的中文用户与 AIGC 创作者。
MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:本地1B轻量思维链代码模型
面向本地部署的 1B 参数轻量文本生成模型,基于 MiniCPM5-1B 在 Fable 5 数据上微调,支持思维链推理、代码生成与指令跟随,上下文最长 128K tokens。适合硬件受限、需要离线跑思维链问答或编程任务的个人开发者,最低 4GB 内存即可加载 Q4 量化版本,无需高端显卡。
Ternary-Bonsai-27B-gguf:27B三元量化笔记本可跑的长文本推理模型
Ternary Bonsai 27B 是基于 Qwen3.6-27B 的三元权重量化版本,部署约 7.2 GB,可在 8 GB 内存的笔记本上加载运行,保留数学、代码与思维链等核心推理能力,原生支持 262K 长上下文。
Qwen3.6-35B-A3B-GGUF:35B 多模态代理编程与长文档模型
Qwen3.6-35B-A3B 是千问首个开源权重的 35B 多模态 MoE 大模型,总参数 35B、激活 3B,支持文本、图像与视频输入,原生 26 万 token 上下文可扩展至百万级。模型卡强调智能体编码、工具调用与思维链保留能力。适合需要本地代理编程、长文档问答和视觉理解的开发者与研究者。可通过 llama.
常见问题
RTX 3060 12GB 能运行哪些本地 AI 模型?
当前数据库中有 83 个模型至少存在一个估算可在 12GB 显存内加载的版本,其中 82 个存在推荐显存不超过该设备容量的量化版本。
12GB 显存应该选择什么量化?
适合更高质量的 7B~14B 模型,并可尝试部分 MoE 或低量化大模型。优先选择推荐显存低于设备容量的版本;只有最低显存满足时,应缩短上下文并减少 GPU Offload 或并发。
最低显存和推荐显存有什么区别?
最低显存接近模型能够加载的下限,推荐显存会为运行框架、上下文 KV Cache 和系统占用保留余量。接近下限并不等于能稳定高负载运行。