本地模型指南
8GB 显存能运行哪些本地 AI 模型?GGUF 量化选型指南
根据当前 GGUF 文件和运行余量,筛选适合 8GB 显存的本地 AI 模型,并说明最低显存与推荐显存的区别。
本文由公开模型元数据与 GGUF 文件信息生成,硬件占用为估算值;长上下文、并发和 GPU Offload 会改变实际结果。
8GB 显存的关键不是寻找“最大的模型”,而是在模型规模、量化质量、上下文和响应速度之间取得平衡。本站当前数据库中有 10 个热门模型至少存在一个估算可在 8GB 范围内加载的 GGUF 文件。
8GB 显存兼容模型
| 模型 | 参数 | 可选量化 | 最低显存 | 推荐显存 |
|---|---|---|---|---|
| gemma-4-12B-coder-fable5-composer2.5-v1-GGUF:本地Python算法推理编码助手 | 12B | Q2 | 3.5 GB | 4.5 GB |
| gemma-4-26B-A4B-it-GGUF:本地推理多模态MoE对话模型 | 26B | Q2 | 7 GB | 8 GB |
| MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF:1B 本地思考模型工具调用增强版 | 1B | F16 | 1 GB | 2 GB |
| Qwen3.8-27B-GGUF:27B多模态推理与代理任务密集模型 | 27B | IQ1 | 3.5 GB | 4.5 GB |
| Qwen3.5-9B-Uncensored-HauhauCS-Aggressive:9B多模态去审查对话模型 | 9B | Q4 | 5 GB | 6 GB |
| Flux2-Klein-9B-True-V3:9B 文本生图与指令编辑模型 | 9B | Q4 | 5 GB | 6 GB |
| MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:本地1B轻量思维链代码模型 | 1B | Q4 | 1 GB | 2 GB |
| Ternary-Bonsai-27B-gguf:27B三元量化笔记本可跑的长文本推理模型 | 27B | Q2 | 7 GB | 8 GB |
| Qwen3.6-35B-A3B-GGUF:35B 多模态代理编程与长文档模型 | 35B | IQ1 | 4.5 GB | 5.5 GB |
| Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced:去审查多模态长上下文编程写作模型 | 12B | Q4 | 6.5 GB | 7.5 GB |
表中的最低显存接近“能够加载”的下限,推荐显存包含了一定运行余量。实际使用时,操作系统、桌面环境、上下文长度和 GPU Offload 策略都会改变占用,因此接近 8GB 上限的模型更适合短上下文或部分层卸载。
8GB 配置怎么选
- 日常聊天优先选择响应速度稳定、许可证清晰的文本生成模型。
- 需要更长上下文时,应降低模型规模或选择更小量化。
- 如果最低显存已经接近 8GB,不要同时开启高并发或超长上下文。
继续缩小范围
访问模型库的 8GB 筛选结果查看最新数据。筛选页不会单独进入搜索索引,搜索引擎收录的是这篇带有解释、边界和可验证模型链接的指南页。
显存值根据 GGUF 文件体积估算,属于选型起点。最终部署前请在目标设备、运行框架和上下文设置下完成实测。
同主题阅读路径
查看「本地模型指南」栏目继续匹配本地模型
回到模型库按任务和显存筛选最新可用的 GGUF 版本。
打开模型库