本地模型指南
2026-08-31 当周 本地 AI 模型周报:热门 GGUF 与显存要求
比较 30 个可公开下载的 GGUF 模型,整理热门模型、最小量化文件和估算显存要求。
本文由公开模型元数据与 GGUF 文件信息生成,硬件占用为估算值;长上下文、并发和 GPU Offload 会改变实际结果。
本期数据截至 2026/09/06,从公开模型仓库中筛选出 30 个存在有效 GGUF 量化文件的模型。排序主要参考下载量,硬件建议则来自文件体积和运行余量估算,两者代表的含义不同。
本周热门本地模型
| 模型 | 参数规模 | 下载量 | 最小量化 | 估算最低显存 |
|---|---|---|---|---|
| Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP:去审查多模态长文推理与创作 | 26B | 0 | Q4 | 13.5 GB |
| gemma-4-12B-coder-fable5-composer2.5-v1-GGUF:本地Python算法推理编码助手 | 12B | 0 | Q2 | 3.5 GB |
| Ornith-1.0-35B-GGUF:开源代理编码轻量模型 | 35B | 0 | Q4 | 18 GB |
| Qwen-AgentWorld-35B-A3B-GGUF:智能体环境模拟世界模型 | 35B | 0 | Q2 | 9 GB |
| gemma-4-26B-A4B-it-GGUF:本地推理多模态MoE对话模型 | 26B | 0 | IQ2 | 7 GB |
| MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF:1B 本地思考模型工具调用增强版 | 1B | 0 | F16 | 1 GB |
| Qwen3.8-27B-GGUF:27B多模态推理与代理任务密集模型 | 27B | 0 | IQ1 | 3.5 GB |
| Qwen3.5-9B-Uncensored-HauhauCS-Aggressive:9B多模态去审查对话模型 | 9B | 0 | Q4 | 5 GB |
| Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF:无审查全能创作与编程模型 | 40B | 0 | IQ2 | 10.5 GB |
| Qwopus3.6-35B-A3B-Coder-MTP-GGUF:思考关闭的本地编码代理模型 | 35B | 0 | Q3 | 13.5 GB |
下载量能够反映近期使用热度,但不能直接代表输出质量。选择模型时还应核对任务类型、许可证、上下文长度和量化精度,并为 KV Cache、系统占用和并发请求预留额外内存。
选择量化版本的顺序
- 先按可用显存筛掉无法加载的文件。
- 在可运行的版本中优先选择质量更高的量化,而不是一味追求最小文件。
- 长上下文或多用户并发场景,应在本站估算值之外继续增加余量。
下一步怎么选
可以使用显存匹配计算器输入自己的显存和任务,或进入模型库按用途筛选。每个模型详情页都会列出已解析的 GGUF 文件、最低显存和推荐显存。
本文基于模型仓库公开元数据自动生成。显存结果用于初筛,不代替在具体运行框架和上下文长度下的实机测试。
同主题阅读路径
查看「本地模型指南」栏目继续匹配本地模型
回到模型库按任务和显存筛选最新可用的 GGUF 版本。
打开模型库