← 返回硬件档案

Apple · Unified Memory

Apple M4 Pro 48GB 能运行哪些本地 AI 模型?

Apple M4 Pro 48GB 统一内存能够覆盖更多中大型量化模型和较长上下文任务,适合需要安静、低功耗本地推理的开发者。系统、GPU 与模型共享内存,实际可用容量会低于标称 48GB,部署前仍需实测吞吐与温度。 适合更大模型、更长上下文和更高 GPU Offload 比例,但仍需为系统与 KV Cache 预留空间。下面的结果按公开模型文件体积估算,适合作为选型起点,不替代目标设备实测。

可用显存
40 GB
系统内存
48 GB
可加载模型
100 个
余量较充足
100 个

先看结论

当前共有 100 个模型存在最低显存不超过 40GB 的版本;其中 100 个模型的推荐显存也在容量内,适合优先尝试。

阅读 24GB 显存完整选型指南 →

Apple M4 Pro 48GB 选模型时看什么?

先看推荐显存

推荐显存不超过设备容量时,通常更容易为运行框架和上下文保留余量。

再看量化质量

Q4 常用于质量与体积平衡;IQ2、Q2 更省显存,但需要接受更明显的能力损失。

最后看任务

编程、长文本、多模态和图像生成的资源需求不同,不要只按参数量判断。

优先查看的兼容模型

按下载量与模型热度排序,首屏只展示 12 个,完整结果可继续筛选。

查看全部 100 个 →
AI MODEL01 / ♥ 0

gemma-4-12B-it-qat-GGUF:12B多模态本地量化指令版

Gemma 4 12B 统一架构指令调优版本,支持文本、图像与音频输入,输出仅文本,原生 256K 上下文,内置可配置思考模式与原生函数调用。Unsloth 提供 QAT 量化 GGUF 并附带 MTP 投机解码草稿模型,兼容 llama.cpp、Ollama 与 LM Studio。

多模态大模型本地推理GGUF量化
模型源更新
最低显存
6.5 GB
最小文件
5.6 GB
AI MODEL01 / ♥ 0

Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP:去审查多模态长文推理与创作

基于 Google Gemma 4 26B-A4B 的去审查微调版本,26B 总参数配 4B 激活 MoE 架构,原生支持 256K 上下文与图像输入。适合需要开放式回答的智能体编程、创意写作、角色扮演与长文档推理用户,建议单卡约 16 GB 显存或 18.5 GB 内存起步,搭配 MTP 草稿头可在 llama.

多模态长上下文MoE 去审查智能体编程
模型源更新
最低显存
13.5 GB
最小文件
12 GB
AI MODEL01 / ♥ 0

gemma-4-12B-coder-fable5-composer2.5-v1-GGUF:本地Python算法推理编码助手

基于Gemma 4 12B针对可验证Python与算法题微调的本地代码模型,融合Composer 2.5真实与Fable 5合成思维链数据蒸馏,最大256K上下文。适合希望离线私有编码助手、显存或内存约4.5GB起步的个人开发者与学习者使用。

Python代码助手本地大模型推理链CoT
模型源更新
最低显存
3.5 GB
最小文件
2.8 GB
AI MODEL01 / ♥ 0

Ornith-1.0-35B-GGUF:开源代理编码轻量模型

Ornith-1.0-35B-GGUF 是 35B 参数的代理编码开源模型,专注代码生成、工具调用与终端代理任务。模型采用自改进 RL 训练框架,适合本地搭建编程代理或 IDE 助手的开发者与研究人员。Q4_K_M 量化最低约需 18GB 显存或 20.

代理编码工具调用代码生成
模型源更新
最低显存
18 GB
最小文件
16 GB
AI MODEL01 / ♥ 0

Qwen-AgentWorld-35B-A3B-GGUF:智能体环境模拟世界模型

Qwen-AgentWorld-35B-A3B 是原生语言世界模型,专注智能体环境模拟,覆盖 MCP 工具调用、搜索、终端、SWE、Android、Web、OS 七个交互域,通过长链思维推理预测下一环境状态。适合智能体框架研究者、AgentWorldBench 评测用户及多工具调用 Agent 系统开发者使用。

世界模型智能体环境模拟Agent 评测
模型源更新
最低显存
9 GB
最小文件
8.1 GB
AI MODEL01 / ♥ 0

gemma-4-26B-A4B-it-GGUF:本地推理多模态MoE对话模型

Google Gemma 4 26B A4B 是 MoE 架构的多模态模型,总参数 26B、激活约 4B,支持文本与图像输入、文本输出,256K 上下文窗口,覆盖 140 多种语言。适合在消费级 GPU 或工作站做本地对话、代码、推理与图文理解。Apache 2.

多模态对话本地推理图文理解
模型源更新
最低显存
7 GB
最小文件
6.1 GB
AI MODEL01 / ♥ 0

MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF:1B 本地思考模型工具调用增强版

基于 MiniCPM5-1B 的 1B 参数本地化文本生成模型,V2 版本相比 V1 强化工具调用与函数调用能力,支持思考模式推理与最长 128K 上下文,兼顾中英文对话、代码生成和指令跟随。适合想要在笔记本或低显存设备上本地跑一个能调用工具、能写代码的小模型的用户。

本地 1B 小模型工具调用思考模式
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-GGUF:27B多模态推理与代理任务密集模型

Qwen3.8-27B-GGUF 是 27B 参数的原生视觉语言密集模型,支持图像与视频理解,擅长编码、专业写作、研究与长链路代理任务;原生上下文 262144 tokens,可经 RoPE 扩展至 1000000 tokens。思考模式默认开启且可按请求关闭,并支持工具调用与多 token 预测。

多模态长上下文代理任务
模型源更新
最低显存
3.5 GB
最小文件
3.1 GB
AI MODEL01 / ♥ 0

Qwen3.5-9B-Uncensored-HauhauCS-Aggressive:9B多模态去审查对话模型

基于Qwen3.5-9B的9B参数混合架构模型,采用线性注意力与全注意力3:1组合,作者称移除安全审查并保留原始多模态能力,支持文本、图像、视频输入及原生262K上下文。适合需要无限制生成的中文及多语言用户,需2026年3月后较新llama.cpp版本。Q4_K_M量化推荐8GB内存,Q8需13GB以上。

多模态对话去审查长上下文
模型源更新
最低显存
5 GB
最小文件
4.2 GB
AI MODEL01 / ♥ 0

Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF:无审查全能创作与编程模型

该模型为 40B 稠密参数文本生成模型,由 Qwen3.6-27B 扩参训练而来,强调无审查、创作与编程能力,原生支持 256K 上下文与视觉输入。适合追求长篇创意写作、角色扮演、复杂代码生成与多轮深度对话的用户。最低运行门槛约 10.

无审查创作长上下文角色扮演本地代码生成
模型源更新
最低显存
10.5 GB
最小文件
9.3 GB
AI MODEL01 / ♥ 0

Qwopus3.6-35B-A3B-Coder-MTP-GGUF:思考关闭的本地编码代理模型

基于 Qwen3.6-35B-A3B 的稀疏 MoE 编码微调模型,总参数 35B、激活约 3B,专为关闭长思考的代理式编码流程设计,擅长多轮工具调用、仓库级调试与多文件补丁生成。

编码代理思考关闭工具调用
模型源更新
最低显存
13.5 GB
最小文件
12 GB
AI MODEL01 / ♥ 0

Flux2-Klein-9B-True-V3:9B 文本生图与指令编辑模型

基于 FLUX.2-klein-9B 微调的 9B 文本生成图像模型,支持纯提示词图像编辑、LoRA 换脸换装及 Mask 区域精准编辑,V3 版本在美学与构图上有明显改进。适合需要本地部署文生图或图像编辑工作流的中文用户与 AIGC 创作者。

文生图图像编辑FLUX 微调
模型源更新
最低显存
5 GB
最小文件
4.2 GB

常见问题

Apple M4 Pro 48GB 能运行哪些本地 AI 模型?

当前数据库中有 100 个模型至少存在一个估算可在 40GB 显存内加载的版本,其中 100 个存在推荐显存不超过该设备容量的量化版本。

40GB 显存应该选择什么量化?

适合更大模型、更长上下文和更高 GPU Offload 比例,但仍需为系统与 KV Cache 预留空间。优先选择推荐显存低于设备容量的版本;只有最低显存满足时,应缩短上下文并减少 GPU Offload 或并发。

最低显存和推荐显存有什么区别?

最低显存接近模型能够加载的下限,推荐显存会为运行框架、上下文 KV Cache 和系统占用保留余量。接近下限并不等于能稳定高负载运行。