HARDWARE PROFILES

本地 AI 硬件档案

按常见显卡和统一内存配置查看可运行模型。

NVIDIA4 GB

GTX 1650 4GB

GTX 1650 4GB 属于本地 AI 的入门档位,更适合 1B~7B 小模型、Q2/Q4 低量化和短上下文任务。运行前应为桌面系统预留显存,并优先选择支持 CPU 与 GPU 混合卸载的 llama.cpp 或 LM Studio。

NVIDIA12 GB

RTX 3060 12GB

RTX 3060 12GB 兼顾容量与普及度,适合高质量 7B~14B 模型、部分低量化 MoE 模型以及日常本地聊天和编程任务。12GB 显存仍需为上下文 KV Cache、桌面占用和运行框架保留余量。

NVIDIA8 GB

RTX 4060 8GB

RTX 4060 8GB 常见于主流桌面和游戏笔记本,适合 7B~12B 模型的 Q4 或更低量化版本。笔记本 4060 还会受到整机功耗与散热限制,选型时应同时关注推荐显存、上下文长度和 CPU 卸载比例。

NVIDIA12 GB

RTX 4070 Super 12GB

RTX 4070 Super 12GB 适合本地聊天、编程和中等规模多模态任务,可优先选择 7B~14B 模型的 Q4/Q5 量化,并尝试部分更大模型的低量化版本。长上下文和高并发仍会明显增加显存占用。

NVIDIA24 GB

RTX 4090 24GB

RTX 4090 24GB 适合高质量中型模型、较长上下文和较高比例 GPU Offload,也能尝试部分 30B~40B 模型的量化版本。实际吞吐取决于量化格式、上下文、批大小和运行框架,24GB 不代表所有大模型都能完整装入。

NVIDIA32 GB

RTX 5090 32GB

RTX 5090 32GB 提供更大的本地推理空间,适合更高质量量化、长上下文和复杂多模态工作流。选择模型时仍需为 KV Cache、并发和桌面系统留出容量,并检查运行框架是否已针对新架构完成优化。

Apple12 GB

Apple M2 16GB

Apple M2 16GB 使用统一内存,模型、系统和图形任务会共享同一容量,不能把 16GB 全部视作独立显存。更适合小到中型量化模型和轻量本地推理,建议优先使用支持 Metal 的 llama.cpp、Ollama 或 LM Studio。

Apple30 GB

Apple M3 Pro 36GB

Apple M3 Pro 36GB 的统一内存适合中型量化模型、较长上下文和本地开发工作流,但操作系统与应用也会占用同一内存池。选型时应按推荐内存而非最低文件体积判断,并优先使用成熟的 Metal 后端。

Apple40 GB

Apple M4 Pro 48GB

Apple M4 Pro 48GB 统一内存能够覆盖更多中大型量化模型和较长上下文任务,适合需要安静、低功耗本地推理的开发者。系统、GPU 与模型共享内存,实际可用容量会低于标称 48GB,部署前仍需实测吞吐与温度。