← 返回硬件档案

NVIDIA · GPU

GTX 1650 4GB 能运行哪些本地 AI 模型?

GTX 1650 4GB 属于本地 AI 的入门档位,更适合 1B~7B 小模型、Q2/Q4 低量化和短上下文任务。运行前应为桌面系统预留显存,并优先选择支持 CPU 与 GPU 混合卸载的 llama.cpp 或 LM Studio。 适合小参数模型、极低量化版本和轻量语音或文本任务。下面的结果按公开模型文件体积估算,适合作为选型起点,不替代目标设备实测。

可用显存
4 GB
系统内存
16 GB
可加载模型
32 个
余量较充足
23 个

先看结论

当前共有 32 个模型存在最低显存不超过 4GB 的版本;其中 23 个模型的推荐显存也在容量内,适合优先尝试。另有 9 个模型只能在较激进量化、短上下文或部分卸载条件下接近下限运行。

阅读 4GB 显存完整选型指南 →

GTX 1650 4GB 选模型时看什么?

先看推荐显存

推荐显存不超过设备容量时,通常更容易为运行框架和上下文保留余量。

再看量化质量

Q4 常用于质量与体积平衡;IQ2、Q2 更省显存,但需要接受更明显的能力损失。

最后看任务

编程、长文本、多模态和图像生成的资源需求不同,不要只按参数量判断。

优先查看的兼容模型

按下载量与模型热度排序,首屏只展示 12 个,完整结果可继续筛选。

查看全部 32 个 →
AI MODEL01 / ♥ 0

gemma-4-12B-coder-fable5-composer2.5-v1-GGUF:本地Python算法推理编码助手

基于Gemma 4 12B针对可验证Python与算法题微调的本地代码模型,融合Composer 2.5真实与Fable 5合成思维链数据蒸馏,最大256K上下文。适合希望离线私有编码助手、显存或内存约4.5GB起步的个人开发者与学习者使用。

Python代码助手本地大模型推理链CoT
模型源更新
最低显存
3.5 GB
最小文件
2.8 GB
AI MODEL01 / ♥ 0

MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF:1B 本地思考模型工具调用增强版

基于 MiniCPM5-1B 的 1B 参数本地化文本生成模型,V2 版本相比 V1 强化工具调用与函数调用能力,支持思考模式推理与最长 128K 上下文,兼顾中英文对话、代码生成和指令跟随。适合想要在笔记本或低显存设备上本地跑一个能调用工具、能写代码的小模型的用户。

本地 1B 小模型工具调用思考模式
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-GGUF:27B多模态推理与代理任务密集模型

Qwen3.8-27B-GGUF 是 27B 参数的原生视觉语言密集模型,支持图像与视频理解,擅长编码、专业写作、研究与长链路代理任务;原生上下文 262144 tokens,可经 RoPE 扩展至 1000000 tokens。思考模式默认开启且可按请求关闭,并支持工具调用与多 token 预测。

多模态长上下文代理任务
模型源更新
最低显存
3.5 GB
最小文件
3.1 GB
AI MODEL01 / ♥ 0

MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:本地1B轻量思维链代码模型

面向本地部署的 1B 参数轻量文本生成模型,基于 MiniCPM5-1B 在 Fable 5 数据上微调,支持思维链推理、代码生成与指令跟随,上下文最长 128K tokens。适合硬件受限、需要离线跑思维链问答或编程任务的个人开发者,最低 4GB 内存即可加载 Q4 量化版本,无需高端显卡。

1B轻量模型本地代码助手思维链推理
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL01 / ♥ 0

gemma-4-12b-it-GGUF:本地多模态对话与推理

由 Unsloth 发布的 Gemma 4 12B 指令微调量化版本,支持文本、图像和音频输入并输出文本,适合在消费级显卡或笔记本上做多模态对话、推理、编码与 OCR 任务。预训练覆盖 140 多种语言,长上下文可达 256K。

多模态长上下文本地部署
模型源更新
最低显存
3.5 GB
最小文件
2.8 GB
AI MODEL01 / ♥ 0

DeepSeek-V4-Pro-Qwen3.5-9B-MTP-GGUF:数学与理工推理的 9B 蒸馏

DeepSeek-V4-Pro-Qwen3.5-9B-MTP-GGUF 是基于 Qwen3.5-9B 的 9B 参数推理模型,由 DeepSeek-V4-Pro Max Effect 模式教师数据蒸馏,约 25 万数学与 STEM 样本完成 SFT 与 GSPO 强化学习。

数学推理理工蒸馏轻量部署
模型源更新
最低显存
2.5 GB
最小文件
2.1 GB
AI MODEL01 / ♥ 0

VibeVoice-ASR-BitNet:边缘CPU实时多语种语音转写模型

VibeVoice-ASR-BitNet 是微软推出的 2.8B 参数语音识别压缩版本,主打边缘CPU实时推理,无需独立显卡。它把原始模型从 4.62 GB 压到约 1.58 GB,模型卡显示 CPU 上比 Whisper.cpp 快 1.6 到 2.3 倍,支持中英法意韩葡越等多语种转写。

语音转文字多语种 ASRCPU 推理
模型源更新
最低显存
2 GB
最小文件
1.6 GB
AI MODEL01 / ♥ 0

Dolphin3-Cyber-8B-GGUF:网络安全攻防专精的本地化8B模型

基于Llama 3.1的8B网络安全垂直模型,主打攻防渗透、漏洞研究、利用开发与防御加固,已移除对齐限制,支持全本地离线推理。GGUF量化梯度从Q2_K到F16共十余档,最低3.18GB即可加载,适合安全工程师、CTF选手与红蓝队研究员。需要消费级或专业级显卡,无联网能力,知识截至基座训练时间。

网络安全渗透测试本地推理
模型源更新
最低显存
2.5 GB
最小文件
1.9 GB
AI MODEL01 / ♥ 0

MiniCPM5-1B-Agentic-Tooluse-GGUF:轻量代理工具调用小模型

这是基于 openbmb MiniCPM5-1B、经 Nemotron SFT+DPO 修复微调后的 1B 参数代理工具调用模型,提供 F16、Q8_0、Q4_K_M 三档 GGUF 量化。适合想在本地或边缘设备上做 AI 代理、需要模型按 XML 函数块格式稳定选择并调用工具的开发者与研究者。

工具调用代理轻量小模型本地运行
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL01 / ♥ 0

Nanbeige4.2-3B-GGUF:3B参数中文轻量对话量化

Nanbeige4.2-3B-GGUF 是基于 Nanbeige4.2-3B 的 GGUF 量化合集,参数规模 3B,支持中英文文本生成。提供 Q2 到 Q8 共 8 档量化,适合硬件资源有限的本地用户。极小文件 Q2/Q3 适合老旧设备与最低 4GB 内存环境;Q5/Q6/Q8 保留更多质量但需要 3GB 以上显存。

中文对话小模型GGUF 量化
模型源更新
最低显存
1 GB
最小文件
0.7 GB
AI MODEL01 / ♥ 0

MiniCPM5-2B-GGUF:本地可跑的2B长上下文中文助手

MiniCPM5-2B-GGUF 是面壁智能开源的2B参数稠密 Transformer GGUF 量化仓库,主打本地部署、端侧推理与资源受限场景。原生支持 131K 长上下文,覆盖代码、数学、工具调用与智能体任务。

本地中文助手2B轻量模型长上下文
模型源更新
最低显存
1.5 GB
最小文件
1.2 GB
AI MODEL01 / ♥ 0

TwIL-LM3:3B参数形式逻辑推理专用模型

TwIL-LM3 是基于 SmolLM3-3B 微调的 3B 参数形式逻辑推理模型,专注一阶逻辑翻译、蕴涵判定、语义解析、Lean 形式化与证明评审等结构化任务。适合需要机器可读符号化推理输出的研究者与本地推理开发者,硬件门槛低,Q4_K_M 量化可在 4GB 显存或纯 CPU 起步。

形式逻辑推理模型小模型
模型源更新
最低显存
2 GB
最小文件
1.8 GB

常见问题

GTX 1650 4GB 能运行哪些本地 AI 模型?

当前数据库中有 32 个模型至少存在一个估算可在 4GB 显存内加载的版本,其中 23 个存在推荐显存不超过该设备容量的量化版本。

4GB 显存应该选择什么量化?

适合小参数模型、极低量化版本和轻量语音或文本任务。优先选择推荐显存低于设备容量的版本;只有最低显存满足时,应缩短上下文并减少 GPU Offload 或并发。

最低显存和推荐显存有什么区别?

最低显存接近模型能够加载的下限,推荐显存会为运行框架、上下文 KV Cache 和系统占用保留余量。接近下限并不等于能稳定高负载运行。