NVIDIA · GPU
RTX 5090 32GB 能运行哪些本地 AI 模型?
RTX 5090 32GB 提供更大的本地推理空间,适合更高质量量化、长上下文和复杂多模态工作流。选择模型时仍需为 KV Cache、并发和桌面系统留出容量,并检查运行框架是否已针对新架构完成优化。 适合更大模型、更长上下文和更高 GPU Offload 比例,但仍需为系统与 KV Cache 预留空间。下面的结果按公开模型文件体积估算,适合作为选型起点,不替代目标设备实测。
先看结论
当前共有 100 个模型存在最低显存不超过 32GB 的版本;其中 100 个模型的推荐显存也在容量内,适合优先尝试。
阅读 24GB 显存完整选型指南 →RTX 5090 32GB 选模型时看什么?
先看推荐显存
推荐显存不超过设备容量时,通常更容易为运行框架和上下文保留余量。
再看量化质量
Q4 常用于质量与体积平衡;IQ2、Q2 更省显存,但需要接受更明显的能力损失。
最后看任务
编程、长文本、多模态和图像生成的资源需求不同,不要只按参数量判断。
优先查看的兼容模型
按下载量与模型热度排序,首屏只展示 12 个,完整结果可继续筛选。
gemma-4-12B-it-qat-GGUF:12B多模态本地量化指令版
Gemma 4 12B 统一架构指令调优版本,支持文本、图像与音频输入,输出仅文本,原生 256K 上下文,内置可配置思考模式与原生函数调用。Unsloth 提供 QAT 量化 GGUF 并附带 MTP 投机解码草稿模型,兼容 llama.cpp、Ollama 与 LM Studio。
Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP:去审查多模态长文推理与创作
基于 Google Gemma 4 26B-A4B 的去审查微调版本,26B 总参数配 4B 激活 MoE 架构,原生支持 256K 上下文与图像输入。适合需要开放式回答的智能体编程、创意写作、角色扮演与长文档推理用户,建议单卡约 16 GB 显存或 18.5 GB 内存起步,搭配 MTP 草稿头可在 llama.
gemma-4-12B-coder-fable5-composer2.5-v1-GGUF:本地Python算法推理编码助手
基于Gemma 4 12B针对可验证Python与算法题微调的本地代码模型,融合Composer 2.5真实与Fable 5合成思维链数据蒸馏,最大256K上下文。适合希望离线私有编码助手、显存或内存约4.5GB起步的个人开发者与学习者使用。
Ornith-1.0-35B-GGUF:开源代理编码轻量模型
Ornith-1.0-35B-GGUF 是 35B 参数的代理编码开源模型,专注代码生成、工具调用与终端代理任务。模型采用自改进 RL 训练框架,适合本地搭建编程代理或 IDE 助手的开发者与研究人员。Q4_K_M 量化最低约需 18GB 显存或 20.
Qwen-AgentWorld-35B-A3B-GGUF:智能体环境模拟世界模型
Qwen-AgentWorld-35B-A3B 是原生语言世界模型,专注智能体环境模拟,覆盖 MCP 工具调用、搜索、终端、SWE、Android、Web、OS 七个交互域,通过长链思维推理预测下一环境状态。适合智能体框架研究者、AgentWorldBench 评测用户及多工具调用 Agent 系统开发者使用。
gemma-4-26B-A4B-it-GGUF:本地推理多模态MoE对话模型
Google Gemma 4 26B A4B 是 MoE 架构的多模态模型,总参数 26B、激活约 4B,支持文本与图像输入、文本输出,256K 上下文窗口,覆盖 140 多种语言。适合在消费级 GPU 或工作站做本地对话、代码、推理与图文理解。Apache 2.
MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF:1B 本地思考模型工具调用增强版
基于 MiniCPM5-1B 的 1B 参数本地化文本生成模型,V2 版本相比 V1 强化工具调用与函数调用能力,支持思考模式推理与最长 128K 上下文,兼顾中英文对话、代码生成和指令跟随。适合想要在笔记本或低显存设备上本地跑一个能调用工具、能写代码的小模型的用户。
Qwen3.8-27B-GGUF:27B多模态推理与代理任务密集模型
Qwen3.8-27B-GGUF 是 27B 参数的原生视觉语言密集模型,支持图像与视频理解,擅长编码、专业写作、研究与长链路代理任务;原生上下文 262144 tokens,可经 RoPE 扩展至 1000000 tokens。思考模式默认开启且可按请求关闭,并支持工具调用与多 token 预测。
Qwen3.5-9B-Uncensored-HauhauCS-Aggressive:9B多模态去审查对话模型
基于Qwen3.5-9B的9B参数混合架构模型,采用线性注意力与全注意力3:1组合,作者称移除安全审查并保留原始多模态能力,支持文本、图像、视频输入及原生262K上下文。适合需要无限制生成的中文及多语言用户,需2026年3月后较新llama.cpp版本。Q4_K_M量化推荐8GB内存,Q8需13GB以上。
Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF:无审查全能创作与编程模型
该模型为 40B 稠密参数文本生成模型,由 Qwen3.6-27B 扩参训练而来,强调无审查、创作与编程能力,原生支持 256K 上下文与视觉输入。适合追求长篇创意写作、角色扮演、复杂代码生成与多轮深度对话的用户。最低运行门槛约 10.
Qwopus3.6-35B-A3B-Coder-MTP-GGUF:思考关闭的本地编码代理模型
基于 Qwen3.6-35B-A3B 的稀疏 MoE 编码微调模型,总参数 35B、激活约 3B,专为关闭长思考的代理式编码流程设计,擅长多轮工具调用、仓库级调试与多文件补丁生成。
Flux2-Klein-9B-True-V3:9B 文本生图与指令编辑模型
基于 FLUX.2-klein-9B 微调的 9B 文本生成图像模型,支持纯提示词图像编辑、LoRA 换脸换装及 Mask 区域精准编辑,V3 版本在美学与构图上有明显改进。适合需要本地部署文生图或图像编辑工作流的中文用户与 AIGC 创作者。
常见问题
RTX 5090 32GB 能运行哪些本地 AI 模型?
当前数据库中有 100 个模型至少存在一个估算可在 32GB 显存内加载的版本,其中 100 个存在推荐显存不超过该设备容量的量化版本。
32GB 显存应该选择什么量化?
适合更大模型、更长上下文和更高 GPU Offload 比例,但仍需为系统与 KV Cache 预留空间。优先选择推荐显存低于设备容量的版本;只有最低显存满足时,应缩短上下文并减少 GPU Offload 或并发。
最低显存和推荐显存有什么区别?
最低显存接近模型能够加载的下限,推荐显存会为运行框架、上下文 KV Cache 和系统占用保留余量。接近下限并不等于能稳定高负载运行。