你的设备能运行哪些 AI 模型?
输入显存与任务,先筛出能运行的量化版本,再通过中文模型定位、适用场景、量化建议和限制判断它是否真的适合你。
VRAM envelope
8 GB 兼容区间
MODEL LIBRARY / CURATED
热门本地模型
不只比较文件体积,也解释模型用途、适用人群、运行入口和采用门槛。
Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP:去审查多模态长文推理与创作
基于 Google Gemma 4 26B-A4B 的去审查微调版本,26B 总参数配 4B 激活 MoE 架构,原生支持 256K 上下文与图像输入。适合需要开放式回答的智能体编程、创意写作、角色扮演与长文档推理用户,建议单卡约 16 GB 显存或 18.5 GB 内存起步,搭配 MTP 草稿头可在 llama.
gemma-4-12B-coder-fable5-composer2.5-v1-GGUF:本地Python算法推理编码助手
基于Gemma 4 12B针对可验证Python与算法题微调的本地代码模型,融合Composer 2.5真实与Fable 5合成思维链数据蒸馏,最大256K上下文。适合希望离线私有编码助手、显存或内存约4.5GB起步的个人开发者与学习者使用。
Ornith-1.0-35B-GGUF:开源代理编码轻量模型
Ornith-1.0-35B-GGUF 是 35B 参数的代理编码开源模型,专注代码生成、工具调用与终端代理任务。模型采用自改进 RL 训练框架,适合本地搭建编程代理或 IDE 助手的开发者与研究人员。Q4_K_M 量化最低约需 18GB 显存或 20.
Qwen-AgentWorld-35B-A3B-GGUF:智能体环境模拟世界模型
Qwen-AgentWorld-35B-A3B 是原生语言世界模型,专注智能体环境模拟,覆盖 MCP 工具调用、搜索、终端、SWE、Android、Web、OS 七个交互域,通过长链思维推理预测下一环境状态。适合智能体框架研究者、AgentWorldBench 评测用户及多工具调用 Agent 系统开发者使用。
gemma-4-26B-A4B-it-GGUF:本地推理多模态MoE对话模型
Google Gemma 4 26B A4B 是 MoE 架构的多模态模型,总参数 26B、激活约 4B,支持文本与图像输入、文本输出,256K 上下文窗口,覆盖 140 多种语言。适合在消费级 GPU 或工作站做本地对话、代码、推理与图文理解。Apache 2.
MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF:1B 本地思考模型工具调用增强版
基于 MiniCPM5-1B 的 1B 参数本地化文本生成模型,V2 版本相比 V1 强化工具调用与函数调用能力,支持思考模式推理与最长 128K 上下文,兼顾中英文对话、代码生成和指令跟随。适合想要在笔记本或低显存设备上本地跑一个能调用工具、能写代码的小模型的用户。
Qwen3.8-27B-GGUF:27B多模态推理与代理任务密集模型
Qwen3.8-27B-GGUF 是 27B 参数的原生视觉语言密集模型,支持图像与视频理解,擅长编码、专业写作、研究与长链路代理任务;原生上下文 262144 tokens,可经 RoPE 扩展至 1000000 tokens。思考模式默认开启且可按请求关闭,并支持工具调用与多 token 预测。
Qwen3.5-9B-Uncensored-HauhauCS-Aggressive:9B多模态去审查对话模型
基于Qwen3.5-9B的9B参数混合架构模型,采用线性注意力与全注意力3:1组合,作者称移除安全审查并保留原始多模态能力,支持文本、图像、视频输入及原生262K上下文。适合需要无限制生成的中文及多语言用户,需2026年3月后较新llama.cpp版本。Q4_K_M量化推荐8GB内存,Q8需13GB以上。