LALocal model compatibility lab / build 02

你的设备能运行哪些 AI 模型?

输入显存与任务,先筛出能运行的量化版本,再通过中文模型定位、适用场景、量化建议和限制判断它是否真的适合你。

Input profile

创建硬件配置

01 / 02

VRAM envelope

8 GB 兼容区间

8.0
GB available
4
8
12
16
24
32
48
7B · Q4
8B · Q4
32B · WAIT
Runtimellama.cpp
QuantQ4_K_M
Headroom12%
A
已收录模型
118
来自公开模型仓库
B
量化文件
711
自动估算显存与内存
C
硬件档案
9
覆盖主流显卡与 Apple 芯片
02

MODEL LIBRARY / CURATED

热门本地模型

不只比较文件体积,也解释模型用途、适用人群、运行入口和采用门槛。

浏览模型库 →
AI MODEL01 / ♥ 0

Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP:去审查多模态长文推理与创作

基于 Google Gemma 4 26B-A4B 的去审查微调版本,26B 总参数配 4B 激活 MoE 架构,原生支持 256K 上下文与图像输入。适合需要开放式回答的智能体编程、创意写作、角色扮演与长文档推理用户,建议单卡约 16 GB 显存或 18.5 GB 内存起步,搭配 MTP 草稿头可在 llama.

多模态长上下文MoE 去审查智能体编程
模型源更新
最低显存
13.5 GB
最小文件
12 GB
AI MODEL02 / ♥ 0

gemma-4-12B-coder-fable5-composer2.5-v1-GGUF:本地Python算法推理编码助手

基于Gemma 4 12B针对可验证Python与算法题微调的本地代码模型,融合Composer 2.5真实与Fable 5合成思维链数据蒸馏,最大256K上下文。适合希望离线私有编码助手、显存或内存约4.5GB起步的个人开发者与学习者使用。

Python代码助手本地大模型推理链CoT
模型源更新
最低显存
3.5 GB
最小文件
2.8 GB
AI MODEL03 / ♥ 0

Ornith-1.0-35B-GGUF:开源代理编码轻量模型

Ornith-1.0-35B-GGUF 是 35B 参数的代理编码开源模型,专注代码生成、工具调用与终端代理任务。模型采用自改进 RL 训练框架,适合本地搭建编程代理或 IDE 助手的开发者与研究人员。Q4_K_M 量化最低约需 18GB 显存或 20.

代理编码工具调用代码生成
模型源更新
最低显存
18 GB
最小文件
16 GB
AI MODEL04 / ♥ 0

Qwen-AgentWorld-35B-A3B-GGUF:智能体环境模拟世界模型

Qwen-AgentWorld-35B-A3B 是原生语言世界模型,专注智能体环境模拟,覆盖 MCP 工具调用、搜索、终端、SWE、Android、Web、OS 七个交互域,通过长链思维推理预测下一环境状态。适合智能体框架研究者、AgentWorldBench 评测用户及多工具调用 Agent 系统开发者使用。

世界模型智能体环境模拟Agent 评测
模型源更新
最低显存
9 GB
最小文件
8.1 GB
AI MODEL05 / ♥ 0

gemma-4-26B-A4B-it-GGUF:本地推理多模态MoE对话模型

Google Gemma 4 26B A4B 是 MoE 架构的多模态模型,总参数 26B、激活约 4B,支持文本与图像输入、文本输出,256K 上下文窗口,覆盖 140 多种语言。适合在消费级 GPU 或工作站做本地对话、代码、推理与图文理解。Apache 2.

多模态对话本地推理图文理解
模型源更新
最低显存
7 GB
最小文件
6.1 GB
AI MODEL06 / ♥ 0

MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF:1B 本地思考模型工具调用增强版

基于 MiniCPM5-1B 的 1B 参数本地化文本生成模型,V2 版本相比 V1 强化工具调用与函数调用能力,支持思考模式推理与最长 128K 上下文,兼顾中英文对话、代码生成和指令跟随。适合想要在笔记本或低显存设备上本地跑一个能调用工具、能写代码的小模型的用户。

本地 1B 小模型工具调用思考模式
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL07 / ♥ 0

Qwen3.8-27B-GGUF:27B多模态推理与代理任务密集模型

Qwen3.8-27B-GGUF 是 27B 参数的原生视觉语言密集模型,支持图像与视频理解,擅长编码、专业写作、研究与长链路代理任务;原生上下文 262144 tokens,可经 RoPE 扩展至 1000000 tokens。思考模式默认开启且可按请求关闭,并支持工具调用与多 token 预测。

多模态长上下文代理任务
模型源更新
最低显存
3.5 GB
最小文件
3.1 GB
AI MODEL08 / ♥ 0

Qwen3.5-9B-Uncensored-HauhauCS-Aggressive:9B多模态去审查对话模型

基于Qwen3.5-9B的9B参数混合架构模型,采用线性注意力与全注意力3:1组合,作者称移除安全审查并保留原始多模态能力,支持文本、图像、视频输入及原生262K上下文。适合需要无限制生成的中文及多语言用户,需2026年3月后较新llama.cpp版本。Q4_K_M量化推荐8GB内存,Q8需13GB以上。

多模态对话去审查长上下文
模型源更新
最低显存
5 GB
最小文件
4.2 GB