MODEL DECISION LIBRARY

先看懂模型,再决定下载哪个量化。

模型名和参数量不能直接回答“适不适合我”。这里同时整理中文用途、模型卡依据、硬件估算、运行入口和已知限制。

找到 32 个模型清除筛选
AI MODEL01 / ♥ 0

gemma-4-12B-coder-fable5-composer2.5-v1-GGUF:本地Python算法推理编码助手

基于Gemma 4 12B针对可验证Python与算法题微调的本地代码模型,融合Composer 2.5真实与Fable 5合成思维链数据蒸馏,最大256K上下文。适合希望离线私有编码助手、显存或内存约4.5GB起步的个人开发者与学习者使用。

Python代码助手本地大模型推理链CoT
模型源更新
最低显存
3.5 GB
最小文件
2.8 GB
AI MODEL01 / ♥ 0

MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF:1B 本地思考模型工具调用增强版

基于 MiniCPM5-1B 的 1B 参数本地化文本生成模型,V2 版本相比 V1 强化工具调用与函数调用能力,支持思考模式推理与最长 128K 上下文,兼顾中英文对话、代码生成和指令跟随。适合想要在笔记本或低显存设备上本地跑一个能调用工具、能写代码的小模型的用户。

本地 1B 小模型工具调用思考模式
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-GGUF:27B多模态推理与代理任务密集模型

Qwen3.8-27B-GGUF 是 27B 参数的原生视觉语言密集模型,支持图像与视频理解,擅长编码、专业写作、研究与长链路代理任务;原生上下文 262144 tokens,可经 RoPE 扩展至 1000000 tokens。思考模式默认开启且可按请求关闭,并支持工具调用与多 token 预测。

多模态长上下文代理任务
模型源更新
最低显存
3.5 GB
最小文件
3.1 GB
AI MODEL01 / ♥ 0

MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:本地1B轻量思维链代码模型

面向本地部署的 1B 参数轻量文本生成模型,基于 MiniCPM5-1B 在 Fable 5 数据上微调,支持思维链推理、代码生成与指令跟随,上下文最长 128K tokens。适合硬件受限、需要离线跑思维链问答或编程任务的个人开发者,最低 4GB 内存即可加载 Q4 量化版本,无需高端显卡。

1B轻量模型本地代码助手思维链推理
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL01 / ♥ 0

gemma-4-12b-it-GGUF:本地多模态对话与推理

由 Unsloth 发布的 Gemma 4 12B 指令微调量化版本,支持文本、图像和音频输入并输出文本,适合在消费级显卡或笔记本上做多模态对话、推理、编码与 OCR 任务。预训练覆盖 140 多种语言,长上下文可达 256K。

多模态长上下文本地部署
模型源更新
最低显存
3.5 GB
最小文件
2.8 GB
AI MODEL01 / ♥ 0

DeepSeek-V4-Pro-Qwen3.5-9B-MTP-GGUF:数学与理工推理的 9B 蒸馏

DeepSeek-V4-Pro-Qwen3.5-9B-MTP-GGUF 是基于 Qwen3.5-9B 的 9B 参数推理模型,由 DeepSeek-V4-Pro Max Effect 模式教师数据蒸馏,约 25 万数学与 STEM 样本完成 SFT 与 GSPO 强化学习。

数学推理理工蒸馏轻量部署
模型源更新
最低显存
2.5 GB
最小文件
2.1 GB
AI MODEL01 / ♥ 0

VibeVoice-ASR-BitNet:边缘CPU实时多语种语音转写模型

VibeVoice-ASR-BitNet 是微软推出的 2.8B 参数语音识别压缩版本,主打边缘CPU实时推理,无需独立显卡。它把原始模型从 4.62 GB 压到约 1.58 GB,模型卡显示 CPU 上比 Whisper.cpp 快 1.6 到 2.3 倍,支持中英法意韩葡越等多语种转写。

语音转文字多语种 ASRCPU 推理
模型源更新
最低显存
2 GB
最小文件
1.6 GB
AI MODEL01 / ♥ 0

Dolphin3-Cyber-8B-GGUF:网络安全攻防专精的本地化8B模型

基于Llama 3.1的8B网络安全垂直模型,主打攻防渗透、漏洞研究、利用开发与防御加固,已移除对齐限制,支持全本地离线推理。GGUF量化梯度从Q2_K到F16共十余档,最低3.18GB即可加载,适合安全工程师、CTF选手与红蓝队研究员。需要消费级或专业级显卡,无联网能力,知识截至基座训练时间。

网络安全渗透测试本地推理
模型源更新
最低显存
2.5 GB
最小文件
1.9 GB
AI MODEL01 / ♥ 0

MiniCPM5-1B-Agentic-Tooluse-GGUF:轻量代理工具调用小模型

这是基于 openbmb MiniCPM5-1B、经 Nemotron SFT+DPO 修复微调后的 1B 参数代理工具调用模型,提供 F16、Q8_0、Q4_K_M 三档 GGUF 量化。适合想在本地或边缘设备上做 AI 代理、需要模型按 XML 函数块格式稳定选择并调用工具的开发者与研究者。

工具调用代理轻量小模型本地运行
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL01 / ♥ 0

Nanbeige4.2-3B-GGUF:3B参数中文轻量对话量化

Nanbeige4.2-3B-GGUF 是基于 Nanbeige4.2-3B 的 GGUF 量化合集,参数规模 3B,支持中英文文本生成。提供 Q2 到 Q8 共 8 档量化,适合硬件资源有限的本地用户。极小文件 Q2/Q3 适合老旧设备与最低 4GB 内存环境;Q5/Q6/Q8 保留更多质量但需要 3GB 以上显存。

中文对话小模型GGUF 量化
模型源更新
最低显存
1 GB
最小文件
0.7 GB
AI MODEL01 / ♥ 0

MiniCPM5-2B-GGUF:本地可跑的2B长上下文中文助手

MiniCPM5-2B-GGUF 是面壁智能开源的2B参数稠密 Transformer GGUF 量化仓库,主打本地部署、端侧推理与资源受限场景。原生支持 131K 长上下文,覆盖代码、数学、工具调用与智能体任务。

本地中文助手2B轻量模型长上下文
模型源更新
最低显存
1.5 GB
最小文件
1.2 GB
AI MODEL01 / ♥ 0

TwIL-LM3:3B参数形式逻辑推理专用模型

TwIL-LM3 是基于 SmolLM3-3B 微调的 3B 参数形式逻辑推理模型,专注一阶逻辑翻译、蕴涵判定、语义解析、Lean 形式化与证明评审等结构化任务。适合需要机器可读符号化推理输出的研究者与本地推理开发者,硬件门槛低,Q4_K_M 量化可在 4GB 显存或纯 CPU 起步。

形式逻辑推理模型小模型
模型源更新
最低显存
2 GB
最小文件
1.8 GB
AI MODEL01 / ♥ 0

Bonsai-27B-gguf:27B模型一比特极限压缩本地可跑

本仓库是prism-ml基于Qwen3.6-27B的1比特二值化GGUF量化版本,把27B参数混合注意力模型压到约3.9GB(每权重1.125bit),主打长文本对话、代码生成与本地离线推理。适合在普通笔记本、单卡GPU或手机上跑27B级模型的用户,最低约4GB内存即可加载主语言模型,附带视觉塔可处理图像输入。

1比特大模型27B本地推理长上下文
模型源更新
最低显存
3.5 GB
最小文件
3.1 GB
AI MODEL01 / ♥ 0

Agents-A1-4B-Q8_0-GGUF:4B 视觉智能体本地小钢炮

Agents-A1-4B-Q8_0-GGUF 是 InternScience 开源的 4B 视觉语言 Agent 模型,专注长程搜索、工具调用与多约束指令遵循,附带 mmproj GGUF 支持图文输入。Q8_0 主文件约 4GB,最低 5GB 内存或 4.5GB 显存,推荐 8GB 内存或 5.5GB 显存。

视觉智能体工具调用长程推理
模型源更新
最低显存
3 GB
最小文件
2.3 GB
AI MODEL01 / ♥ 0

Qwen3.6-14B-A3B-FableVibes-GGUF:14B推理蒸馏的消费级长思维模型

Qwen3.6-14B-A3B-FableVibes 由 Qwen3.6-35B-A3B 经 REAP 剪枝到 14B 活跃参数,再用 Claude Fable 5 推理痕迹做 QLoRA 蒸馏得到。回答前会输出思考 token,适合中文写作、编程与多步规划。Q3_K_M 至 Q4_K_M 即可在消费级显存上跑通。

通用推理长思维链多模态
模型源更新
最低显存
4 GB
最小文件
3.3 GB
AI MODEL01 / ♥ 0

LFM2.5-2.6B-GGUF:本地部署的多语言轻量文本生成模型

LFM2.5-2.6B-GGUF 是 LiquidAI 推出的 2.6B 参数混合架构模型,专为设备端部署设计,支持中文在内的十余种语言文本生成。适合想在笔记本、低配台式机或边缘设备上离线运行轻量语言模型的用户,最低 4GB 内存即可加载 Q4 量化版本,对独立显卡依赖较低。

本地部署轻量文本生成边缘设备
模型源更新
最低显存
1.5 GB
最小文件
1.2 GB
AI MODEL01 / ♥ 0

nemotron-3.5-asr-streaming-0.6b:0.6B 参数多语种流式语音转文字模型

NVIDIA 推出的 0.6B 参数多语种流式语音识别模型,基于缓存感知 FastConformer-RNNT 架构,原生支持 40 种语言-地区转录,可配置 80 毫秒到 1120 毫秒分块以在延迟与精度间权衡。适合需要多语种实时字幕、语音代理、跨语种转写或多语种批量转录的开发者与团队,输出自带大小写与标点。

多语种语音识别流式 ASR语音转文字
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL01 / ♥ 0

Supra2-100M-Instruct:百兆参数实验型英文对话模型

基于 Qwen3 架构的 100M 参数英文指令模型,仅 2K 上下文,提供 F16 GGUF(约 62.5MB)。适合低配置设备尝鲜轻量文本生成或研究小模型行为的开发者与爱好者。不适合需要事实准确性或多轮复杂推理的生产场景。

轻量英文对话超小参数模型Qwen3 衍生
模型源更新
最低显存
1 GB
最小文件
0.1 GB
AI MODEL01 / ♥ 0

TIPOv2-1B-A200M:文生图提示词扩写专家

TIPOv2-1B-A200M 是一个 1B 总参数、每 token 仅激活约 200M 的稀疏 MoE 模型,专门把用户输入的简短提示词扩写为更详细的长描述,供 Stable Diffusion 等文生图扩散模型使用。

文生图提示词提示词扩写Danbooru 标签
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL01 / ♥ 0

NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF:30B MoE混合架构多语言推理底座

30B 总参数、3B 激活的 NVIDIA 混合架构模型,结合 Mamba-2、MoE 与 Attention 层,支持长上下文与工具调用。仓库提供 IQ1 到 Q8 多档 GGUF 量化,IQ1 最低约 4GB 显存即可加载,桌面显卡也能尝试低比特版本。

MoE混合架构多语言推理长上下文
模型源更新
最低显存
4 GB
最小文件
3.5 GB
AI MODEL01 / ♥ 0

LFM2.5-VL-3B-GGUF:面向端侧的3B视觉语言多模态模型

LFM2.5-VL-3B-GGUF 是 LiquidAI 发布的 3B 参数视觉语言模型,采用混合架构主打边缘与端侧部署,支持图片加文本输入并覆盖十余种语言。适合需要在本地设备上做图像问答、视觉理解的开发者与个人用户,最小仅需 4GB 内存即可加载 Q4 量化,适合笔记本、迷你主机等资源受限场景。

多模态视觉问答端侧部署
模型源更新
最低显存
2 GB
最小文件
1.7 GB
AI MODEL01 / ♥ 0

nl2sh-1.5b-Q4_K_M:英文需求转单条Shell命令

基于 Qwen2.5-Coder-1.5B-Instruct 用 1.5B 参数底座配合 LoRA 微调并合并权重,专把一句英文需求翻译成单条 Bash 命令。约 941 MB,CPU 即可加载,约一秒返回。适合需要在本地终端把自然语言随手转成命令、又不想上云的用户。门槛低,普通笔记本就能跑。

命令生成Shell助手轻量本地
模型源更新
最低显存
1 GB
最小文件
0.7 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-GGUF:支持图像理解的多模态对话量化版

基于Qwen3.8-27B的多模态对话模型量化版本,支持图像理解与文本生成,原生提供思维链开关。提供从IQ1到Q8_0十余种量化文件与独立视觉投影组件,最低约3.5GB显存可启动小量化,但完整能力需中高端显存。适合具备中高显卡配置、想在本地运行视觉对话与推理任务的用户。

多模态对话视觉理解长上下文
模型源更新
最低显存
3.5 GB
最小文件
3.1 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF:去审查27B长文本生成模型

基于Qwen3.8-27B双轮ARA去审查的27B参数文本生成模型,采用Gated DeltaNet混合架构支持262K上下文。适合追求低过滤创意写作、长篇角色扮演和成人向内容研究的用户,需较高显存,最低建议16GB内存跑Q4量化,24GB显卡可获得更佳体验。

去审查大模型27B长上下文角色扮演写作
模型源更新
最低显存
3.5 GB
最小文件
3.1 GB
AI MODEL01 / ♥ 0

Qwen3.8-4B-Distill-GGUF:4B 蒸馏推理模型量化包

Qwen3.8-4B-Distill 是把 Qwen3.8 2.4T A95B 大模型蒸馏到 Qwen3.5-4B 架构而来的 4B 参数推理模型,本仓库为 GGUF 量化版。适合想在消费级硬件上本地跑推理模型、又不愿承担大模型显存开销的用户。属于 Qwen3.

4B 蒸馏推理GGUF 量化本地部署
模型源更新
最低显存
2.5 GB
最小文件
1.9 GB
AI MODEL01 / ♥ 0

Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF:9B 参数去审查指令强化 GGUF 量化包

基于 Qwen3.5-9B 的多阶段微调与合并版本,主打指令遵循与通用智能提升,并移除拒绝行为,属于去审查类(Heretic)文本生成模型,同时支持视觉理解,需额外下载 mmproj 文件。

去审查模型长上下文视觉多模态
模型源更新
最低显存
2.5 GB
最小文件
2.1 GB
AI MODEL01 / ♥ 0

Qwen3.8-2B-Distill-GGUF:手机可跑的 2B 蒸馏推理量化版

该仓库是 empero-ai/Qwen3.8-2B 的官方 GGUF 量化合集,对应 2B 参数的蒸馏推理模型,主打文本生成与思考型回答。适合想在手机、单板机、轻薄本上离线运行轻量对话的中文及英文用户,CPU 即可起步。Q4 量化约 1.3 GB,本地门槛低。注意需较新 llama.cpp 以支持 Qwen3.

边缘推理轻量聊天GGUF 量化
模型源更新
最低显存
1.5 GB
最小文件
1.2 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-Unleashed-GGUF:去审查27B长文本生成

基于 Qwen3.8-27B 的去审查 GGUF 版本,采用按张量动态比特分配(Unsloth Dynamic 3.0 配方),共 9 个档位。基础为 27B 混合 DeltaNet(65 层仅 17 层全注意力),支持 262k 上下文与视觉。推荐 UD-Q3_K_XL(13.

长文本生成去审查大模型Qwen3.8量化
模型源更新
最低显存
3.5 GB
最小文件
3.1 GB
AI MODEL01 / ♥ 0

Ornith-1.5-9B-GGUF:9B视觉对话模型量化合集

Ornith-1.5-9B-GGUF 是带视觉理解的 9B 参数对话与智能体编码模型的本地 GGUF 量化仓库,由 AtomicChat 基于自研重要性矩阵调优多档位布局。适合想本地跑多模态对话、图像识别、长上下文问答与代码助手的用户。

多模态对话视觉理解智能体编码
模型源更新
最低显存
2.5 GB
最小文件
2.1 GB
AI MODEL01 / ♥ 0

Spark-X2.5-4B-GGUF:轻量通用对话与写作本地模型

Spark-X2.5-4B-GGUF 是 4B 参数的紧凑型通用语言模型量化版本,支持对话、写作、翻译、推理、编码、工具调用与智能体工作流。采用混合注意力架构,原生上下文可达 1M 词元,覆盖 200 余种语言。

通用对话本地推理长上下文
模型源更新
最低显存
2.5 GB
最小文件
1.9 GB
AI MODEL01 / ♥ 0

LFM2.5-2.6B-DSpark-GGUF:2.6B目标专用投机解码草稿

这是 LiquidAI 为 LFM2.5-2.6B 目标模型发布的 GGUF 投机解码草稿侧车,必须配合 LFM2.5-2.6B-GGUF 目标文件共同使用。草稿侧车仅含 5 层注意力、rank-256 Markov 头与置信头,块大小 9,加载时共享目标模型的嵌入和 LM 头,因此体积远小于常规同参数量模型。

投机解码草稿llama.cpp 加速LFM2 2.6B 推理
模型源更新
最低显存
1.5 GB
最小文件
1.2 GB
AI MODEL01 / ♥ 0

Ornith-1.5-9B-OBLITERATED:移除安全层的9B文本生成

Ornith-1.5-9B-OBLITERATED 是 Ornith-1.5-9B 的去安全对齐版本,基于 Qwen3.5 混合架构,含 9B 参数与视觉编码器。面向研究、红队测试与安全分析用户,强调代码与推理能力,但 MMLU 较原版下降约 4 个百分点。

去对齐模型9B 文本生成红队测试
模型源更新
最低显存
2.5 GB
最小文件
2.3 GB