MODEL DECISION LIBRARY

先看懂模型,再决定下载哪个量化。

模型名和参数量不能直接回答“适不适合我”。这里同时整理中文用途、模型卡依据、硬件估算、运行入口和已知限制。

找到 72 个模型清除筛选
AI MODEL01 / ♥ 0

gemma-4-12B-it-qat-GGUF:12B多模态本地量化指令版

Gemma 4 12B 统一架构指令调优版本,支持文本、图像与音频输入,输出仅文本,原生 256K 上下文,内置可配置思考模式与原生函数调用。Unsloth 提供 QAT 量化 GGUF 并附带 MTP 投机解码草稿模型,兼容 llama.cpp、Ollama 与 LM Studio。

多模态大模型本地推理GGUF量化
模型源更新
最低显存
6.5 GB
最小文件
5.6 GB
AI MODEL01 / ♥ 0

gemma-4-12B-coder-fable5-composer2.5-v1-GGUF:本地Python算法推理编码助手

基于Gemma 4 12B针对可验证Python与算法题微调的本地代码模型,融合Composer 2.5真实与Fable 5合成思维链数据蒸馏,最大256K上下文。适合希望离线私有编码助手、显存或内存约4.5GB起步的个人开发者与学习者使用。

Python代码助手本地大模型推理链CoT
模型源更新
最低显存
3.5 GB
最小文件
2.8 GB
AI MODEL01 / ♥ 0

gemma-4-26B-A4B-it-GGUF:本地推理多模态MoE对话模型

Google Gemma 4 26B A4B 是 MoE 架构的多模态模型,总参数 26B、激活约 4B,支持文本与图像输入、文本输出,256K 上下文窗口,覆盖 140 多种语言。适合在消费级 GPU 或工作站做本地对话、代码、推理与图文理解。Apache 2.

多模态对话本地推理图文理解
模型源更新
最低显存
7 GB
最小文件
6.1 GB
AI MODEL01 / ♥ 0

MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF:1B 本地思考模型工具调用增强版

基于 MiniCPM5-1B 的 1B 参数本地化文本生成模型,V2 版本相比 V1 强化工具调用与函数调用能力,支持思考模式推理与最长 128K 上下文,兼顾中英文对话、代码生成和指令跟随。适合想要在笔记本或低显存设备上本地跑一个能调用工具、能写代码的小模型的用户。

本地 1B 小模型工具调用思考模式
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-GGUF:27B多模态推理与代理任务密集模型

Qwen3.8-27B-GGUF 是 27B 参数的原生视觉语言密集模型,支持图像与视频理解,擅长编码、专业写作、研究与长链路代理任务;原生上下文 262144 tokens,可经 RoPE 扩展至 1000000 tokens。思考模式默认开启且可按请求关闭,并支持工具调用与多 token 预测。

多模态长上下文代理任务
模型源更新
最低显存
3.5 GB
最小文件
3.1 GB
AI MODEL01 / ♥ 0

Qwen3.5-9B-Uncensored-HauhauCS-Aggressive:9B多模态去审查对话模型

基于Qwen3.5-9B的9B参数混合架构模型,采用线性注意力与全注意力3:1组合,作者称移除安全审查并保留原始多模态能力,支持文本、图像、视频输入及原生262K上下文。适合需要无限制生成的中文及多语言用户,需2026年3月后较新llama.cpp版本。Q4_K_M量化推荐8GB内存,Q8需13GB以上。

多模态对话去审查长上下文
模型源更新
最低显存
5 GB
最小文件
4.2 GB
AI MODEL01 / ♥ 0

Flux2-Klein-9B-True-V3:9B 文本生图与指令编辑模型

基于 FLUX.2-klein-9B 微调的 9B 文本生成图像模型,支持纯提示词图像编辑、LoRA 换脸换装及 Mask 区域精准编辑,V3 版本在美学与构图上有明显改进。适合需要本地部署文生图或图像编辑工作流的中文用户与 AIGC 创作者。

文生图图像编辑FLUX 微调
模型源更新
最低显存
5 GB
最小文件
4.2 GB
AI MODEL01 / ♥ 0

MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:本地1B轻量思维链代码模型

面向本地部署的 1B 参数轻量文本生成模型,基于 MiniCPM5-1B 在 Fable 5 数据上微调,支持思维链推理、代码生成与指令跟随,上下文最长 128K tokens。适合硬件受限、需要离线跑思维链问答或编程任务的个人开发者,最低 4GB 内存即可加载 Q4 量化版本,无需高端显卡。

1B轻量模型本地代码助手思维链推理
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL01 / ♥ 0

Ternary-Bonsai-27B-gguf:27B三元量化笔记本可跑的长文本推理模型

Ternary Bonsai 27B 是基于 Qwen3.6-27B 的三元权重量化版本,部署约 7.2 GB,可在 8 GB 内存的笔记本上加载运行,保留数学、代码与思维链等核心推理能力,原生支持 262K 长上下文。

27B 本地推理三元量化长上下文
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

Qwen3.6-35B-A3B-GGUF:35B 多模态代理编程与长文档模型

Qwen3.6-35B-A3B 是千问首个开源权重的 35B 多模态 MoE 大模型,总参数 35B、激活 3B,支持文本、图像与视频输入,原生 26 万 token 上下文可扩展至百万级。模型卡强调智能体编码、工具调用与思维链保留能力。适合需要本地代理编程、长文档问答和视觉理解的开发者与研究者。可通过 llama.

多模态大模型长上下文智能体编程
模型源更新
最低显存
4.5 GB
最小文件
4.1 GB
AI MODEL01 / ♥ 0

Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced:去审查多模态长上下文编程写作模型

基于 Gemma4 12B 的去审查衍生版本,保留图像识别与 256K 长上下文,面向代理式编程、推理与创意写作调优。Q4_K_M 文本权重为仓库标定的甜点量化,附加 mmproj 视觉投影器后建议约 10GB 显存与 10GB 内存起步。需要长上下文、无明显拒答偏置或本地图片问答能力的开发者与创作者可直接试用。

去审查多模态长上下文
模型源更新
最低显存
6.5 GB
最小文件
5.6 GB
AI MODEL01 / ♥ 0

gemma-4-12b-it-GGUF:本地多模态对话与推理

由 Unsloth 发布的 Gemma 4 12B 指令微调量化版本,支持文本、图像和音频输入并输出文本,适合在消费级显卡或笔记本上做多模态对话、推理、编码与 OCR 任务。预训练覆盖 140 多种语言,长上下文可达 256K。

多模态长上下文本地部署
模型源更新
最低显存
3.5 GB
最小文件
2.8 GB
AI MODEL01 / ♥ 0

Qwythos-9B-v2-GGUF:9B推理多模态长上下文模型

Qwythos-9B-v2-GGUF 是基于 Qwen3.5-9B 的 9B 参数 GGUF 量化推理模型,通过 FTPO 训练消除了低温度解码下的循环重复,恢复 MTP 头并保留多模态视觉塔。支持 1M token 长上下文,推理时先输出思考块再作答。

长上下文推理多模态视觉GGUF量化
模型源更新
最低显存
5 GB
最小文件
4.2 GB
AI MODEL01 / ♥ 0

DeepSeek-V4-Pro-Qwen3.5-9B-MTP-GGUF:数学与理工推理的 9B 蒸馏

DeepSeek-V4-Pro-Qwen3.5-9B-MTP-GGUF 是基于 Qwen3.5-9B 的 9B 参数推理模型,由 DeepSeek-V4-Pro Max Effect 模式教师数据蒸馏,约 25 万数学与 STEM 样本完成 SFT 与 GSPO 强化学习。

数学推理理工蒸馏轻量部署
模型源更新
最低显存
2.5 GB
最小文件
2.1 GB
AI MODEL01 / ♥ 0

Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF:百万上下文去限制推理模型

基于 Qwen3.5 架构的 9B 参数文本生成模型,支持 1M 超长上下文,覆盖推理、函数调用、工具使用和网络安全、生物医学等方向。该版本经过 abliteration 处理,安全过滤被显著削弱,更适合研究、测试和受控环境中的技术探索。消费级显卡建议 6GB 显存起运行 Q4_K 量化版本。

长上下文去审查推理代理
模型源更新
最低显存
5 GB
最小文件
4.2 GB
AI MODEL01 / ♥ 0

VibeVoice-ASR-BitNet:边缘CPU实时多语种语音转写模型

VibeVoice-ASR-BitNet 是微软推出的 2.8B 参数语音识别压缩版本,主打边缘CPU实时推理,无需独立显卡。它把原始模型从 4.62 GB 压到约 1.58 GB,模型卡显示 CPU 上比 Whisper.cpp 快 1.6 到 2.3 倍,支持中英法意韩葡越等多语种转写。

语音转文字多语种 ASRCPU 推理
模型源更新
最低显存
2 GB
最小文件
1.6 GB
AI MODEL01 / ♥ 0

Qwen3.6-35B-A3B-MTP-GGUF:面向智能体编码的多模态MoE

这是Qwen3.6-35B-A3B的多token预测GGUF量化版,总参数35B、激活约3B,原生26.2万token上下文并可扩展至约101万。模型具备视觉编码与智能体编码能力,强调工具调用与思考上下文保留。适合本地部署智能体助手或多模态应用的进阶用户,最低IQ1_M可在约4.

智能体编码多模态长上下文
模型源更新
最低显存
4.5 GB
最小文件
4.1 GB
AI MODEL01 / ♥ 0

Dolphin3-Cyber-8B-GGUF:网络安全攻防专精的本地化8B模型

基于Llama 3.1的8B网络安全垂直模型,主打攻防渗透、漏洞研究、利用开发与防御加固,已移除对齐限制,支持全本地离线推理。GGUF量化梯度从Q2_K到F16共十余档,最低3.18GB即可加载,适合安全工程师、CTF选手与红蓝队研究员。需要消费级或专业级显卡,无联网能力,知识截至基座训练时间。

网络安全渗透测试本地推理
模型源更新
最低显存
2.5 GB
最小文件
1.9 GB
AI MODEL01 / ♥ 0

MiniCPM5-1B-Agentic-Tooluse-GGUF:轻量代理工具调用小模型

这是基于 openbmb MiniCPM5-1B、经 Nemotron SFT+DPO 修复微调后的 1B 参数代理工具调用模型,提供 F16、Q8_0、Q4_K_M 三档 GGUF 量化。适合想在本地或边缘设备上做 AI 代理、需要模型按 XML 函数块格式稳定选择并调用工具的开发者与研究者。

工具调用代理轻量小模型本地运行
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL01 / ♥ 0

Ornith-1.0-35B-GGUF:面向编码代理的开源模型

Ornith-1.0-35B 是基于 Qwen3.5 微调的 35B MoE 模型,主打自主代理式编程,支持工具调用与代码生成。适合需要本地或私有部署智能编码助手、终端自动化脚本与 Agent 框架的开发者。提供 IQ1 到 Q6、BF16 多档 GGUF,最低约 4.

编程代理智能编码终端 Agent
模型源更新
最低显存
4.5 GB
最小文件
4.1 GB
AI MODEL01 / ♥ 0

Nanbeige4.2-3B-GGUF:3B参数中文轻量对话量化

Nanbeige4.2-3B-GGUF 是基于 Nanbeige4.2-3B 的 GGUF 量化合集,参数规模 3B,支持中英文文本生成。提供 Q2 到 Q8 共 8 档量化,适合硬件资源有限的本地用户。极小文件 Q2/Q3 适合老旧设备与最低 4GB 内存环境;Q5/Q6/Q8 保留更多质量但需要 3GB 以上显存。

中文对话小模型GGUF 量化
模型源更新
最低显存
1 GB
最小文件
0.7 GB
AI MODEL01 / ♥ 0

MiniCPM5-2B-GGUF:本地可跑的2B长上下文中文助手

MiniCPM5-2B-GGUF 是面壁智能开源的2B参数稠密 Transformer GGUF 量化仓库,主打本地部署、端侧推理与资源受限场景。原生支持 131K 长上下文,覆盖代码、数学、工具调用与智能体任务。

本地中文助手2B轻量模型长上下文
模型源更新
最低显存
1.5 GB
最小文件
1.2 GB
AI MODEL01 / ♥ 0

POCKET-35B-GGUF:CPU可跑的35B本地对话模型

POCKET-35B-GGUF 是 35B 参数的稀疏 MoE 对话模型,由 Darwin-36B-Opus 量化而来,主打无显卡本地运行。适合没有 GPU、做日常对话与写作辅助的本地用户。最低 IQ1_M 约 8 GB 可装入 16 GB 内存设备,Q2_K 推荐 12.5 GB 内存,Q4_K_M 推荐 24.

本地大模型CPU推理MoE对话
模型源更新
最低显存
4.5 GB
最小文件
4.1 GB
AI MODEL01 / ♥ 0

TwIL-LM3:3B参数形式逻辑推理专用模型

TwIL-LM3 是基于 SmolLM3-3B 微调的 3B 参数形式逻辑推理模型,专注一阶逻辑翻译、蕴涵判定、语义解析、Lean 形式化与证明评审等结构化任务。适合需要机器可读符号化推理输出的研究者与本地推理开发者,硬件门槛低,Q4_K_M 量化可在 4GB 显存或纯 CPU 起步。

形式逻辑推理模型小模型
模型源更新
最低显存
2 GB
最小文件
1.8 GB
AI MODEL01 / ♥ 0

Bonsai-27B-gguf:27B模型一比特极限压缩本地可跑

本仓库是prism-ml基于Qwen3.6-27B的1比特二值化GGUF量化版本,把27B参数混合注意力模型压到约3.9GB(每权重1.125bit),主打长文本对话、代码生成与本地离线推理。适合在普通笔记本、单卡GPU或手机上跑27B级模型的用户,最低约4GB内存即可加载主语言模型,附带视觉塔可处理图像输入。

1比特大模型27B本地推理长上下文
模型源更新
最低显存
3.5 GB
最小文件
3.1 GB
AI MODEL01 / ♥ 0

Agents-A1-4B-Q8_0-GGUF:4B 视觉智能体本地小钢炮

Agents-A1-4B-Q8_0-GGUF 是 InternScience 开源的 4B 视觉语言 Agent 模型,专注长程搜索、工具调用与多约束指令遵循,附带 mmproj GGUF 支持图文输入。Q8_0 主文件约 4GB,最低 5GB 内存或 4.5GB 显存,推荐 8GB 内存或 5.5GB 显存。

视觉智能体工具调用长程推理
模型源更新
最低显存
3 GB
最小文件
2.3 GB
AI MODEL01 / ♥ 0

Qwen3.6-14B-A3B-FableVibes-GGUF:14B推理蒸馏的消费级长思维模型

Qwen3.6-14B-A3B-FableVibes 由 Qwen3.6-35B-A3B 经 REAP 剪枝到 14B 活跃参数,再用 Claude Fable 5 推理痕迹做 QLoRA 蒸馏得到。回答前会输出思考 token,适合中文写作、编程与多步规划。Q3_K_M 至 Q4_K_M 即可在消费级显存上跑通。

通用推理长思维链多模态
模型源更新
最低显存
4 GB
最小文件
3.3 GB
AI MODEL01 / ♥ 0

Neutrino-8B:8B 三元量化对话与工具调用模型

Neutrino-8B 是基于 Qwen3-8B 的 8B 参数三元量化聊天模型,每个线性层以五值编码存储为亚 2 比特权重,整模型容器约 3.9 GB,适合在 Mac、CPU 服务器或显存约 6.5 GB 的入门显卡上离线加载。模型卡写明带工具调用与结构化 JSON 输出训练,可用作本地对话、长文生成或轻量函数代理。

三元量化对话8B 本地部署工具调用
模型源更新
最低显存
5.5 GB
最小文件
4.7 GB
AI MODEL01 / ♥ 0

LFM2.5-2.6B-GGUF:本地部署的多语言轻量文本生成模型

LFM2.5-2.6B-GGUF 是 LiquidAI 推出的 2.6B 参数混合架构模型,专为设备端部署设计,支持中文在内的十余种语言文本生成。适合想在笔记本、低配台式机或边缘设备上离线运行轻量语言模型的用户,最低 4GB 内存即可加载 Q4 量化版本,对独立显卡依赖较低。

本地部署轻量文本生成边缘设备
模型源更新
最低显存
1.5 GB
最小文件
1.2 GB
AI MODEL01 / ♥ 0

Qwen3.6-27B-MTP-GGUF:视觉多模态长上下文MTP编码模型

Qwen3.6-27B-MTP-GGUF 是 unsloth 在 Hugging Face 发布的 27B 参数多模态语言模型 GGUF 仓库,转发 Qwen3.6-27B 原生权重并附 mmproj 视觉投影文件,主打代理式编码、工具调用、原生 26 万 token 上下文与 MTP 多 Token 预测加速。

多模态大模型长上下文代码助手
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

Ornith-1.0-9B-GGUF:面向代理编程的轻量9B模型

Ornith-1.0-9B 是面向智能体编程的 9B 密集模型,专为单 GPU 部署优化,擅长终端编码任务、工具调用与多步推理。模型卡未给出通用聊天定位,更适合接入代理框架或本地 OpenAI 兼容服务来自动化编码。Q4_K_M 量化约需 5GB 显存即可运行,BF16 全精度建议 8GB 以上显存或 13GB 内存。

智能体编程代码代理工具调用
模型源更新
最低显存
5 GB
最小文件
4.2 GB
AI MODEL01 / ♥ 0

nemotron-3.5-asr-streaming-0.6b:0.6B 参数多语种流式语音转文字模型

NVIDIA 推出的 0.6B 参数多语种流式语音识别模型,基于缓存感知 FastConformer-RNNT 架构,原生支持 40 种语言-地区转录,可配置 80 毫秒到 1120 毫秒分块以在延迟与精度间权衡。适合需要多语种实时字幕、语音代理、跨语种转写或多语种批量转录的开发者与团队,输出自带大小写与标点。

多语种语音识别流式 ASR语音转文字
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL01 / ♥ 0

Supra2-100M-Instruct:百兆参数实验型英文对话模型

基于 Qwen3 架构的 100M 参数英文指令模型,仅 2K 上下文,提供 F16 GGUF(约 62.5MB)。适合低配置设备尝鲜轻量文本生成或研究小模型行为的开发者与爱好者。不适合需要事实准确性或多轮复杂推理的生产场景。

轻量英文对话超小参数模型Qwen3 衍生
模型源更新
最低显存
1 GB
最小文件
0.1 GB
AI MODEL01 / ♥ 0

Muse-Glimmer-30B-GGUF:本地部署的多模态智能体模型

Muse-Glimmer-30B 是 Meta 推出的 30B 参数多模态语言模型,专为本地智能体任务设计,集成多步推理、工具调用、失败恢复和图文理解能力。通过 4-bit 量化可压缩到 24–32GB 显存运行,适合需要在本地搭建自主代理、代码助手或多模态应用的研究者和开发者,使用门槛中等偏高。

本地智能体多模态推理工具调用
模型源更新
最低显存
8 GB
最小文件
7.0 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF:去审查长文创作编程三合一本地模型

基于 Qwen3.8-27B 的 27B 参数多阶段微调模型,主打去审查与压缩思考块,支持视觉输入与 256k 上下文,并提供三种推理档位。适合需要长文创意写作、角色扮演、辅助编程且拥有 16GB 以上显存的本地用户,工具调用建议 Q4_K_M 以上量化。

27B 去审查创意写作编程长上下文本地部署
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF:去审查强化推理全能型

基于Qwen3.6-27B多阶段微调并经Heretic去审查,强化思考推理、指令跟随与通用能力,支持视觉与长上下文。27B体量对显存门槛较高,Q4量约需16GB显存、Q8需30GB以上,适合中文高级用户与本地推理爱好者使用MTP可进一步提速。

通用对话与推理视觉问答与长上下文去审查本地大模型
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

TIPOv2-1B-A200M:文生图提示词扩写专家

TIPOv2-1B-A200M 是一个 1B 总参数、每 token 仅激活约 200M 的稀疏 MoE 模型,专门把用户输入的简短提示词扩写为更详细的长描述,供 Stable Diffusion 等文生图扩散模型使用。

文生图提示词提示词扩写Danbooru 标签
模型源更新
最低显存
1 GB
最小文件
0.6 GB
AI MODEL01 / ♥ 0

NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF:30B MoE混合架构多语言推理底座

30B 总参数、3B 激活的 NVIDIA 混合架构模型,结合 Mamba-2、MoE 与 Attention 层,支持长上下文与工具调用。仓库提供 IQ1 到 Q8 多档 GGUF 量化,IQ1 最低约 4GB 显存即可加载,桌面显卡也能尝试低比特版本。

MoE混合架构多语言推理长上下文
模型源更新
最低显存
4 GB
最小文件
3.5 GB
AI MODEL01 / ♥ 0

LFM2.5-VL-3B-GGUF:面向端侧的3B视觉语言多模态模型

LFM2.5-VL-3B-GGUF 是 LiquidAI 发布的 3B 参数视觉语言模型,采用混合架构主打边缘与端侧部署,支持图片加文本输入并覆盖十余种语言。适合需要在本地设备上做图像问答、视觉理解的开发者与个人用户,最小仅需 4GB 内存即可加载 Q4 量化,适合笔记本、迷你主机等资源受限场景。

多模态视觉问答端侧部署
模型源更新
最低显存
2 GB
最小文件
1.4 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-OBLITERATED-GGUF:去审查版红队研究模型

Qwen3.8-27B 的去审查 GGUF 量化版本,去除模型对齐限制,面向 AI 安全红队研究与对抗测试场景。基座来自 OBLITERATUS 的 27B 规模文本模型,标签明确标注 abliterated、uncensored、red-team。

AI 安全研究去审查模型红队测试
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

Qwen3.8-9B-GGUF:9B 蒸馏推理模型 GGUF 量化版

本仓库提供 empero-ai 出品的 Qwen3.8-9B GGUF 量化文件,原模型将 Qwen3.8 2.4T A95B 教师能力蒸馏到 Qwen3.5-9B 架构,属于 9B 参数推理模型,主攻文本生成与思维链推理。适合想在消费级硬件上体验 Qwen3.8 思路的个人开发者和研究者。运行需较新 llama.

本地推理思维链GGUF 量化
模型源更新
最低显存
5 GB
最小文件
4.2 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-GGUF:27B 多模态中文对话量化版

本仓库为 Qwen3.8-27B 的 llama.cpp GGUF 量化版本,支持中英文文本生成、图文理解、MTP 推测解码与工具调用。提供 IQ2 到 Q8_0 全套量化以及 BF16 原版,适合本地高显存用户追求质量、低显存用户追求可用。

多模态对话中文大模型27B 量化
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

Muse-Glimmer-30B-Abliterated-GGUF:本地多模态去拒绝30B模型

基于Meta的30B多模态智能体模型的去拒绝权重修改版,GGUF格式打包,可在单卡消费级GPU或CPU上完全离线运行。支持131K长上下文、图像输入与DFlash投机解码加速,适合本地部署研究与智能体任务,但属实验性版本,需较高端硬件与新版llama.cpp。

多模态去拒绝本地部署
模型源更新
最低显存
8 GB
最小文件
7.0 GB
AI MODEL01 / ♥ 0

Dirk-Qwen3.8-27B-GGUF:精简模板默认的27B视觉语言模型

Dirk 是基于 Qwen3.8-27B 的 27B 视觉语言 GGUF 量化版本,原生支持图像输入并保留 MTP 多 token 预测投机解码头,推理档位可在 low、medium、xhigh 间切换,适合需要在消费级显卡上做代码、视觉问答和知识型任务的中高级本地用户。

视觉语言模型27B 本地推理代码与编程助手
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-Uncensored-GGUF:本地部署的去审查语言模型

Qwen3.8-27B-Uncensored-GGUF 是 orcarouter 发布的 27B 参数去审查大语言模型 GGUF 量化合集,适合想本地运行中等规模对话模型、追求回答自由度较高的中文用户。硬件门槛跨度大,从 8GB 内存的极限压缩版到 31.5GB 内存的全精度版均可部署,覆盖入门台式机到高端工作站。

本地大模型GGUF 量化去审查对话
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

nl2sh-1.5b-Q4_K_M:英文需求转单条Shell命令

基于 Qwen2.5-Coder-1.5B-Instruct 用 1.5B 参数底座配合 LoRA 微调并合并权重,专把一句英文需求翻译成单条 Bash 命令。约 941 MB,CPU 即可加载,约一秒返回。适合需要在本地终端把自然语言随手转成命令、又不想上云的用户。门槛低,普通笔记本就能跑。

命令生成Shell助手轻量本地
模型源更新
最低显存
1 GB
最小文件
0.7 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-GGUF:支持图像理解的多模态对话量化版

基于Qwen3.8-27B的多模态对话模型量化版本,支持图像理解与文本生成,原生提供思维链开关。提供从IQ1到Q8_0十余种量化文件与独立视觉投影组件,最低约3.5GB显存可启动小量化,但完整能力需中高端显存。适合具备中高显卡配置、想在本地运行视觉对话与推理任务的用户。

多模态对话视觉理解长上下文
模型源更新
最低显存
3.5 GB
最小文件
3.1 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF:去审查27B长文本生成模型

基于Qwen3.8-27B双轮ARA去审查的27B参数文本生成模型,采用Gated DeltaNet混合架构支持262K上下文。适合追求低过滤创意写作、长篇角色扮演和成人向内容研究的用户,需较高显存,最低建议16GB内存跑Q4量化,24GB显卡可获得更佳体验。

去审查大模型27B长上下文角色扮演写作
模型源更新
最低显存
3.5 GB
最小文件
3.1 GB
AI MODEL01 / ♥ 0

Qwen3.8-4B-Distill-GGUF:4B 蒸馏推理模型量化包

Qwen3.8-4B-Distill 是把 Qwen3.8 2.4T A95B 大模型蒸馏到 Qwen3.5-4B 架构而来的 4B 参数推理模型,本仓库为 GGUF 量化版。适合想在消费级硬件上本地跑推理模型、又不愿承担大模型显存开销的用户。属于 Qwen3.

4B 蒸馏推理GGUF 量化本地部署
模型源更新
最低显存
2.5 GB
最小文件
1.9 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-GSQ-RCO-GGUF:27B 视觉语言模型非均匀量化

Qwen3.8-27B(27B 参数视觉语言模型)的非均匀 GGUF 量化版,使用 GSQ 与 RCO 混合精度方法逐张量分配精度,提供 IQ2 到 IQ3 多档并附带视觉投影器支持图文多模态。适合想在消费级硬件跑 27B 多模态模型的用户,最低约 8GB 内存或 7GB 显存可加载 IQ2 档,IQ3 档推荐 14.

27B 多模态非均匀量化视觉语言模型
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

Qwen3.8-9B-Distill-GGUF:蒸馏9B推理模型的GGUF量化版

基于 Qwen3.5-9B 架构蒸馏自 Qwen3.8 教师模型,主打推理能力,MMLU 提升明显。提供 Q4 到 BF16 多档 GGUF 量化,9B 参数量适合消费级显卡和笔记本本地运行。注意这是 Gated DeltaNet 混合架构,需使用较新的 llama.cpp(支持 Qwen3.

本地推理模型GGUF 量化9B 蒸馏模型
模型源更新
最低显存
5 GB
最小文件
4.2 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF:直答型多模态加速生成

这是基于 Qwen3.8-27B 的去审查 Aggressive 变体,27B 参数保留原生多模态、长上下文与推理能力,主打直接回答、低拒答,并附带 HauhauCS FastMTP 加速侧车。适合追求快速响应、不在意安全过滤的本地用户,硬件门槛较高,Q4 量级需 16GB 内存,Q8 需 31.5GB 以上。

多模态长上下文去审查直答GGUF 量化
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-CRACK-GGUF:去审查多模态研究模型

基于 Qwen3.8-27B 量化的多模态去审查研究模型,支持图像与视频理解、原生 262K 上下文、可控推理强度,附带 MTP 推测解码头。适合安全研究人员做红队测试或越狱研究,需要至少 14GB 显存(Q4 量化)才能运行,量化文件覆盖 IQ2 到 Q8 各档。

去审查研究多模态视觉长上下文
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

Huihui-Qwen3.8-27B-abliterated-GGUF:27B 去审查图文对话量化包

基于 Qwen3.8-27B 通过 abliteration 移除部分拒绝行为的去审查版本,支持图像与文本输入。仅消融 18-51 层,保留视觉与 MTP 模块,并对关键层做混合精度处理以稳定生成质量。适合本地受限话题研究与消融实验用户,硬件门槛 8GB 显存起步,推荐 16GB 以上。

去审查对话27B 多模态消融实验
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF:9B 参数去审查指令强化 GGUF 量化包

基于 Qwen3.5-9B 的多阶段微调与合并版本,主打指令遵循与通用智能提升,并移除拒绝行为,属于去审查类(Heretic)文本生成模型,同时支持视觉理解,需额外下载 mmproj 文件。

去审查模型长上下文视觉多模态
模型源更新
最低显存
2.5 GB
最小文件
2.1 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-OBLITERATED:去审查红队研究专用大模型

基于Qwen3.8-27B的去审查27.8B参数文本生成模型,通过迭代权重手术移除硬拒答与软偏转,适合AI安全研究、对齐测试和本地控制用户。提供Q2到Q8_0共八种GGUF量化,Q2_K最低约7GB显存可加载,Q4_K_M推荐16GB显存或19.5GB内存。

去审查大模型AI安全研究红队测试
模型源更新
最低显存
7 GB
最小文件
6.5 GB
AI MODEL01 / ♥ 0

Ornith-1.5-9B-GGUF:轻量代码与智能体推理模型

Ornith-1.5-9B 是一款面向终端编码与智能体场景的 9B 密集模型,在 Qwen3.5 与 Gemma4 基础上继续预训练并通过自改进循环优化。模型默认输出链式推理,支持工具调用与最长 262K 上下文,可经 YaRN 缩放扩展到约 1M tokens。

代码生成智能体推理工具调用
模型源更新
最低显存
5 GB
最小文件
4.2 GB
AI MODEL01 / ♥ 0

Qwythos-9B-Claude-Mythos-5-1M-GGUF:百万上下文推理视觉多模态

基于 Qwen3.5-9B 的全参数推理模型,支持原生函数调用、图像理解与百万 token 长上下文,适合需要长文分析、工具调用与网络安全、生物医药等技术问答的用户。Q4 量化可在 8GB 内存或 6GB 显存设备运行,启用完整 1M 上下文通常需要多卡或 KV-cache 卸载。

9B 推理模型百万上下文视觉多模态
模型源更新
最低显存
5 GB
最小文件
4.2 GB
AI MODEL01 / ♥ 0

Qwen3.6-27B-Uncensored-HauhauCS-Aggressive:去审查多模态直答激进版

基于官方 Qwen3.6-27B 的 27B 参数多模态去审查变体,原生支持文本、图像、视频并自带 mmproj 文件。Aggressive 版在敏感提示下跳过铺陈与免责声明直接作答,测试拒答率为 0/465。K_P 自定义量化在体积与质量间较好平衡,但 27B 体量对显存内存要求较高,建议至少 16GB 显存起步。

去审查多模态长上下文大模型GGUF 本地部署
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-Uncensored-GGUF:去审查版中文多模态大模型

Qwen3.8-27B 的去审查 GGUF 量化版,通过 Heretic 去拒绝处理把 100 条有害提示的拒答从 98 降到 12。保留 27B 原架构、262K 上下文、视觉能力与 MTP 推测解码头。适合想要宽松回答、本地有 16GB 以上显存或 32GB 以上内存的用户。

去审查大模型中文长上下文本地多模态
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

Qwen3.8-2B-Distill-GGUF:手机可跑的 2B 蒸馏推理量化版

该仓库是 empero-ai/Qwen3.8-2B 的官方 GGUF 量化合集,对应 2B 参数的蒸馏推理模型,主打文本生成与思考型回答。适合想在手机、单板机、轻薄本上离线运行轻量对话的中文及英文用户,CPU 即可起步。Q4 量化约 1.3 GB,本地门槛低。注意需较新 llama.cpp 以支持 Qwen3.

边缘推理轻量聊天GGUF 量化
模型源更新
最低显存
1.5 GB
最小文件
0.9 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF:冷融合加速推理创作全能模型

基于 Qwen3.8-27B 的第三方冷融合微调 GGUF 仓库,使用 GAIN 加 Unsloth 复合训练方法,号称 4bit 量化可保留近 99% BF16 性能,思考 token 压缩至常规版的 1/2 至 1/10。

冷融合推理长上下文代码MTP 量化
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-Unleashed-GGUF:去审查27B长文本生成

基于 Qwen3.8-27B 的去审查 GGUF 版本,采用按张量动态比特分配(Unsloth Dynamic 3.0 配方),共 9 个档位。基础为 27B 混合 DeltaNet(65 层仅 17 层全注意力),支持 262k 上下文与视觉。推荐 UD-Q3_K_XL(13.

长文本生成去审查大模型Qwen3.8量化
模型源更新
最低显存
3.5 GB
最小文件
3.1 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-ABLITERATED-GGUF:本地多模态去拒答大模型

基于 Qwen3.8-27B 改造的 27B 参数稠密多模态 GGUF 版本,支持文本、图像、视频输入与文本输出,原生 262K 上下文。经权重级去拒答处理,保留推理与工具调用能力,内置 MTP 推测头,可选 DFlash2 加速。Q4_K_M 推荐约 16GB 显存。

多模态对话长上下文去拒答研究
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

Ornith-1.5-9B-GGUF:9B视觉对话模型量化合集

Ornith-1.5-9B-GGUF 是带视觉理解的 9B 参数对话与智能体编码模型的本地 GGUF 量化仓库,由 AtomicChat 基于自研重要性矩阵调优多档位布局。适合想本地跑多模态对话、图像识别、长上下文问答与代码助手的用户。

多模态对话视觉理解智能体编码
模型源更新
最低显存
2.5 GB
最小文件
2.1 GB
AI MODEL01 / ♥ 0

Spark-X2.5-4B-GGUF:轻量通用对话与写作本地模型

Spark-X2.5-4B-GGUF 是 4B 参数的紧凑型通用语言模型量化版本,支持对话、写作、翻译、推理、编码、工具调用与智能体工作流。采用混合注意力架构,原生上下文可达 1M 词元,覆盖 200 余种语言。

通用对话本地推理长上下文
模型源更新
最低显存
2.5 GB
最小文件
1.9 GB
AI MODEL01 / ♥ 0

Qwen3.8-27B-EfficientThink-Uncensored-K3-Opus5-Grok4.6-GPT5.6Sol-SFT-SimPO-DFlash2-GGUF:高效思考与多模态推理量化版

主要用途是基于 Qwen3.8-27B 基座的高效思考模式与去审查微调版本,提供 GGUF 多档量化以适配不同显存。适合需要长上下文、推理增强与多模态输入的研究者,或中英文双语应用开发者。硬件门槛跨度大,从 8GB 显存运行 Q2 量化到 31.5GB 以上显存运行 Q8_0 全精度。

高效思考多模态GGUF27B推理
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

LFM2.5-2.6B-DSpark-GGUF:2.6B目标专用投机解码草稿

这是 LiquidAI 为 LFM2.5-2.6B 目标模型发布的 GGUF 投机解码草稿侧车,必须配合 LFM2.5-2.6B-GGUF 目标文件共同使用。草稿侧车仅含 5 层注意力、rank-256 Markov 头与置信头,块大小 9,加载时共享目标模型的嵌入和 LM 头,因此体积远小于常规同参数量模型。

投机解码草稿llama.cpp 加速LFM2 2.6B 推理
模型源更新
最低显存
1.5 GB
最小文件
1.2 GB
AI MODEL01 / ♥ 0

Qwopus3.8-27B-Flash-GGUF:MTP加速的Agent微调模型

基于Qwen3.8-27B微调的27B参数多模态模型,专为本地Agent工作流优化。通过MTP推测解码降低推理时延与生成成本,减少异常长尾推理。适合需要本地部署、多轮工具调用、长期Agent循环和代码生成的用户。模型卡明确说明存在Python代码缩进已知问题,修复中。

Agent工作流MTP推测解码工具调用
模型源更新
最低显存
7 GB
最小文件
6.3 GB
AI MODEL01 / ♥ 0

flux2-klein-9b-uncensored-text-encoder:FLUX.2 图像管线的 9B 文本编码器

基于 Qwen3 架构的 8.2B 参数文本编码器,命名显示面向 FLUX.2 图像生成管线。仓库仅提供 GGUF 量化文件,可通过 Ollama、llama.cpp、LM Studio 三类本地推理工具加载。适合希望在本地替换或测试 FLUX.

文本编码器FLUX 图像生成Qwen3 衍生
模型源更新
最低显存
4.5 GB
最小文件
3.8 GB
AI MODEL01 / ♥ 0

Ornith-1.5-9B-OBLITERATED:移除安全层的9B文本生成

Ornith-1.5-9B-OBLITERATED 是 Ornith-1.5-9B 的去安全对齐版本,基于 Qwen3.5 混合架构,含 9B 参数与视觉编码器。面向研究、红队测试与安全分析用户,强调代码与推理能力,但 MMLU 较原版下降约 4 个百分点。

去对齐模型9B 文本生成红队测试
模型源更新
最低显存
2.5 GB
最小文件
2.3 GB
AI MODEL01 / ♥ 0

gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF:低显存本地编码代理与工具调用

基于 google/gemma-4-12B-it 微调的 12B 文本生成模型,专注编码、终端与多步 Agentic 工具调用任务。Q3 量化约 4.5GB,可在约 5GB VRAM 的低配机器运行本地私有代理,Q4_K_M 被作者标为推荐甜点。通用知识略低于基模,英语为主,未做安全对齐,按 Apache 2.

本地编码助手Agentic 工具调用终端调试
模型源更新
最低显存
5 GB
最小文件
4.2 GB