MODEL DECISION LIBRARY
先看懂模型,再决定下载哪个量化。
模型名和参数量不能直接回答“适不适合我”。这里同时整理中文用途、模型卡依据、硬件估算、运行入口和已知限制。
gemma-4-12B-it-qat-GGUF:12B多模态本地量化指令版
Gemma 4 12B 统一架构指令调优版本,支持文本、图像与音频输入,输出仅文本,原生 256K 上下文,内置可配置思考模式与原生函数调用。Unsloth 提供 QAT 量化 GGUF 并附带 MTP 投机解码草稿模型,兼容 llama.cpp、Ollama 与 LM Studio。
Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP:去审查多模态长文推理与创作
基于 Google Gemma 4 26B-A4B 的去审查微调版本,26B 总参数配 4B 激活 MoE 架构,原生支持 256K 上下文与图像输入。适合需要开放式回答的智能体编程、创意写作、角色扮演与长文档推理用户,建议单卡约 16 GB 显存或 18.5 GB 内存起步,搭配 MTP 草稿头可在 llama.
gemma-4-12B-coder-fable5-composer2.5-v1-GGUF:本地Python算法推理编码助手
基于Gemma 4 12B针对可验证Python与算法题微调的本地代码模型,融合Composer 2.5真实与Fable 5合成思维链数据蒸馏,最大256K上下文。适合希望离线私有编码助手、显存或内存约4.5GB起步的个人开发者与学习者使用。
Ornith-1.0-35B-GGUF:开源代理编码轻量模型
Ornith-1.0-35B-GGUF 是 35B 参数的代理编码开源模型,专注代码生成、工具调用与终端代理任务。模型采用自改进 RL 训练框架,适合本地搭建编程代理或 IDE 助手的开发者与研究人员。Q4_K_M 量化最低约需 18GB 显存或 20.
Qwen-AgentWorld-35B-A3B-GGUF:智能体环境模拟世界模型
Qwen-AgentWorld-35B-A3B 是原生语言世界模型,专注智能体环境模拟,覆盖 MCP 工具调用、搜索、终端、SWE、Android、Web、OS 七个交互域,通过长链思维推理预测下一环境状态。适合智能体框架研究者、AgentWorldBench 评测用户及多工具调用 Agent 系统开发者使用。
gemma-4-26B-A4B-it-GGUF:本地推理多模态MoE对话模型
Google Gemma 4 26B A4B 是 MoE 架构的多模态模型,总参数 26B、激活约 4B,支持文本与图像输入、文本输出,256K 上下文窗口,覆盖 140 多种语言。适合在消费级 GPU 或工作站做本地对话、代码、推理与图文理解。Apache 2.
MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF:1B 本地思考模型工具调用增强版
基于 MiniCPM5-1B 的 1B 参数本地化文本生成模型,V2 版本相比 V1 强化工具调用与函数调用能力,支持思考模式推理与最长 128K 上下文,兼顾中英文对话、代码生成和指令跟随。适合想要在笔记本或低显存设备上本地跑一个能调用工具、能写代码的小模型的用户。
Qwen3.8-27B-GGUF:27B多模态推理与代理任务密集模型
Qwen3.8-27B-GGUF 是 27B 参数的原生视觉语言密集模型,支持图像与视频理解,擅长编码、专业写作、研究与长链路代理任务;原生上下文 262144 tokens,可经 RoPE 扩展至 1000000 tokens。思考模式默认开启且可按请求关闭,并支持工具调用与多 token 预测。
Qwen3.5-9B-Uncensored-HauhauCS-Aggressive:9B多模态去审查对话模型
基于Qwen3.5-9B的9B参数混合架构模型,采用线性注意力与全注意力3:1组合,作者称移除安全审查并保留原始多模态能力,支持文本、图像、视频输入及原生262K上下文。适合需要无限制生成的中文及多语言用户,需2026年3月后较新llama.cpp版本。Q4_K_M量化推荐8GB内存,Q8需13GB以上。
Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF:无审查全能创作与编程模型
该模型为 40B 稠密参数文本生成模型,由 Qwen3.6-27B 扩参训练而来,强调无审查、创作与编程能力,原生支持 256K 上下文与视觉输入。适合追求长篇创意写作、角色扮演、复杂代码生成与多轮深度对话的用户。最低运行门槛约 10.
Qwopus3.6-35B-A3B-Coder-MTP-GGUF:思考关闭的本地编码代理模型
基于 Qwen3.6-35B-A3B 的稀疏 MoE 编码微调模型,总参数 35B、激活约 3B,专为关闭长思考的代理式编码流程设计,擅长多轮工具调用、仓库级调试与多文件补丁生成。
Flux2-Klein-9B-True-V3:9B 文本生图与指令编辑模型
基于 FLUX.2-klein-9B 微调的 9B 文本生成图像模型,支持纯提示词图像编辑、LoRA 换脸换装及 Mask 区域精准编辑,V3 版本在美学与构图上有明显改进。适合需要本地部署文生图或图像编辑工作流的中文用户与 AIGC 创作者。
MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:本地1B轻量思维链代码模型
面向本地部署的 1B 参数轻量文本生成模型,基于 MiniCPM5-1B 在 Fable 5 数据上微调,支持思维链推理、代码生成与指令跟随,上下文最长 128K tokens。适合硬件受限、需要离线跑思维链问答或编程任务的个人开发者,最低 4GB 内存即可加载 Q4 量化版本,无需高端显卡。
Ternary-Bonsai-27B-gguf:27B三元量化笔记本可跑的长文本推理模型
Ternary Bonsai 27B 是基于 Qwen3.6-27B 的三元权重量化版本,部署约 7.2 GB,可在 8 GB 内存的笔记本上加载运行,保留数学、代码与思维链等核心推理能力,原生支持 262K 长上下文。
Qwen3.6-35B-A3B-GGUF:35B 多模态代理编程与长文档模型
Qwen3.6-35B-A3B 是千问首个开源权重的 35B 多模态 MoE 大模型,总参数 35B、激活 3B,支持文本、图像与视频输入,原生 26 万 token 上下文可扩展至百万级。模型卡强调智能体编码、工具调用与思维链保留能力。适合需要本地代理编程、长文档问答和视觉理解的开发者与研究者。可通过 llama.
Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced:去审查多模态长上下文编程写作模型
基于 Gemma4 12B 的去审查衍生版本,保留图像识别与 256K 长上下文,面向代理式编程、推理与创意写作调优。Q4_K_M 文本权重为仓库标定的甜点量化,附加 mmproj 视觉投影器后建议约 10GB 显存与 10GB 内存起步。需要长上下文、无明显拒答偏置或本地图片问答能力的开发者与创作者可直接试用。
gemma-4-12b-it-GGUF:本地多模态对话与推理
由 Unsloth 发布的 Gemma 4 12B 指令微调量化版本,支持文本、图像和音频输入并输出文本,适合在消费级显卡或笔记本上做多模态对话、推理、编码与 OCR 任务。预训练覆盖 140 多种语言,长上下文可达 256K。
ThinkingCap-Qwen3.6-27B-GGUF:27B视觉语言高效推理量化版
这是基于Qwen3.6-27B微调的27B视觉语言模型GGUF量化版本,通过token-efficient微调使思考token平均减少约50%而保持原答案质量,支持图像输入。适合拥有中高端硬件、追求本地高效图文推理的用户,Q4_K_M是模型卡推荐的质量与体积平衡点。
Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF:去审查多模态长上下文生成模型
基于 35B MoE 架构(每前向激活约 3B),原生支持文本、图像、视频输入与 262K 上下文(YaRN 可扩至 1M),融合 Hermes 函数调用能力,适合本地无审查多模态与长上下文生成。APEX 版约需 22.5GB 显存与 25.5GB 内存,Q8 版需 35.
Qwythos-9B-v2-GGUF:9B推理多模态长上下文模型
Qwythos-9B-v2-GGUF 是基于 Qwen3.5-9B 的 9B 参数 GGUF 量化推理模型,通过 FTPO 训练消除了低温度解码下的循环重复,恢复 MTP 头并保留多模态视觉塔。支持 1M token 长上下文,推理时先输出思考块再作答。
supergemma4-26b-uncensored-gguf-v2:本地对话与代码兼顾的精简版
基于Gemma 4 26B MoE底座的轻量本地GGUF,主打去审查的英文与韩文对话以及代码生成,提供Q4_K_M单文件版本。适合日常聊天和编程辅助混合使用,需约15.5GB内存或13.5GB显存起步。已在苹果Silicon设备上验证过llama.cpp运行。
DeepSeek-V4-Pro-Qwen3.5-9B-MTP-GGUF:数学与理工推理的 9B 蒸馏
DeepSeek-V4-Pro-Qwen3.5-9B-MTP-GGUF 是基于 Qwen3.5-9B 的 9B 参数推理模型,由 DeepSeek-V4-Pro Max Effect 模式教师数据蒸馏,约 25 万数学与 STEM 样本完成 SFT 与 GSPO 强化学习。
ThinkingCap-Qwen3.6-27B-MTP-GGUF:27B思考模型精简量化与MTP加速
基于Qwen3.6-27B精简微调的27B思考模型,专为Blackwell架构与MTP推测解码打包。思考token比基座平均减少约46%而精度保持,适合追求推理效率的中高端用户。IQ3档位约12.8GB、最低约10.
Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF:百万上下文去限制推理模型
基于 Qwen3.5 架构的 9B 参数文本生成模型,支持 1M 超长上下文,覆盖推理、函数调用、工具使用和网络安全、生物医学等方向。该版本经过 abliteration 处理,安全过滤被显著削弱,更适合研究、测试和受控环境中的技术探索。消费级显卡建议 6GB 显存起运行 Q4_K 量化版本。
VibeVoice-ASR-BitNet:边缘CPU实时多语种语音转写模型
VibeVoice-ASR-BitNet 是微软推出的 2.8B 参数语音识别压缩版本,主打边缘CPU实时推理,无需独立显卡。它把原始模型从 4.62 GB 压到约 1.58 GB,模型卡显示 CPU 上比 Whisper.cpp 快 1.6 到 2.3 倍,支持中英法意韩葡越等多语种转写。
gemma-4-26B-A4B-it-qat-GGUF:面向图文与长上下文的26B MoE量化版
gemma-4-26B-A4B是Google DeepMind推出的多模态指令模型,总参数25.2B、激活约3.8B的MoE架构,支持256K长上下文、图文理解、可配置思考模式与原生函数调用。Unsloth在此基础上发布QAT量化GGUF仓库,Q4_0可在16GB级消费GPU本地运行。
Qwen3.6-35B-A3B-MTP-GGUF:面向智能体编码的多模态MoE
这是Qwen3.6-35B-A3B的多token预测GGUF量化版,总参数35B、激活约3B,原生26.2万token上下文并可扩展至约101万。模型具备视觉编码与智能体编码能力,强调工具调用与思考上下文保留。适合本地部署智能体助手或多模态应用的进阶用户,最低IQ1_M可在约4.
Dolphin3-Cyber-8B-GGUF:网络安全攻防专精的本地化8B模型
基于Llama 3.1的8B网络安全垂直模型,主打攻防渗透、漏洞研究、利用开发与防御加固,已移除对齐限制,支持全本地离线推理。GGUF量化梯度从Q2_K到F16共十余档,最低3.18GB即可加载,适合安全工程师、CTF选手与红蓝队研究员。需要消费级或专业级显卡,无联网能力,知识截至基座训练时间。
Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V2-GGUF:去审查多模态长上下文量化版
基于Qwen3.6 35B总参数、约3B激活的MoE架构GGUF量化版本,主打去审查文本生成、多语言对话和原生图文视频多模态理解,融合DeltaNet线性注意力与全注意力,含256专家。
Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF:中文多模态长上下文本地MoE模型
一款35B参数MoE架构的去审查大模型,每次推理仅激活约3B参数,支持文本、图像、视频原生多模态输入,覆盖201种语言,262K上下文可扩展至1M。经过Genesis-SVD张量修复与Hermes智能体微调,适合本地部署用于创意写作、SVG生成、代码辅助和多模态智能体任务。APEX版最低约需25GB内存或22GB显存。
MiniCPM5-1B-Agentic-Tooluse-GGUF:轻量代理工具调用小模型
这是基于 openbmb MiniCPM5-1B、经 Nemotron SFT+DPO 修复微调后的 1B 参数代理工具调用模型,提供 F16、Q8_0、Q4_K_M 三档 GGUF 量化。适合想在本地或边缘设备上做 AI 代理、需要模型按 XML 函数块格式稳定选择并调用工具的开发者与研究者。
Ornith-1.0-35B-GGUF:面向编码代理的开源模型
Ornith-1.0-35B 是基于 Qwen3.5 微调的 35B MoE 模型,主打自主代理式编程,支持工具调用与代码生成。适合需要本地或私有部署智能编码助手、终端自动化脚本与 Agent 框架的开发者。提供 IQ1 到 Q6、BF16 多档 GGUF,最低约 4.
Nanbeige4.2-3B-GGUF:3B参数中文轻量对话量化
Nanbeige4.2-3B-GGUF 是基于 Nanbeige4.2-3B 的 GGUF 量化合集,参数规模 3B,支持中英文文本生成。提供 Q2 到 Q8 共 8 档量化,适合硬件资源有限的本地用户。极小文件 Q2/Q3 适合老旧设备与最低 4GB 内存环境;Q5/Q6/Q8 保留更多质量但需要 3GB 以上显存。
MiniCPM5-2B-GGUF:本地可跑的2B长上下文中文助手
MiniCPM5-2B-GGUF 是面壁智能开源的2B参数稠密 Transformer GGUF 量化仓库,主打本地部署、端侧推理与资源受限场景。原生支持 131K 长上下文,覆盖代码、数学、工具调用与智能体任务。
POCKET-35B-GGUF:CPU可跑的35B本地对话模型
POCKET-35B-GGUF 是 35B 参数的稀疏 MoE 对话模型,由 Darwin-36B-Opus 量化而来,主打无显卡本地运行。适合没有 GPU、做日常对话与写作辅助的本地用户。最低 IQ1_M 约 8 GB 可装入 16 GB 内存设备,Q2_K 推荐 12.5 GB 内存,Q4_K_M 推荐 24.
TwIL-LM3:3B参数形式逻辑推理专用模型
TwIL-LM3 是基于 SmolLM3-3B 微调的 3B 参数形式逻辑推理模型,专注一阶逻辑翻译、蕴涵判定、语义解析、Lean 形式化与证明评审等结构化任务。适合需要机器可读符号化推理输出的研究者与本地推理开发者,硬件门槛低,Q4_K_M 量化可在 4GB 显存或纯 CPU 起步。
Bonsai-27B-gguf:27B模型一比特极限压缩本地可跑
本仓库是prism-ml基于Qwen3.6-27B的1比特二值化GGUF量化版本,把27B参数混合注意力模型压到约3.9GB(每权重1.125bit),主打长文本对话、代码生成与本地离线推理。适合在普通笔记本、单卡GPU或手机上跑27B级模型的用户,最低约4GB内存即可加载主语言模型,附带视觉塔可处理图像输入。
Agents-A1-4B-Q8_0-GGUF:4B 视觉智能体本地小钢炮
Agents-A1-4B-Q8_0-GGUF 是 InternScience 开源的 4B 视觉语言 Agent 模型,专注长程搜索、工具调用与多约束指令遵循,附带 mmproj GGUF 支持图文输入。Q8_0 主文件约 4GB,最低 5GB 内存或 4.5GB 显存,推荐 8GB 内存或 5.5GB 显存。
Qwen3.6-14B-A3B-FableVibes-GGUF:14B推理蒸馏的消费级长思维模型
Qwen3.6-14B-A3B-FableVibes 由 Qwen3.6-35B-A3B 经 REAP 剪枝到 14B 活跃参数,再用 Claude Fable 5 推理痕迹做 QLoRA 蒸馏得到。回答前会输出思考 token,适合中文写作、编程与多步规划。Q3_K_M 至 Q4_K_M 即可在消费级显存上跑通。
Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF:35B多模态无审查混合架构本地模型
围绕 35B 总参数、约 3B 激活的 MoE 架构,主打本地无审查角色扮演、SVG 创作与 Hermes 函数调用式 agent 任务,原生支持文本、图像、视频多模态。建议至少保留 22.5 GB 显存或 25.
Nail-Qwen3.6-35B-A3B-GGUF:高速MoE对话与视觉编程
Nail 是基于 Qwen3.6-35B-A3B 重新调参的 35B 参数 MoE 量化模型,专为追求极速响应的多轮对话、推理与自主软件工程场景设计。它内置精简系统提示以抑制过度思考,并通过 llama.cpp 与 ollama 等运行时支持文本与视觉任务。
Qwopus3.6-27B-Fusion-GGUF:融合推理与代码的27B单代理
Qwopus3.6-27B-Fusion-GGUF 是 27B 参数、qwen35 混合线性与全注意力架构的 GGUF 量化版本,把多步推理与代码执行能力合并到一个模型里,面向希望本地运行闭环创作编程代理的开发者。默认开启思考模式,最低 Q3_K_M 需约 12GB 内存与 10.
Qwythos-27B-v1-GGUF:百万上下文多模态推理模型
基于 Qwen3.5-27B 的 27B 参数稠密混合模型,保留原生 MTP 推理头、视觉塔与 1,048,576 token 长上下文能力,支持图像输入、工具调用与代理式任务。适合需要本地部署大尺寸推理模型、有较高显存或内存预算的研究者与开发者。
Qwopus3.6-27B-Fusion-GGUF:融合推理与代码的27B一站式代理
Qwopus3.6-27B-Fusion-GGUF 为 27B 融合模型,把推理稳定性与代码生成能力合二为一,面向希望一位代理完成规划、写码、自修闭环的本地用户。Q4_K_M 量化约 16GB 显存起跑,推荐 24GB 以上显卡,支持图像输入。适合玩单文件应用、研究任务向量融合的本地开发者与代理式编程实验者。
Neutrino-8B:8B 三元量化对话与工具调用模型
Neutrino-8B 是基于 Qwen3-8B 的 8B 参数三元量化聊天模型,每个线性层以五值编码存储为亚 2 比特权重,整模型容器约 3.9 GB,适合在 Mac、CPU 服务器或显存约 6.5 GB 的入门显卡上离线加载。模型卡写明带工具调用与结构化 JSON 输出训练,可用作本地对话、长文生成或轻量函数代理。
Mizan-27B-Turkish-Legal-LLM-Q4_K_M-GGUF:土耳其法律问答与法务草稿助手
基于 Qwen3.6-27B 的土耳其法律领域微调模型,27B 参数,采用 4-bit NF4 QLoRA 在 21 万余条土耳其法律问答数据上做文本 SFT,主打土耳其语法律问答、合同与 KVKK 等子领域分析与 RAG 生成。
LFM2.5-2.6B-GGUF:本地部署的多语言轻量文本生成模型
LFM2.5-2.6B-GGUF 是 LiquidAI 推出的 2.6B 参数混合架构模型,专为设备端部署设计,支持中文在内的十余种语言文本生成。适合想在笔记本、低配台式机或边缘设备上离线运行轻量语言模型的用户,最低 4GB 内存即可加载 Q4 量化版本,对独立显卡依赖较低。
Qwen3.6-27B-MTP-GGUF:视觉多模态长上下文MTP编码模型
Qwen3.6-27B-MTP-GGUF 是 unsloth 在 Hugging Face 发布的 27B 参数多模态语言模型 GGUF 仓库,转发 Qwen3.6-27B 原生权重并附 mmproj 视觉投影文件,主打代理式编码、工具调用、原生 26 万 token 上下文与 MTP 多 Token 预测加速。
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive:去审查激进MoE多模态长上下文
基于 Qwen3.6-35B-A3B 底座的激进去审查变体,35B 总参数 MoE 架构每次仅激活约 3B,支持 262K 原生上下文与文本、图像、视频多模态输入。Q4/IQ4 量化估计需要 24GB 以上内存或 20GB 以上显存,适合具备高端硬件、追求长上下文多模态推理且不介意去除内容审查限制的本地部署用户。
Ornith-1.0-9B-GGUF:面向代理编程的轻量9B模型
Ornith-1.0-9B 是面向智能体编程的 9B 密集模型,专为单 GPU 部署优化,擅长终端编码任务、工具调用与多步推理。模型卡未给出通用聊天定位,更适合接入代理框架或本地 OpenAI 兼容服务来自动化编码。Q4_K_M 量化约需 5GB 显存即可运行,BF16 全精度建议 8GB 以上显存或 13GB 内存。
nemotron-3.5-asr-streaming-0.6b:0.6B 参数多语种流式语音转文字模型
NVIDIA 推出的 0.6B 参数多语种流式语音识别模型,基于缓存感知 FastConformer-RNNT 架构,原生支持 40 种语言-地区转录,可配置 80 毫秒到 1120 毫秒分块以在延迟与精度间权衡。适合需要多语种实时字幕、语音代理、跨语种转写或多语种批量转录的开发者与团队,输出自带大小写与标点。
Supra2-100M-Instruct:百兆参数实验型英文对话模型
基于 Qwen3 架构的 100M 参数英文指令模型,仅 2K 上下文,提供 F16 GGUF(约 62.5MB)。适合低配置设备尝鲜轻量文本生成或研究小模型行为的开发者与爱好者。不适合需要事实准确性或多轮复杂推理的生产场景。
Ornith-1.0-35B-GGUF:面向代理编码的轻量推理模型
Ornith-1.0-35B 是 35B 参数规模的自改进代理编码模型家族成员,针对单卡部署优化。适合需要在本地或私有化环境运行编码代理、调用工具并完成代码理解与改写任务的开发者与团队。Q4 量化需约 18GB 显存或 20.5GB 内存,硬件门槛偏高,入门级消费显卡通常难以承载。
Muse-Glimmer-30B-GGUF:本地部署的多模态智能体模型
Muse-Glimmer-30B 是 Meta 推出的 30B 参数多模态语言模型,专为本地智能体任务设计,集成多步推理、工具调用、失败恢复和图文理解能力。通过 4-bit 量化可压缩到 24–32GB 显存运行,适合需要在本地搭建自主代理、代码助手或多模态应用的研究者和开发者,使用门槛中等偏高。
Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF:去审查长文创作编程三合一本地模型
基于 Qwen3.8-27B 的 27B 参数多阶段微调模型,主打去审查与压缩思考块,支持视觉输入与 256k 上下文,并提供三种推理档位。适合需要长文创意写作、角色扮演、辅助编程且拥有 16GB 以上显存的本地用户,工具调用建议 Q4_K_M 以上量化。
Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF:去审查强化推理全能型
基于Qwen3.6-27B多阶段微调并经Heretic去审查,强化思考推理、指令跟随与通用能力,支持视觉与长上下文。27B体量对显存门槛较高,Q4量约需16GB显存、Q8需30GB以上,适合中文高级用户与本地推理爱好者使用MTP可进一步提速。
TIPOv2-1B-A200M:文生图提示词扩写专家
TIPOv2-1B-A200M 是一个 1B 总参数、每 token 仅激活约 200M 的稀疏 MoE 模型,专门把用户输入的简短提示词扩写为更详细的长描述,供 Stable Diffusion 等文生图扩散模型使用。
Qwen3.6-40B-Grand-Intelligence-Fable-Fusion-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF:40B级多阶段融合的全能本地对话模型
40B 参数多阶段微调的开源大模型,由 Qwen3.6 27B 通过多版本融合扩展而成,强化指令遵循与深度思考,并经 Heretic 处理降低拒绝率。支持 256k 长上下文和视觉输入,提供 IQ2 至 Q8 多档 GGUF 与 MTP 加速版本。
Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V8-GGUF:多模态混合注意力去审查大模型
35B 参数 MoE 模型,每次前向约激活 3B 参数;支持文本、图像、视频多模态输入,原生 262K 上下文,YaRN 可扩至 1M。融合 Hermes 智能体与函数调用微调,并经 Genesis 张量修复,主打低拒答。
Muse-Glimmer-30B-GGUF:本地多模态代理大模型
Muse-Glimmer-30B 是 Meta 发布的 30B 参数本地代理大模型,集成多步推理、工具调用、失败恢复与图像理解,主打端到端自动代理任务。适合需要在本地离线部署 AI 代理、编写调试代码或处理图文混合输入的开发者与研究者。
gemma-4-31B-it-scotoma-2-GGUF:31B参数去套语写作微调
这是基于Google gemma-4-31B-it的DPO偏好微调量化版本,通过三轮共9.3k对的训练减少角色扮演写作中的重复套语,包括堆叠形容词、破折号插入语与反义否定结构。适合中文角色扮演、创意写作与文本生成用户。Q3量化至少需要14GB内存或12GB显存,Q4量化需18.
Jack-3.8-27B-Coder-16GB-VRAM:本地16G显存长上下文编程代理
Jack-3.8-27B-Coder-16GB-VRAM 是一款基于 27B 参数的本地编程专用模型,专为长时间运行的软件工程代理场景设计,覆盖规划、编码、调试、代码审查、测试设计与多轮工具调用。
NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF:30B MoE混合架构多语言推理底座
30B 总参数、3B 激活的 NVIDIA 混合架构模型,结合 Mamba-2、MoE 与 Attention 层,支持长上下文与工具调用。仓库提供 IQ1 到 Q8 多档 GGUF 量化,IQ1 最低约 4GB 显存即可加载,桌面显卡也能尝试低比特版本。
qwen3.8-27b-abliterated-3.69bpw-12GB-MTP.gguf:无审查混合量化长上下文本地点推理
基于 Qwen3.8-27B 的无审查派生版本,沿用 Gated-DeltaNet 混合注意力与 MTP 推测解码,3.69 bpw 混合量化将文件压至约 11.73 GiB,原生支持 262K 上下文。适合本地长文档阅读、摘要与编程辅助,需约 24GB 内存或 19.5GB 显存,无内置安全层。
LFM2.5-VL-3B-GGUF:面向端侧的3B视觉语言多模态模型
LFM2.5-VL-3B-GGUF 是 LiquidAI 发布的 3B 参数视觉语言模型,采用混合架构主打边缘与端侧部署,支持图片加文本输入并覆盖十余种语言。适合需要在本地设备上做图像问答、视觉理解的开发者与个人用户,最小仅需 4GB 内存即可加载 Q4 量化,适合笔记本、迷你主机等资源受限场景。
Qwen3.8-27B-Uncensored-YMQ-MTP-GGUF:27B混合架构无审查代码助手
基于 Qwen3.8-27B 去审查权重,zerodigest 用 YMQ-Compiler 输出 GGUF 混合精度量化版,主打本地代码智能体与 RooCode/Aider 类工具。提供约 9.
Qwen3.8-27B-OBLITERATED-GGUF:去审查版红队研究模型
Qwen3.8-27B 的去审查 GGUF 量化版本,去除模型对齐限制,面向 AI 安全红队研究与对抗测试场景。基座来自 OBLITERATUS 的 27B 规模文本模型,标签明确标注 abliterated、uncensored、red-team。
Qwen3.8-9B-GGUF:9B 蒸馏推理模型 GGUF 量化版
本仓库提供 empero-ai 出品的 Qwen3.8-9B GGUF 量化文件,原模型将 Qwen3.8 2.4T A95B 教师能力蒸馏到 Qwen3.5-9B 架构,属于 9B 参数推理模型,主攻文本生成与思维链推理。适合想在消费级硬件上体验 Qwen3.8 思路的个人开发者和研究者。运行需较新 llama.
Qwen3.6-40B-Fable-Fusion-6-Core-Deckard-Eleanor-Heretic-Uncensored-NM-DAU-NEO-MAX-MTP-GGUF:40B 多阶段融合全能文本视觉模型
基于 Qwen3.6 27B 多核融合并扩展到 40B 参数的多阶段微调模型,主打指令遵循、推理思考、编程写作等全用途场景。原生 256k 上下文并支持视觉输入,需 10.5GB 以上显存才能加载 IQ2 量化,24GB 显卡建议使用 IQ4 量化。适合拥有高端显卡、追求长上下文与去审核体验的本地推理和创作用户。
Qwen3.8-27B-GGUF:27B 多模态中文对话量化版
本仓库为 Qwen3.8-27B 的 llama.cpp GGUF 量化版本,支持中英文文本生成、图文理解、MTP 推测解码与工具调用。提供 IQ2 到 Q8_0 全套量化以及 BF16 原版,适合本地高显存用户追求质量、低显存用户追求可用。
Muse-Glimmer-30B-Abliterated-GGUF:本地多模态去拒绝30B模型
基于Meta的30B多模态智能体模型的去拒绝权重修改版,GGUF格式打包,可在单卡消费级GPU或CPU上完全离线运行。支持131K长上下文、图像输入与DFlash投机解码加速,适合本地部署研究与智能体任务,但属实验性版本,需较高端硬件与新版llama.cpp。
K2-Horizon-MoVA-36B-A4B-GGUF:36B总参4B激活的MoE长上下文推理
IFM 推出的 K2-Horizon-MoVA-36B-A4B 是稀疏 MoE 模型,总参数36B、每 token 仅激活4B,主打512K长上下文、推理与智能体工具调用。当前 GGUF 仓库仅提供 BF16 文件,显存门槛约23GB、内存26.5GB起步,需支持 K2 Horizon 架构的 llama.
Ornith-1.5-35B-A3B-GGUF:35B MoE 编码智能体长上下文
Ornith-1.5-35B-A3B 是 35B 混合专家(MoE)文本生成模型,每 token 激活约 3B 参数,面向编码与智能体任务,支持长上下文与工具调用。适合本地或私有化部署的开发者与 Agent 工程师。Q4_K_M 量化约需 20GB 内存或显存,长上下文推理建议多卡 GPU。
Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V7-GGUF:原生多模态去审查大模型
基于Qwen3.6的35B参数MoE模型(每次激活约3B),原生支持文本、图像、视频多模态与262K长上下文。经Genesis信号修复与Hermes代理数据微调,主打低拒绝率、Agent任务与创作。APEX量化约21.9GB,需25.5GB内存或22.5GB显存;Q8量化约35GB,需41GB内存或35.5GB显存。
Dirk-Qwen3.8-27B-GGUF:精简模板默认的27B视觉语言模型
Dirk 是基于 Qwen3.8-27B 的 27B 视觉语言 GGUF 量化版本,原生支持图像输入并保留 MTP 多 token 预测投机解码头,推理档位可在 low、medium、xhigh 间切换,适合需要在消费级显卡上做代码、视觉问答和知识型任务的中高级本地用户。
Qwen3.8-27B-Ridge-GGUF:原生MTP加速的多模态27B量化版
这是 Qwen3.8-27B 的 GGUF 量化仓库,主打 11.73 GiB 的 Ridge 3.69 bpw 混合精度文件,并保留原生 MTP 草稿头以支持推测解码。基础模型为支持视觉输入的多模态推理模型,原生 262k 上下文可经 YaRN 扩展到 1M。
Qwen3.8-27B-Uncensored-GGUF:本地部署的去审查语言模型
Qwen3.8-27B-Uncensored-GGUF 是 orcarouter 发布的 27B 参数去审查大语言模型 GGUF 量化合集,适合想本地运行中等规模对话模型、追求回答自由度较高的中文用户。硬件门槛跨度大,从 8GB 内存的极限压缩版到 31.5GB 内存的全精度版均可部署,覆盖入门台式机到高端工作站。
Nail-Qwen3.6-35B-A3B-GGUF-MTP:MTP加速的35B多模态推理模型
基于 Qwen3.6-35B-A3B 的 GGUF 量化版,保留 MTP 推测解码头并内置改良 chat template 与系统提示,支持中英双语、原生 262K 长上下文与视觉输入,主打 agentic 编程、多轮对话与复杂推理。最低 IQ3_S 需约 15.5GB 显存,BF16 双分片需 96GB+ 内存。
nl2sh-1.5b-Q4_K_M:英文需求转单条Shell命令
基于 Qwen2.5-Coder-1.5B-Instruct 用 1.5B 参数底座配合 LoRA 微调并合并权重,专把一句英文需求翻译成单条 Bash 命令。约 941 MB,CPU 即可加载,约一秒返回。适合需要在本地终端把自然语言随手转成命令、又不想上云的用户。门槛低,普通笔记本就能跑。
Qwen3.8-27B-GGUF:支持图像理解的多模态对话量化版
基于Qwen3.8-27B的多模态对话模型量化版本,支持图像理解与文本生成,原生提供思维链开关。提供从IQ1到Q8_0十余种量化文件与独立视觉投影组件,最低约3.5GB显存可启动小量化,但完整能力需中高端显存。适合具备中高显卡配置、想在本地运行视觉对话与推理任务的用户。
Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF:去审查27B长文本生成模型
基于Qwen3.8-27B双轮ARA去审查的27B参数文本生成模型,采用Gated DeltaNet混合架构支持262K上下文。适合追求低过滤创意写作、长篇角色扮演和成人向内容研究的用户,需较高显存,最低建议16GB内存跑Q4量化,24GB显卡可获得更佳体验。
Ornith-1.5-35B-A3B-GGUF:多模态对话与视觉推理
Ornith-1.5-35B-A3B-GGUF 是面向本地图像—文本对话的稀疏 MoE 量化模型,支持视觉输入、262144 长上下文与思考开关。总参数约35B,每 token 激活约3B,但内存主要按 35B 估算;适合显存较大或可把专家卸载到系统内存的用户。
Qwen3.8-27B-Uncensored-Cyber-GGUF:27B去审查的网络安全图文问答
Qwen3.8-27B-Uncensored-Cyber 是 27B 参数去审查微调版本,聚焦网络安全与攻防话题,可搭配 mmproj 视觉投影器实现图文输入。仓库提供 Q4–Q8 多档 GGUF 量化,16GB 内存即可加载 Q4,适合需要完整回答敏感安全话题、对指令审查容忍度低的研究者与红队演练。
Qwen3.8-4B-Distill-GGUF:4B 蒸馏推理模型量化包
Qwen3.8-4B-Distill 是把 Qwen3.8 2.4T A95B 大模型蒸馏到 Qwen3.5-4B 架构而来的 4B 参数推理模型,本仓库为 GGUF 量化版。适合想在消费级硬件上本地跑推理模型、又不愿承担大模型显存开销的用户。属于 Qwen3.
Qwen3.8-27B-GSQ-RCO-GGUF:27B 视觉语言模型非均匀量化
Qwen3.8-27B(27B 参数视觉语言模型)的非均匀 GGUF 量化版,使用 GSQ 与 RCO 混合精度方法逐张量分配精度,提供 IQ2 到 IQ3 多档并附带视觉投影器支持图文多模态。适合想在消费级硬件跑 27B 多模态模型的用户,最低约 8GB 内存或 7GB 显存可加载 IQ2 档,IQ3 档推荐 14.
Qwen3.8-9B-Distill-GGUF:蒸馏9B推理模型的GGUF量化版
基于 Qwen3.5-9B 架构蒸馏自 Qwen3.8 教师模型,主打推理能力,MMLU 提升明显。提供 Q4 到 BF16 多档 GGUF 量化,9B 参数量适合消费级显卡和笔记本本地运行。注意这是 Gated DeltaNet 混合架构,需使用较新的 llama.cpp(支持 Qwen3.
Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF:直答型多模态加速生成
这是基于 Qwen3.8-27B 的去审查 Aggressive 变体,27B 参数保留原生多模态、长上下文与推理能力,主打直接回答、低拒答,并附带 HauhauCS FastMTP 加速侧车。适合追求快速响应、不在意安全过滤的本地用户,硬件门槛较高,Q4 量级需 16GB 内存,Q8 需 31.5GB 以上。
Qwen3.8-27B-CRACK-GGUF:去审查多模态研究模型
基于 Qwen3.8-27B 量化的多模态去审查研究模型,支持图像与视频理解、原生 262K 上下文、可控推理强度,附带 MTP 推测解码头。适合安全研究人员做红队测试或越狱研究,需要至少 14GB 显存(Q4 量化)才能运行,量化文件覆盖 IQ2 到 Q8 各档。
Huihui-Qwen3.8-27B-abliterated-GGUF:27B 去审查图文对话量化包
基于 Qwen3.8-27B 通过 abliteration 移除部分拒绝行为的去审查版本,支持图像与文本输入。仅消融 18-51 层,保留视觉与 MTP 模块,并对关键层做混合精度处理以稳定生成质量。适合本地受限话题研究与消融实验用户,硬件门槛 8GB 显存起步,推荐 16GB 以上。
Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF:9B 参数去审查指令强化 GGUF 量化包
基于 Qwen3.5-9B 的多阶段微调与合并版本,主打指令遵循与通用智能提升,并移除拒绝行为,属于去审查类(Heretic)文本生成模型,同时支持视觉理解,需额外下载 mmproj 文件。
Qwen3.8-27B-OBLITERATED:去审查红队研究专用大模型
基于Qwen3.8-27B的去审查27.8B参数文本生成模型,通过迭代权重手术移除硬拒答与软偏转,适合AI安全研究、对齐测试和本地控制用户。提供Q2到Q8_0共八种GGUF量化,Q2_K最低约7GB显存可加载,Q4_K_M推荐16GB显存或19.5GB内存。
Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V9-GGUF:长上下文多模态去审查混合专家
基于 Qwen3.6-35B-A3B 的 MoE 架构微调模型,总参数 35B、单次激活约 3B,原生支持文本、图像、视频多模态与 262K token 长上下文,可经 YaRN 扩展到 100 万 token。
Ornith-1.5-9B-GGUF:轻量代码与智能体推理模型
Ornith-1.5-9B 是一款面向终端编码与智能体场景的 9B 密集模型,在 Qwen3.5 与 Gemma4 基础上继续预训练并通过自改进循环优化。模型默认输出链式推理,支持工具调用与最长 262K 上下文,可经 YaRN 缩放扩展到约 1M tokens。
Qwen3.8-27B-GGUF:本地可跑的图文多模态量化版
这是 ggml-org 发布的 Qwen3.8-27B 的 GGUF 量化版本,基础模型 pipeline_tag 标注为 image-text-to-text,属于图文多模态模型,采用 Apache 2.0 协议。仓库提供 Q4_K_M、Q8_0 和 BF16 三种精度文件,对显存与内存有一定门槛。
Tiel-Coder-35B-A3B-GGUF:面向编码与多轮对话的35B MoE
Tiel-Coder-35B-A3B 是 Ornith-1.5-35B-A3B 的自量化 GGUF 版,采用 256 专家 8 激活的 MoE 架构,主打代理式编码与多轮对话,同时支持视觉输入。在 SWE-bench-Live 修复 12/25 题,但 MMLU-Pro 仅 73.7,弱于 Nail 等同档对手。
Qwen3.8-27B-DFlash2-GGUF:块扩散加速草稿模型
这是 Qwen3.8-27B 的 DFlash 2 推测解码草稿模型镜像,并非可独立运行的对话模型,必须搭配 Qwen3.8-27B 目标主模型在 llama.cpp 推测解码服务内使用,通过块扩散一次预测多个 token 提升生成速度。适合已在本地部署 Qwen3.
Qwythos-9B-Claude-Mythos-5-1M-GGUF:百万上下文推理视觉多模态
基于 Qwen3.5-9B 的全参数推理模型,支持原生函数调用、图像理解与百万 token 长上下文,适合需要长文分析、工具调用与网络安全、生物医药等技术问答的用户。Q4 量化可在 8GB 内存或 6GB 显存设备运行,启用完整 1M 上下文通常需要多卡或 KV-cache 卸载。
Qwen3.8-27B-Uncensored-OrcaRouter-GGUF:27B视觉多模态本地研究版
Qwen3.8 27B 参数视觉语言模型的 GGUF 第三方量化版,已通过 abliteration 移除内置安全拒绝层,保留图文理解、工具调用与 MTP 投机解码能力,理论上下文 262K。Q4_K_M 最低约 16GB 内存或 14GB 显存,Q6_K 需约 24GB 内存。
Qwen3.6-27B-Uncensored-HauhauCS-Aggressive:去审查多模态直答激进版
基于官方 Qwen3.6-27B 的 27B 参数多模态去审查变体,原生支持文本、图像、视频并自带 mmproj 文件。Aggressive 版在敏感提示下跳过铺陈与免责声明直接作答,测试拒答率为 0/465。K_P 自定义量化在体积与质量间较好平衡,但 27B 体量对显存内存要求较高,建议至少 16GB 显存起步。
Qwen3.8-27B-Uncensored-GGUF:去审查版中文多模态大模型
Qwen3.8-27B 的去审查 GGUF 量化版,通过 Heretic 去拒绝处理把 100 条有害提示的拒答从 98 降到 12。保留 27B 原架构、262K 上下文、视觉能力与 MTP 推测解码头。适合想要宽松回答、本地有 16GB 以上显存或 32GB 以上内存的用户。