← 返回模型库

chimingw/Qwen3.8-27B-Uncensored-OrcaRouter-GGUF

Qwen3.8-27B-Uncensored-OrcaRouter-GGUF:27B视觉多模态本地研究版

Qwen3.8 27B 参数视觉语言模型的 GGUF 第三方量化版,已通过 abliteration 移除内置安全拒绝层,保留图文理解、工具调用与 MTP 投机解码能力,理论上下文 262K。Q4_K_M 最低约 16GB 内存或 14GB 显存,Q6_K 需约 24GB 内存。

多模态长上下文本地研究工具调用
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库由 chimingw 维护,是 orcarouter/Qwen3.8-27B-Uncensored-FP8 的非官方转换与量化仓库,未做任何额外训练、微调或对齐改动。模型能力来自上游 Qwen3.8 27B 原生视觉语言模型,主打混合注意力、长上下文与多模态原生支持;本仓库额外提供 Q8_0、Q6_K、Q5_K_M、Q4_K_M 四档独立 GGUF 量化及 BF16/F16 分片,并附可选 MTP 投机解码草稿。运行工具以 llama.cpp 指定 commit 为主,也兼容 Ollama 与 LM Studio 主流量化加载。安全性、可解释性与拒答机制描述均继承自上游模型卡,本仓库未独立验证,模型卡未提供 GGUF 独立基准测试结果。

更适合谁

  • AI 安全与拒答机制研究者
  • 红队评估与稳健性测试人员
  • 大模型可解释性与对齐研究团队
  • 需要长上下文与多模态能力的本地实验者

典型使用场景

  • 图文多模态对话与视觉理解实验
  • 工具调用与函数工作流测试
  • 长上下文与混合注意力压力测试
  • MTP 投机解码兼容性验证

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

27B 密集视觉语言原生支持

图像输入配合 AUX 中 BF16 多模态投影器,可做图文问答与视觉理解

262K 长上下文与混合注意力

声称最大位置 262144 token,采用 Gated DeltaNet 线性与全注意力混合架构

推理控制与工具调用保留

源模型保留 reasoning 与 tool 消息结构,可用于函数调用工作流

可选 MTP 投机解码草稿

提供与源版本匹配的 Q8_0 MTP 草稿,可配 llama-server --model-draft 使用

多档独立 GGUF 量化

Q4_K_M 至 Q8_0 与 BF16 分片均由 BF16 父权重独立产出

硬件怎么准备

  • Q4_K_M 最低约 16GB 内存或 14GB 显存
  • Q5_K_M 与 BF16/F16 最低约 20GB 内存或 17GB 显存
  • Q6_K 最低约 24GB 内存或 20.5GB 显存
  • Q8_0 MTP 草稿最低约 31.5GB 内存或 27.5GB 显存

量化版本怎么选

  • 入门体验建议选 Q4_K_M,体积最小且本地可跑
  • 编码与工具调用场景优选 Q5_K_M,内存仍可控
  • 显存充足且在意保真度时升级 Q6_K 或 Q8_0
  • BF16 分片为四档量化的父权重,普通用户不建议下载

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q413 GB14 GB16 GB19 GB文件 ↗
BF1616 GB17 GB19.5 GB24 GB文件 ↗
F1616 GB17 GB19.5 GB24 GB文件 ↗
Q516 GB17 GB19.5 GB24 GB文件 ↗
Q619 GB20.5 GB23.5 GB28.5 GB文件 ↗
Q825 GB27.5 GB31.5 GB38 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 14GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 16GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • llama.cpp 主线按模型卡推荐 commit 加载主量化
  • Ollama 加载 Q4_K_M、Q5_K_M、Q6_K、Q8_0 主量化文件
  • LM Studio 加载同款 GGUF 主量化
  • llama-server 配合 --model-draft 使用 MTP 投机解码草稿

采用前要知道的限制

  • 已通过 abliteration 移除安全对齐,无内置护栏
  • BF16 仅扩展 FP8 表示数值,无法恢复源前权重
  • 当前发布未做独立质量、速度或多模态基准
  • MTP 草稿需运行工具支持且配对同源版本,不保证所有场景提速