下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本仓库由 chimingw 维护,是 orcarouter/Qwen3.8-27B-Uncensored-FP8 的非官方转换与量化仓库,未做任何额外训练、微调或对齐改动。模型能力来自上游 Qwen3.8 27B 原生视觉语言模型,主打混合注意力、长上下文与多模态原生支持;本仓库额外提供 Q8_0、Q6_K、Q5_K_M、Q4_K_M 四档独立 GGUF 量化及 BF16/F16 分片,并附可选 MTP 投机解码草稿。运行工具以 llama.cpp 指定 commit 为主,也兼容 Ollama 与 LM Studio 主流量化加载。安全性、可解释性与拒答机制描述均继承自上游模型卡,本仓库未独立验证,模型卡未提供 GGUF 独立基准测试结果。
更适合谁
- AI 安全与拒答机制研究者
- 红队评估与稳健性测试人员
- 大模型可解释性与对齐研究团队
- 需要长上下文与多模态能力的本地实验者
典型使用场景
- 图文多模态对话与视觉理解实验
- 工具调用与函数工作流测试
- 长上下文与混合注意力压力测试
- MTP 投机解码兼容性验证
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
27B 密集视觉语言原生支持
图像输入配合 AUX 中 BF16 多模态投影器,可做图文问答与视觉理解
262K 长上下文与混合注意力
声称最大位置 262144 token,采用 Gated DeltaNet 线性与全注意力混合架构
推理控制与工具调用保留
源模型保留 reasoning 与 tool 消息结构,可用于函数调用工作流
可选 MTP 投机解码草稿
提供与源版本匹配的 Q8_0 MTP 草稿,可配 llama-server --model-draft 使用
多档独立 GGUF 量化
Q4_K_M 至 Q8_0 与 BF16 分片均由 BF16 父权重独立产出
硬件怎么准备
- Q4_K_M 最低约 16GB 内存或 14GB 显存
- Q5_K_M 与 BF16/F16 最低约 20GB 内存或 17GB 显存
- Q6_K 最低约 24GB 内存或 20.5GB 显存
- Q8_0 MTP 草稿最低约 31.5GB 内存或 27.5GB 显存
量化版本怎么选
- 入门体验建议选 Q4_K_M,体积最小且本地可跑
- 编码与工具调用场景优选 Q5_K_M,内存仍可控
- 显存充足且在意保真度时升级 Q6_K 或 Q8_0
- BF16 分片为四档量化的父权重,普通用户不建议下载
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 14GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 16GB。
阅读 24GB 显存选型指南 →可以怎样运行
- llama.cpp 主线按模型卡推荐 commit 加载主量化
- Ollama 加载 Q4_K_M、Q5_K_M、Q6_K、Q8_0 主量化文件
- LM Studio 加载同款 GGUF 主量化
- llama-server 配合 --model-draft 使用 MTP 投机解码草稿
采用前要知道的限制
- 已通过 abliteration 移除安全对齐,无内置护栏
- BF16 仅扩展 FP8 表示数值,无法恢复源前权重
- 当前发布未做独立质量、速度或多模态基准
- MTP 草稿需运行工具支持且配对同源版本,不保证所有场景提速