← 返回模型库

empero-ai/Qwythos-9B-v2-GGUF

Qwythos-9B-v2-GGUF:9B推理多模态长上下文模型

Qwythos-9B-v2-GGUF 是基于 Qwen3.5-9B 的 9B 参数 GGUF 量化推理模型,通过 FTPO 训练消除了低温度解码下的循环重复,恢复 MTP 头并保留多模态视觉塔。支持 1M token 长上下文,推理时先输出思考块再作答。

长上下文推理多模态视觉GGUF量化9B参数
查看模型源页面
下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库为 empero-ai/Qwythos-9B-v2 的 GGUF 量化分发版本,并非独立训练成果,训练细节、能力评估与训练数据请以原 Qwythos-9B-v2 模型卡为准。提供 Q4_K_M、Q5_K_M、Q6_K、Q8_0 与 BF16 五档纯文本权重,并附对应 -MTP- 变体以启用 llama.cpp 推测解码;同时附带 mmproj-BF16 视觉投影器,支持图文输入与 1M token YaRN 长上下文。运行端适配 llama.cpp、Ollama、LM Studio、jan、KoboldCpp 等 GGUF 运行时。混合架构中 Gated-DeltaNet/SSM 张量在 K-quants 内被抬升到更高精度以保留敏感状态。

更适合谁

  • 需要在消费级显卡上做链式思考推理的中英文用户
  • 想本地离线运行并支持 1M token 长文本与图文输入的实验者
  • 对低温度解码稳定性敏感、关心输出可复现性的用户
  • 计划在 Ollama、LM Studio 等 GGUF 运行时中快速加载部署的人

典型使用场景

  • 链式思考类问答、数学与逻辑推理任务
  • 长文档摘要、代码分析、多轮深度对话
  • 图文混合输入的多模态问答
  • 本地离线环境下的无审查对话与研究实验

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

去循环解码

v2 通过 FTPO 把循环率从 6.7% 降到 0%,可直接使用 greedy 或 temp 0

MTP 推测解码

恢复 Qwen3.5 原生多 token 预测头,可配合 llama.cpp draft-mtp 加速

1M 长上下文

集成 YaRN rope 缩放,理论支持 1,048,576 token 窗口

多模态视觉

提供 mmproj 文件,可与文本量化组合进行图文输入

混合精度量化

SSM 张量在 K-quants 中保留更高位宽,减小量化损失

硬件怎么准备

  • Q4_K_M 起步显存约 5GB、推荐 6GB 显存或 8GB 内存
  • Q5_K_M 与 BF16 起步显存 6GB、推荐 7GB 显存或 8GB 内存
  • Q6_K 起步显存 7GB、推荐 8GB 显存或 9.5GB 内存
  • Q8_0 起步显存 9.5GB、推荐 11GB 显存或 13GB 内存

量化版本怎么选

  • 不确定选哪一档时优先 Q4_K_M,体积最小且质量尚可
  • 想要更好效果且显存充裕可升 Q5_K_M 或 Q6_K
  • 需要近无损精度或用作二次转换基座选 BF16,但需 16GB 以上显存
  • 想启用 MTP 推测解码必须下载带 -MTP- 后缀的对应量化文件

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q44.2 GB5 GB6 GB8 GB文件 ↗
BF165.2 GB6 GB7 GB8 GB文件 ↗
Q55.2 GB6 GB7 GB8 GB文件 ↗
Q66.3 GB7 GB8 GB9.5 GB文件 ↗
Q88.4 GB9.5 GB11 GB13 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp 命令行或 server,MTP 推测需较新的 draft-mtp 构建
  • Ollama 直接导入 GGUF 文件即可使用
  • LM Studio、jan、KoboldCpp 将文件放入模型目录即可加载
  • 图文输入需要同时加载文本量化与 mmproj-BF16 视觉投影器

采用前要知道的限制

  • 本仓库为量化分发,模型卡未给出量化后独立跑分
  • 视觉塔未在 Qwythos 训练中微调,图文能力继承 Qwen3.5-9B 基座行为
  • 完整 1M 上下文通常需要多卡或激进的 KV-cache 卸载
  • 主语言为英文,模型卡未说明中文训练语料占比