下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本仓库为 empero-ai/Qwythos-9B-v2 的 GGUF 量化分发版本,并非独立训练成果,训练细节、能力评估与训练数据请以原 Qwythos-9B-v2 模型卡为准。提供 Q4_K_M、Q5_K_M、Q6_K、Q8_0 与 BF16 五档纯文本权重,并附对应 -MTP- 变体以启用 llama.cpp 推测解码;同时附带 mmproj-BF16 视觉投影器,支持图文输入与 1M token YaRN 长上下文。运行端适配 llama.cpp、Ollama、LM Studio、jan、KoboldCpp 等 GGUF 运行时。混合架构中 Gated-DeltaNet/SSM 张量在 K-quants 内被抬升到更高精度以保留敏感状态。
更适合谁
- 需要在消费级显卡上做链式思考推理的中英文用户
- 想本地离线运行并支持 1M token 长文本与图文输入的实验者
- 对低温度解码稳定性敏感、关心输出可复现性的用户
- 计划在 Ollama、LM Studio 等 GGUF 运行时中快速加载部署的人
典型使用场景
- 链式思考类问答、数学与逻辑推理任务
- 长文档摘要、代码分析、多轮深度对话
- 图文混合输入的多模态问答
- 本地离线环境下的无审查对话与研究实验
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
去循环解码
v2 通过 FTPO 把循环率从 6.7% 降到 0%,可直接使用 greedy 或 temp 0
MTP 推测解码
恢复 Qwen3.5 原生多 token 预测头,可配合 llama.cpp draft-mtp 加速
1M 长上下文
集成 YaRN rope 缩放,理论支持 1,048,576 token 窗口
多模态视觉
提供 mmproj 文件,可与文本量化组合进行图文输入
混合精度量化
SSM 张量在 K-quants 中保留更高位宽,减小量化损失
硬件怎么准备
- Q4_K_M 起步显存约 5GB、推荐 6GB 显存或 8GB 内存
- Q5_K_M 与 BF16 起步显存 6GB、推荐 7GB 显存或 8GB 内存
- Q6_K 起步显存 7GB、推荐 8GB 显存或 9.5GB 内存
- Q8_0 起步显存 9.5GB、推荐 11GB 显存或 13GB 内存
量化版本怎么选
- 不确定选哪一档时优先 Q4_K_M,体积最小且质量尚可
- 想要更好效果且显存充裕可升 Q5_K_M 或 Q6_K
- 需要近无损精度或用作二次转换基座选 BF16,但需 16GB 以上显存
- 想启用 MTP 推测解码必须下载带 -MTP- 后缀的对应量化文件
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp 命令行或 server,MTP 推测需较新的 draft-mtp 构建
- Ollama 直接导入 GGUF 文件即可使用
- LM Studio、jan、KoboldCpp 将文件放入模型目录即可加载
- 图文输入需要同时加载文本量化与 mmproj-BF16 视觉投影器
采用前要知道的限制
- 本仓库为量化分发,模型卡未给出量化后独立跑分
- 视觉塔未在 Qwythos 训练中微调,图文能力继承 Qwen3.5-9B 基座行为
- 完整 1M 上下文通常需要多卡或激进的 KV-cache 卸载
- 主语言为英文,模型卡未说明中文训练语料占比