← 返回模型库

empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF

Qwythos-9B-Claude-Mythos-5-1M-GGUF:百万上下文推理视觉多模态

基于 Qwen3.5-9B 的全参数推理模型,支持原生函数调用、图像理解与百万 token 长上下文,适合需要长文分析、工具调用与网络安全、生物医药等技术问答的用户。Q4 量化可在 8GB 内存或 6GB 显存设备运行,启用完整 1M 上下文通常需要多卡或 KV-cache 卸载。

9B 推理模型百万上下文视觉多模态函数调用
查看模型源页面
下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

本仓库为 Qwythos-9B 的 GGUF 量化分发仓库,模型本身是基于 Qwen3.5-9B 全参数后训练得到的推理模型,模型卡声明相对基座在 MMLU、GSM8K 等指标有提升,并支持 Qwen3.5 原生函数调用、视觉输入与通过 YaRN rope-scaling 扩展的百万 token 上下文。仓库同时提供 Q4_K_M、Q5_K_M、Q6_K、Q8_0、BF16 多档常规量化与对应 MTP 草稿版本,配套 CLIP 风格视觉投影器 mmproj 文件,可在 llama.cpp、Ollama、LM Studio、jan、KoboldCpp 等 GGUF 运行时加载使用;硬件门槛、显存占用与运行速度以具体 GGUF 文件为准,模型卡未给出第三方独立跑分。

更适合谁

  • 需要长上下文推理与工具调用的本地开发者
  • 想在 8GB 显存级设备体验 9B 推理模型的研究者
  • 网络安全、生物医药、临床医学等技术问答用户
  • 想尝试视觉+长文本多模态推理的爱好者

典型使用场景

  • 长文档、代码库与多文件项目的摘要与问答
  • 工具调用驱动的检索增强问答与自动化 Agent
  • 图像+长文本结合的多模态推理与图表阅读
  • 网络安全与生物医药领域的技术性问答

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

长上下文推理

默认开启 YaRN,原生 1M token 上下文,回复前带思维链

原生函数调用

按 Qwen3.5 规范发出工具调用块,工具回路自校正

视觉多模态

继承 Qwen3.5-9B 视觉塔,支持图像描述、OCR、图表理解

量化档位齐全

Q4 到 BF16 全档 GGUF 含 MTP 草稿版本,兼容主流 GGUF 运行时

通用基准提升

模型卡声明相对 Qwen3.5-9B 基座在 MMLU、GSM8K 等指标有提升

硬件怎么准备

  • Q4_K_M 文本权重:建议 8GB 内存或 6GB 显存起,适合常规上下文
  • Q5/Q6_K 文本权重:建议 8–9.5GB 内存或 7–8GB 显存,质量更稳
  • Q8_0/BF16 文本权重:建议 13GB 内存或 11GB 显存以上
  • 启用完整 1M 上下文:通常需要多卡张量并行或激进 KV-cache 卸载

量化版本怎么选

  • 入门默认选择 Q4_K_M,体积小且质量保留较好
  • 想使用 MTP 草稿推测时下载对应 MTP 量化版本
  • 显存宽裕可选 Q6_K 或 Q8_0 提升质量
  • 视觉输入需额外下载 mmproj-F16 文件与文本权重搭配使用

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q44.2 GB5 GB6 GB8 GB文件 ↗
BF165.2 GB6 GB7 GB8 GB文件 ↗
Q55.2 GB6 GB7 GB8 GB文件 ↗
F165.2 GB6 GB7 GB8 GB文件 ↗
Q66.3 GB7 GB8 GB9.5 GB文件 ↗
Q88.4 GB9.5 GB11 GB13 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • 可优先通过 Ollama、llama.cpp、LM Studio 核对模型加载兼容性。
  • 首次运行建议使用短上下文和单请求,确认稳定后再增加上下文或并发。

采用前要知道的限制

  • 推理模型,回复前始终带 ... 块,需较大 max_new_tokens
  • 贪心解码或极低温度容易出现重复循环,需使用推荐采样
  • SFT 为纯文本训练,视觉能力继承自基座未经独立评估
  • 无审查模型,正式面向终端的部署需自行叠加安全审核层

COMPARISON PATH

继续对比同类方案

不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。