下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
本仓库为 Qwythos-9B 的 GGUF 量化分发仓库,模型本身是基于 Qwen3.5-9B 全参数后训练得到的推理模型,模型卡声明相对基座在 MMLU、GSM8K 等指标有提升,并支持 Qwen3.5 原生函数调用、视觉输入与通过 YaRN rope-scaling 扩展的百万 token 上下文。仓库同时提供 Q4_K_M、Q5_K_M、Q6_K、Q8_0、BF16 多档常规量化与对应 MTP 草稿版本,配套 CLIP 风格视觉投影器 mmproj 文件,可在 llama.cpp、Ollama、LM Studio、jan、KoboldCpp 等 GGUF 运行时加载使用;硬件门槛、显存占用与运行速度以具体 GGUF 文件为准,模型卡未给出第三方独立跑分。
更适合谁
- 需要长上下文推理与工具调用的本地开发者
- 想在 8GB 显存级设备体验 9B 推理模型的研究者
- 网络安全、生物医药、临床医学等技术问答用户
- 想尝试视觉+长文本多模态推理的爱好者
典型使用场景
- 长文档、代码库与多文件项目的摘要与问答
- 工具调用驱动的检索增强问答与自动化 Agent
- 图像+长文本结合的多模态推理与图表阅读
- 网络安全与生物医药领域的技术性问答
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
长上下文推理
默认开启 YaRN,原生 1M token 上下文,回复前带思维链
原生函数调用
按 Qwen3.5 规范发出工具调用块,工具回路自校正
视觉多模态
继承 Qwen3.5-9B 视觉塔,支持图像描述、OCR、图表理解
量化档位齐全
Q4 到 BF16 全档 GGUF 含 MTP 草稿版本,兼容主流 GGUF 运行时
通用基准提升
模型卡声明相对 Qwen3.5-9B 基座在 MMLU、GSM8K 等指标有提升
硬件怎么准备
- Q4_K_M 文本权重:建议 8GB 内存或 6GB 显存起,适合常规上下文
- Q5/Q6_K 文本权重:建议 8–9.5GB 内存或 7–8GB 显存,质量更稳
- Q8_0/BF16 文本权重:建议 13GB 内存或 11GB 显存以上
- 启用完整 1M 上下文:通常需要多卡张量并行或激进 KV-cache 卸载
量化版本怎么选
- 入门默认选择 Q4_K_M,体积小且质量保留较好
- 想使用 MTP 草稿推测时下载对应 MTP 量化版本
- 显存宽裕可选 Q6_K 或 Q8_0 提升质量
- 视觉输入需额外下载 mmproj-F16 文件与文本权重搭配使用
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。
阅读 8GB 显存选型指南 →可以怎样运行
- 可优先通过 Ollama、llama.cpp、LM Studio 核对模型加载兼容性。
- 首次运行建议使用短上下文和单请求,确认稳定后再增加上下文或并发。
采用前要知道的限制
- 推理模型,回复前始终带 ... 块,需较大 max_new_tokens
- 贪心解码或极低温度容易出现重复循环,需使用推荐采样
- SFT 为纯文本训练,视觉能力继承自基座未经独立评估
- 无审查模型,正式面向终端的部署需自行叠加安全审核层
COMPARISON PATH
继续对比同类方案
不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。