← 返回模型库

Jackrong/DeepSeek-V4-Pro-Qwen3.5-9B-MTP-GGUF

DeepSeek-V4-Pro-Qwen3.5-9B-MTP-GGUF:数学与理工推理的 9B 蒸馏

DeepSeek-V4-Pro-Qwen3.5-9B-MTP-GGUF 是基于 Qwen3.5-9B 的 9B 参数推理模型,由 DeepSeek-V4-Pro Max Effect 模式教师数据蒸馏,约 25 万数学与 STEM 样本完成 SFT 与 GSPO 强化学习。

数学推理理工蒸馏轻量部署
查看模型源页面
下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

DeepSeek-V4-Pro-Qwen3.5-9B-MTP-GGUF 是 Jackrong 发布的 9B 参数推理模型仓库,仅分发 GGUF 量化,不含原始 PyTorch 权重。模型能力源自 Qwen3.5-9B 基座,由 DeepSeek-V4-Pro Max Effect 模式蒸馏,训练数据集中在数学与 STEM,叠加 SFT 与 GSPO 强化学习。上下文方面,模型卡未说明完整上限,评测中 9B 量化版本使用 8K 上下文。仓库附带 mmproj-F32 配套文件,提供 Q2 到 Q8_0 共 8 种 GGUF 量化,兼容 Ollama、llama.cpp、LM Studio 桌面部署,并支持 vLLM NVFP4 服务化运行。

更适合谁

  • 需要数学与理工科推理的中文及多语言用户
  • 9B 级别、显存或内存受限的本地部署者
  • 推理蒸馏与跨域迁移研究
  • 重视指令遵循与格式合规的轻量模型使用者

典型使用场景

  • 数学解题与逐步推导
  • 物理、化学及 STEM 学科问答
  • 结构化分析与约束跟踪类任务
  • 编程与工具调用辅助的实验场景

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

数学与理工推理

基于 DeepSeek-V4-Pro Max Effect 蒸馏,约 25 万数学与 STEM 样本训练

结构化多步推导

强化问题分解、约束跟踪与验证

指令格式高度合规

单字母与最终答案场景接近 97% 至 99.8% 严格输出

跨域小幅迁移

编程与工具调用出现初步泛化提升

推理 token 效率

同准确率下 token 消耗显著低于 Qwen3.5-9B 基座

硬件怎么准备

  • 2.5GB 显存可加载 Q2_K 量化
  • 5GB 显存可加载 Q4_K_M 或 IQ4_XS 量化
  • 7GB 显存可加载 Q5_K_M 或 BF16 量化
  • 9.5GB 显存可加载 Q8_0 高保真量化

量化版本怎么选

  • 极低显存或重速度选 Q2_K、Q3_K_L
  • 平衡质量与体积选 Q4_K_M
  • 显存充裕且追求质量选 Q6_K 或 Q8_0
  • 部署时需保留 mmproj-F32 配套文件

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q22.1 GB2.5 GB3.5 GB8 GB文件 ↗
Q33.1 GB3.5 GB4.5 GB8 GB文件 ↗
IQ44.2 GB5 GB6 GB8 GB文件 ↗
Q44.2 GB5 GB6 GB8 GB文件 ↗
BF165.2 GB6 GB7 GB8 GB文件 ↗
Q55.2 GB6 GB7 GB8 GB文件 ↗
GGUF5.2 GB6 GB7 GB8 GB文件 ↗
Q66.3 GB7 GB8 GB9.5 GB文件 ↗
Q88.4 GB9.5 GB11 GB13 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 2.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 3.5GB。

阅读 4GB 显存选型指南 →

可以怎样运行

  • Ollama 本地 GGUF 推理
  • llama.cpp GGUF 推理
  • LM Studio 桌面部署
  • vLLM NVFP4 服务化部署

采用前要知道的限制

  • 实验性 9B 社区模型,仍可能产生幻觉与推理错误
  • MMLU-Pro 仅抽 500 题每子集,非全面能力或安全评估
  • GSM8K 与 MMLU-Pro 使用不同推理后端,量化得分不可直接互比
  • 编程与工具调用提升为初步观察,无直接代码监督数据