下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
DeepSeek-V4-Pro-Qwen3.5-9B-MTP-GGUF 是 Jackrong 发布的 9B 参数推理模型仓库,仅分发 GGUF 量化,不含原始 PyTorch 权重。模型能力源自 Qwen3.5-9B 基座,由 DeepSeek-V4-Pro Max Effect 模式蒸馏,训练数据集中在数学与 STEM,叠加 SFT 与 GSPO 强化学习。上下文方面,模型卡未说明完整上限,评测中 9B 量化版本使用 8K 上下文。仓库附带 mmproj-F32 配套文件,提供 Q2 到 Q8_0 共 8 种 GGUF 量化,兼容 Ollama、llama.cpp、LM Studio 桌面部署,并支持 vLLM NVFP4 服务化运行。
更适合谁
- 需要数学与理工科推理的中文及多语言用户
- 9B 级别、显存或内存受限的本地部署者
- 推理蒸馏与跨域迁移研究
- 重视指令遵循与格式合规的轻量模型使用者
典型使用场景
- 数学解题与逐步推导
- 物理、化学及 STEM 学科问答
- 结构化分析与约束跟踪类任务
- 编程与工具调用辅助的实验场景
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
数学与理工推理
基于 DeepSeek-V4-Pro Max Effect 蒸馏,约 25 万数学与 STEM 样本训练
结构化多步推导
强化问题分解、约束跟踪与验证
指令格式高度合规
单字母与最终答案场景接近 97% 至 99.8% 严格输出
跨域小幅迁移
编程与工具调用出现初步泛化提升
推理 token 效率
同准确率下 token 消耗显著低于 Qwen3.5-9B 基座
硬件怎么准备
- 2.5GB 显存可加载 Q2_K 量化
- 5GB 显存可加载 Q4_K_M 或 IQ4_XS 量化
- 7GB 显存可加载 Q5_K_M 或 BF16 量化
- 9.5GB 显存可加载 Q8_0 高保真量化
量化版本怎么选
- 极低显存或重速度选 Q2_K、Q3_K_L
- 平衡质量与体积选 Q4_K_M
- 显存充裕且追求质量选 Q6_K 或 Q8_0
- 部署时需保留 mmproj-F32 配套文件
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 2.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 3.5GB。
阅读 4GB 显存选型指南 →可以怎样运行
- Ollama 本地 GGUF 推理
- llama.cpp GGUF 推理
- LM Studio 桌面部署
- vLLM NVFP4 服务化部署
采用前要知道的限制
- 实验性 9B 社区模型,仍可能产生幻觉与推理错误
- MMLU-Pro 仅抽 500 题每子集,非全面能力或安全评估
- GSM8K 与 MMLU-Pro 使用不同推理后端,量化得分不可直接互比
- 编程与工具调用提升为初步观察,无直接代码监督数据