← 返回模型库

FINAL-Bench/POCKET-35B-GGUF

POCKET-35B-GGUF:CPU可跑的35B本地对话模型

POCKET-35B-GGUF 是 35B 参数的稀疏 MoE 对话模型,由 Darwin-36B-Opus 量化而来,主打无显卡本地运行。适合没有 GPU、做日常对话与写作辅助的本地用户。最低 IQ1_M 约 8 GB 可装入 16 GB 内存设备,Q2_K 推荐 12.5 GB 内存,Q4_K_M 推荐 24.

本地大模型CPU推理MoE对话端侧部署
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

POCKET-35B-GGUF 是基于 Qwen3.5 家族 MoE 架构(256 专家、top-8)的 35B 对话模型,由 VIDRAFT 的 Darwin-36B-Opus 量化而来,定位为“无显卡也能跑大模型”。在量化仓库层面,它仅提供 GGUF 格式权重,覆盖 IQ1_M、Q2_K、Q3_K_M、Q4_K_M 四档;同家族另有 POCKET-26B、POCKET-KR、POCKET-EN 等姊妹仓库。运行工具方面,模型卡明确支持 stock llama.cpp、Ollama、LM Studio,无需 fork 或自定义运行时。模型卡未提供原始训练数据规模与上下文长度上限,也未公布完整基准列表,仅给出 GPQA-Diamond、HellaSwag 与韩文 Wikipedia 困惑度等少量自测数据。

更适合谁

  • 没有独立显卡、想在普通 PC 或迷你主机上跑大模型的本地 LLM 用户
  • 拥有 16 GB 以上内存、追求端侧或离线部署的开发者
  • 想体验稀疏 MoE 大模型在 CPU 上推理表现的爱好者与研究者

典型使用场景

  • 无显卡环境下的本地对话、问答与写作辅助
  • 离线或隐私敏感场景的端侧文本生成实验
  • 在低内存、低显存设备上验证大模型可行性的基准测试
  • 对稀疏 MoE 量化与 CPU 推理性能进行横向对比研究

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

稀疏 MoE 架构

基于 Qwen3.5 家族 MoE(256 专家、top-8),35B 总参数可在 CPU 上较高效地出文

无需显卡即可部署

通过 stock llama.cpp、Ollama、LM Studio 直接加载,不依赖 CUDA

多档量化可选

提供 IQ1_M、Q2_K、Q3_K_M、Q4_K_M 四种 GGUF 量化,覆盖从 16 GB 内存到 32 GB 内存设备

端侧覆盖广

体积最小的 IQ1_M 可装入 16 GB 内存设备,姊妹仓库还覆盖 Android、iPhone 与 Mac

Apache-2.0 开源

采用 Apache-2.0 协议,可自由用于本地研究与商业部署

硬件怎么准备

  • IQ1_M 量化约 8 GB 文件,最低 5.5 GB 内存或 4.5 GB 显存,推荐 8 GB 内存或 5.5 GB 显存
  • Q2_K 量化约 13 GB 文件,最低 10.5 GB 内存或 9 GB 显存,推荐 12.5 GB 内存或 10.5 GB 显存
  • Q3_K_M 量化约 16 GB 文件,最低 15.5 GB 内存或 13.5 GB 显存,推荐 18.5 GB 内存或 15.5 GB 显存
  • Q4_K_M 量化约 21 GB 文件,最低 20.5 GB 内存或 18 GB 显存,推荐 24.5 GB 内存或 20.5 GB 显存

量化版本怎么选

  • 优先选用 Q2_K 作为日常使用的甜点档位,模型卡将其标注为 best value
  • 设备内存 ≥24 GB 时直接使用 Q4_K_M 以获取最佳质量
  • IQ1_M 仅适合 16 GB 内存设备追求极限体积的场景,对韩文质量影响更显著
  • Q3_K_M 适合 24 GB 内存且想兼顾质量与体积折中的用户

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ14.1 GB4.5 GB5.5 GB8 GB文件 ↗
Q28.1 GB9 GB10.5 GB12.5 GB文件 ↗
Q312 GB13.5 GB15.5 GB18.5 GB文件 ↗
Q416 GB18 GB20.5 GB24.5 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 4.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 5.5GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp:stock 版本直接加载,无需 fork 或自定义构建
  • Ollama:模型卡声明支持,可作为本地推理后端
  • LM Studio:模型卡声明支持,适合桌面图形化运行
  • 配合 PocketPal 在 iPhone 上运行英文轻量化变体(姊妹仓库提供)

采用前要知道的限制

  • 模型卡未提供具体上下文长度上限
  • 模型卡未公开训练数据来源、规模与对齐细节
  • IQ1_M 等极低量化对韩文质量影响约 2.8 倍,需谨慎用于多语言任务
  • iPhone 与 Mac 上的实测速度由社区补充,作者尚未自行测量