下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
POCKET-35B-GGUF 是基于 Qwen3.5 家族 MoE 架构(256 专家、top-8)的 35B 对话模型,由 VIDRAFT 的 Darwin-36B-Opus 量化而来,定位为“无显卡也能跑大模型”。在量化仓库层面,它仅提供 GGUF 格式权重,覆盖 IQ1_M、Q2_K、Q3_K_M、Q4_K_M 四档;同家族另有 POCKET-26B、POCKET-KR、POCKET-EN 等姊妹仓库。运行工具方面,模型卡明确支持 stock llama.cpp、Ollama、LM Studio,无需 fork 或自定义运行时。模型卡未提供原始训练数据规模与上下文长度上限,也未公布完整基准列表,仅给出 GPQA-Diamond、HellaSwag 与韩文 Wikipedia 困惑度等少量自测数据。
更适合谁
- 没有独立显卡、想在普通 PC 或迷你主机上跑大模型的本地 LLM 用户
- 拥有 16 GB 以上内存、追求端侧或离线部署的开发者
- 想体验稀疏 MoE 大模型在 CPU 上推理表现的爱好者与研究者
典型使用场景
- 无显卡环境下的本地对话、问答与写作辅助
- 离线或隐私敏感场景的端侧文本生成实验
- 在低内存、低显存设备上验证大模型可行性的基准测试
- 对稀疏 MoE 量化与 CPU 推理性能进行横向对比研究
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
稀疏 MoE 架构
基于 Qwen3.5 家族 MoE(256 专家、top-8),35B 总参数可在 CPU 上较高效地出文
无需显卡即可部署
通过 stock llama.cpp、Ollama、LM Studio 直接加载,不依赖 CUDA
多档量化可选
提供 IQ1_M、Q2_K、Q3_K_M、Q4_K_M 四种 GGUF 量化,覆盖从 16 GB 内存到 32 GB 内存设备
端侧覆盖广
体积最小的 IQ1_M 可装入 16 GB 内存设备,姊妹仓库还覆盖 Android、iPhone 与 Mac
Apache-2.0 开源
采用 Apache-2.0 协议,可自由用于本地研究与商业部署
硬件怎么准备
- IQ1_M 量化约 8 GB 文件,最低 5.5 GB 内存或 4.5 GB 显存,推荐 8 GB 内存或 5.5 GB 显存
- Q2_K 量化约 13 GB 文件,最低 10.5 GB 内存或 9 GB 显存,推荐 12.5 GB 内存或 10.5 GB 显存
- Q3_K_M 量化约 16 GB 文件,最低 15.5 GB 内存或 13.5 GB 显存,推荐 18.5 GB 内存或 15.5 GB 显存
- Q4_K_M 量化约 21 GB 文件,最低 20.5 GB 内存或 18 GB 显存,推荐 24.5 GB 内存或 20.5 GB 显存
量化版本怎么选
- 优先选用 Q2_K 作为日常使用的甜点档位,模型卡将其标注为 best value
- 设备内存 ≥24 GB 时直接使用 Q4_K_M 以获取最佳质量
- IQ1_M 仅适合 16 GB 内存设备追求极限体积的场景,对韩文质量影响更显著
- Q3_K_M 适合 24 GB 内存且想兼顾质量与体积折中的用户
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 4.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 5.5GB。
阅读 8GB 显存选型指南 →可以怎样运行
- llama.cpp:stock 版本直接加载,无需 fork 或自定义构建
- Ollama:模型卡声明支持,可作为本地推理后端
- LM Studio:模型卡声明支持,适合桌面图形化运行
- 配合 PocketPal 在 iPhone 上运行英文轻量化变体(姊妹仓库提供)
采用前要知道的限制
- 模型卡未提供具体上下文长度上限
- 模型卡未公开训练数据来源、规模与对齐细节
- IQ1_M 等极低量化对韩文质量影响约 2.8 倍,需谨慎用于多语言任务
- iPhone 与 Mac 上的实测速度由社区补充,作者尚未自行测量