下载量
0
参数
0.1B
上下文
未说明
架构 / 任务
qwen3
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
模型能力来自 SupraLabs 从零预训练并微调的 100M 参数 Qwen3 架构指令模型,训练数据为英文网页文本,上下文窗口 2K,模型卡未说明支持中文,也未给出公开评测。量化仓库方面,目前 Hugging Face 仅提供 F16 单精度 GGUF 文件,约 62.5MB,无 Q4、Q8 等更低比特档位。运行工具层面,ollama、llama.cpp 与 LM Studio 均已声明支持部署,普通笔记本或入门显卡即可加载。
更适合谁
- 想在低配设备试验小模型的研究者
- 对 Qwen3 架构超小规模衍生感兴趣的开发者
- 学习本地推理流程的入门用户
- 极轻量英文生成场景的尝鲜者
典型使用场景
- 英文短句生成与简单问答演示
- 小型语言模型行为观察与教学
- 低算力设备的离线文本补全实验
- 模型推理流程的本地调试练习
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
体积极小
100M 参数,F16 仅约 62.5MB,普通电脑即可加载
架构现代
基于 Qwen3 decoder-only 架构,配 32768 token 自定义分词器
部署灵活
同时支持 ollama、llama.cpp、LM Studio 三种本地推理工具
协议宽松
采用 Apache-2.0 协议,允许商用与二次微调
硬件怎么准备
- 最低 4GB 内存与 1GB 显存即可加载 F16 版本
- 推荐 8GB 内存与 2GB 显存以获得更稳定体验
- 普通笔记本 CPU 可运行,速度模型卡未说明
- 老旧独显或集成显卡均可尝试,无需高端硬件
量化版本怎么选
- 当前仓库仅提供 F16 单档 GGUF,无更低比特量化
- 想要更小体积需等待官方发布 Q4/Q8 等量化
- 体积已足够小,多数场景无需自行转码
- F16 精度保留完整,更适合实验而非生产部署
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| F16 | 0.1 GB | 1 GB | 2 GB | 8 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 1GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2GB。
阅读 4GB 显存选型指南 →可以怎样运行
- 使用 ollama 拉取模型并直接对话
- 通过 llama.cpp 加载 GGUF 文件命令行推理
- 在 LM Studio 中选择模型进行本地聊天
- 用 transformers 库以 Python 调用基础权重
采用前要知道的限制
- 上下文窗口仅 2K,长对话与长文档不可用
- 模型卡未说明中文支持,仅适用英文任务
- 100M 参数能力有限,输出可能存在事实错误
- 仅 F16 一种量化,缺乏速度与体积优化选项