← 返回模型库

SupraLabs/Supra2-100M-Instruct

Supra2-100M-Instruct:百兆参数实验型英文对话模型

基于 Qwen3 架构的 100M 参数英文指令模型,仅 2K 上下文,提供 F16 GGUF(约 62.5MB)。适合低配置设备尝鲜轻量文本生成或研究小模型行为的开发者与爱好者。不适合需要事实准确性或多轮复杂推理的生产场景。

轻量英文对话超小参数模型Qwen3 衍生本地离线推理
查看模型源页面
下载量
0
参数
0.1B
上下文
未说明
架构 / 任务
qwen3
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来自 SupraLabs 从零预训练并微调的 100M 参数 Qwen3 架构指令模型,训练数据为英文网页文本,上下文窗口 2K,模型卡未说明支持中文,也未给出公开评测。量化仓库方面,目前 Hugging Face 仅提供 F16 单精度 GGUF 文件,约 62.5MB,无 Q4、Q8 等更低比特档位。运行工具层面,ollama、llama.cpp 与 LM Studio 均已声明支持部署,普通笔记本或入门显卡即可加载。

更适合谁

  • 想在低配设备试验小模型的研究者
  • 对 Qwen3 架构超小规模衍生感兴趣的开发者
  • 学习本地推理流程的入门用户
  • 极轻量英文生成场景的尝鲜者

典型使用场景

  • 英文短句生成与简单问答演示
  • 小型语言模型行为观察与教学
  • 低算力设备的离线文本补全实验
  • 模型推理流程的本地调试练习

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

体积极小

100M 参数,F16 仅约 62.5MB,普通电脑即可加载

架构现代

基于 Qwen3 decoder-only 架构,配 32768 token 自定义分词器

部署灵活

同时支持 ollama、llama.cpp、LM Studio 三种本地推理工具

协议宽松

采用 Apache-2.0 协议,允许商用与二次微调

硬件怎么准备

  • 最低 4GB 内存与 1GB 显存即可加载 F16 版本
  • 推荐 8GB 内存与 2GB 显存以获得更稳定体验
  • 普通笔记本 CPU 可运行,速度模型卡未说明
  • 老旧独显或集成显卡均可尝试,无需高端硬件

量化版本怎么选

  • 当前仓库仅提供 F16 单档 GGUF,无更低比特量化
  • 想要更小体积需等待官方发布 Q4/Q8 等量化
  • 体积已足够小,多数场景无需自行转码
  • F16 精度保留完整,更适合实验而非生产部署

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
F160.1 GB1 GB2 GB8 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 1GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 2GB。

阅读 4GB 显存选型指南 →

可以怎样运行

  • 使用 ollama 拉取模型并直接对话
  • 通过 llama.cpp 加载 GGUF 文件命令行推理
  • 在 LM Studio 中选择模型进行本地聊天
  • 用 transformers 库以 Python 调用基础权重

采用前要知道的限制

  • 上下文窗口仅 2K,长对话与长文档不可用
  • 模型卡未说明中文支持,仅适用英文任务
  • 100M 参数能力有限,输出可能存在事实错误
  • 仅 F16 一种量化,缺乏速度与体积优化选项