下载量
0
参数
26B
上下文
未说明
架构 / 任务
未分类
许可证
gemma
MODEL POSITIONING
这个模型解决什么问题?
模型能力源自官方Gemma 4 26B-A4B-it底座经Fast微调的去审查版本,主打英文与韩文对话、代码生成和工具调用,附带中性聊天模板以避免普通问答被路由到代码或工具模式。本仓库仅做GGUF量化分发,目前只提供Q4_K_M单一变体,没有附带原始Transformer权重或其他量化档位。运行层面支持llama.cpp、Ollama与LM Studio三类常见本地工具;上下文长度上限、原始对话模板字段和训练数据来源在模型卡中未说明。
更适合谁
- 希望在本地部署26B参数去审查对话模型的用户
- 主要使用英文或韩文进行聊天与编程辅助的用户
- 拥有苹果Silicon或同等内存配置的本地推理玩家
典型使用场景
- 本地英语或韩语自由对话与日常问答
- Python等语言的代码片段生成与解释
- 通过Ollama或LM Studio搭建轻量化本地助手
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
去审查对话风格
减少常规安全过滤,保留自然回答
兼顾代码与聊天
同一模型可处理日常问答与编程任务,不强行切换模式
韩英双语支持
官方标注支持英语和韩语,对韩语用户尤其友好
Fast线权重调优
使用经过验证的Fast调优权重替代原始底座
中性聊天模板
嵌入中立模板以减少提示路由漂移
硬件怎么准备
- 至少15.5GB内存或13.5GB显存可加载Q4_K_M文件
- 推荐18.5GB内存或15.5GB显存以获得更流畅体验
- 苹果Silicon M系列在llama.cpp下经过作者验证
- 约13GB单文件,普通SSD本地存储即可
量化版本怎么选
- 本仓库仅提供Q4_K_M单一量化,没有更高或更低精度选择
- 13GB左右体积适合内存或显存受限但又想体验26B MoE的用户
- 需要Q5、Q6或Q8等其他量化需自行转换或等待其他来源
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| Q4 | 12 GB | 13.5 GB | 15.5 GB | 18.5 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 13.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 15.5GB。
阅读 24GB 显存选型指南 →可以怎样运行
- 通过llama.cpp本地加载GGUF文件运行
- 使用Ollama导入并以聊天模式调用
- 通过LM Studio加载进行可视化交互
采用前要知道的限制
- 仓库只发布Q4_K_M单量化,无多档位或原始权重可比对
- 模型卡未说明上下文长度、训练数据和详细架构配置
- 去审查定位意味着部分回答可能涉及争议或敏感内容,需自行判断
- 主要针对英文与韩语优化,其他语言表现模型卡未说明