MODEL POSITIONING
这个模型解决什么问题?
模型能力来自 Qwen3.8-27B 基座,是 27B 参数规模的通用文本与代码生成模型。本仓库为第三方 IU4 加速量化版本,专为 AMD Strix Halo(gfx1151)提供 RDNA 3.5 原生 4-bit 矩阵指令路径,并附带 FFN、GDN、GDN-Output 三个 .pfs 加速伴随文件。运行工具不是通用 llama.cpp / Ollama / LM Studio,而是 Kairic Edge v1.2 不可变源代码发行版中的捆绑运行器,启用 Kairic Edge、Prompt Forge、262K 上下文、8 GiB 提示缓存与原生 MTP4 推测解码。模型卡未说明非 Strix Halo AMD 平台或其他显卡的兼容性,也未承诺生产环境的稳定性。
更适合谁
- 配备 AMD Ryzen AI Max+ 395 / Radeon 8060S(Strix Halo)的本地推理用户
- 能自行从源码编译 Kairic Edge v1.2 运行器的技术开发者
- 需要 262K 长上下文与重复前缀提示缓存的长文档服务场景
- 追求 27B 模型编码与文本生成速度极致的极客用户
典型使用场景
- AMD Strix Halo 设备上 27B 级代码补全与函数级生成
- 长文档(数十万 token 级别)的多轮问答与综述
- 重复前缀的固定模板并发请求(如系统提示 + 用户查询)
- 对 RDNA 3.5 IU4 指令的本地性能与算力上限做技术基准测试
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
IU4 原生矩阵加速
走 RDNA 3.5 的 V_WMMA_I32_16X16X16_IU4 指令,4-bit 矩阵算力约为 FP16 / IU8 的 1.93–1.94 倍
Dual View 双视图架构
权威 GGUF 视图负责质量敏感路径,三个 .pfs 伴随视图承担可加速的前馈、循环与输出投影
编码基准突出
HumanEval Base 158/164(96.34%),Plus 152/164(92.68%),模型卡对比超过同体积 Unsloth Dynamic Q4 / Q6
长上下文与提示缓存
验证 262K 上下文 + 8 GiB 提示缓存,重复前缀提示时间可降低 98–99%
MTP4 推测解码
64-token n-gram 起草 + 严格 M65 验证,模型卡报告 draft 接受率 99.73%、平均接受长度 64.83
硬件怎么准备
- 必须使用 AMD Ryzen AI Max+ 395 + Radeon 8060S(gfx1151 / Strix Halo),模型卡未说明在其他 AMD 显卡上的兼容性
- 至少 20GB 统一内存(推荐 24GB);启用 262K 上下文 + 8 GiB 提示缓存时还需额外预留
- 模型 GGUF 约 15.48 GiB,加上 FFN / GDN / GDN-Output 三个 .pfs 约 10.57 GiB,合计约 26 GiB
- 需要 ROCm 工具链(如 TheRock、AMD clang)从源码构建 Kairic Edge v1.2 运行器,普通安装路径无效
量化版本怎么选
- 本仓库为 IU4 自定义量化(非标准 Q4_K_M / Q6_K),必须配合 .pfs 加速伴随文件使用
- FFN / GDN / GDN-Output 三个 .pfs 为必备依赖,缺失会令 Kairic Edge 加速路径失效
- 不可直接喂给 llama.cpp / Ollama / LM Studio 等通用框架,否则无法启用 Kairic Edge
- 模型卡声明本量化的对照环境为 Unsloth Dynamic 3.0,在 4-bit 之上叠加了原生指令加速
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
| 量化 | 文件 | 最低显存 | 推荐显存 | 推荐内存 | 来源 |
|---|---|---|---|---|---|
| GGUF | 16 GB | 17 GB | 19.5 GB | 24 GB | 文件 ↗ |
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 17GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 19.5GB。
阅读 24GB 显存选型指南 →可以怎样运行
- 使用 Kairic Edge v1.2 不可变源代码发行版中捆绑的自定义运行器,启用 Kairic Edge、提示缓存、262K 配置与原生 MTP4
- 标准 llama.cpp / Ollama / LM Studio 标记为不兼容,需自行从源码编译
- 默认高速贪婪模式仅支持贪婪采样;采样、惩罚、工具调用需切换兼容模式
- 旧版不安全 M65 验证需环境变量开关才能启用,仅供诊断,模型卡未说明其在生产中的正确性
采用前要知道的限制
- 仅在 AMD Ryzen AI Max+ 395 + Radeon 8060S / gfx1151 上验证,其他硬件平台兼容性模型卡未说明
- IU4 加速仅覆盖选定提示与多 token 验证形状,并非整个模型原生 4-bit 推理,M1 target-decode 路径未加速
- v1.2 默认严格 M65 验证,相对原生 IU4 M65 验证在 exact-M65 重负载上约慢 5–8%
- 三个 .pfs 伴随文件额外占用约 10.57 GiB,对内存有限的小机型构成门槛