← 返回模型库

jcbtc/Qwen3.8-27B-IU4-Kairic-Edge

Qwen3.8-27B-IU4-Kairic-Edge:AMD Strix Halo 平台 27B IU4 本地推理加速模型

基于 Qwen3.8-27B 的 IU4 加速量化模型,专为 AMD Strix Halo / Radeon 8060S(gfx1151)深度优化。融合 Prompt Forge 与 Dual View 技术,HumanEval Base 158/164(96.34%),编码生成能力突出。

AMD Strix Halo 推理27B 本地文本生成IU4 加速量化代码补全模型
查看模型源页面
下载量
0
参数
27B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来自 Qwen3.8-27B 基座,是 27B 参数规模的通用文本与代码生成模型。本仓库为第三方 IU4 加速量化版本,专为 AMD Strix Halo(gfx1151)提供 RDNA 3.5 原生 4-bit 矩阵指令路径,并附带 FFN、GDN、GDN-Output 三个 .pfs 加速伴随文件。运行工具不是通用 llama.cpp / Ollama / LM Studio,而是 Kairic Edge v1.2 不可变源代码发行版中的捆绑运行器,启用 Kairic Edge、Prompt Forge、262K 上下文、8 GiB 提示缓存与原生 MTP4 推测解码。模型卡未说明非 Strix Halo AMD 平台或其他显卡的兼容性,也未承诺生产环境的稳定性。

更适合谁

  • 配备 AMD Ryzen AI Max+ 395 / Radeon 8060S(Strix Halo)的本地推理用户
  • 能自行从源码编译 Kairic Edge v1.2 运行器的技术开发者
  • 需要 262K 长上下文与重复前缀提示缓存的长文档服务场景
  • 追求 27B 模型编码与文本生成速度极致的极客用户

典型使用场景

  • AMD Strix Halo 设备上 27B 级代码补全与函数级生成
  • 长文档(数十万 token 级别)的多轮问答与综述
  • 重复前缀的固定模板并发请求(如系统提示 + 用户查询)
  • 对 RDNA 3.5 IU4 指令的本地性能与算力上限做技术基准测试

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

IU4 原生矩阵加速

走 RDNA 3.5 的 V_WMMA_I32_16X16X16_IU4 指令,4-bit 矩阵算力约为 FP16 / IU8 的 1.93–1.94 倍

Dual View 双视图架构

权威 GGUF 视图负责质量敏感路径,三个 .pfs 伴随视图承担可加速的前馈、循环与输出投影

编码基准突出

HumanEval Base 158/164(96.34%),Plus 152/164(92.68%),模型卡对比超过同体积 Unsloth Dynamic Q4 / Q6

长上下文与提示缓存

验证 262K 上下文 + 8 GiB 提示缓存,重复前缀提示时间可降低 98–99%

MTP4 推测解码

64-token n-gram 起草 + 严格 M65 验证,模型卡报告 draft 接受率 99.73%、平均接受长度 64.83

硬件怎么准备

  • 必须使用 AMD Ryzen AI Max+ 395 + Radeon 8060S(gfx1151 / Strix Halo),模型卡未说明在其他 AMD 显卡上的兼容性
  • 至少 20GB 统一内存(推荐 24GB);启用 262K 上下文 + 8 GiB 提示缓存时还需额外预留
  • 模型 GGUF 约 15.48 GiB,加上 FFN / GDN / GDN-Output 三个 .pfs 约 10.57 GiB,合计约 26 GiB
  • 需要 ROCm 工具链(如 TheRock、AMD clang)从源码构建 Kairic Edge v1.2 运行器,普通安装路径无效

量化版本怎么选

  • 本仓库为 IU4 自定义量化(非标准 Q4_K_M / Q6_K),必须配合 .pfs 加速伴随文件使用
  • FFN / GDN / GDN-Output 三个 .pfs 为必备依赖,缺失会令 Kairic Edge 加速路径失效
  • 不可直接喂给 llama.cpp / Ollama / LM Studio 等通用框架,否则无法启用 Kairic Edge
  • 模型卡声明本量化的对照环境为 Unsloth Dynamic 3.0,在 4-bit 之上叠加了原生指令加速

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
GGUF16 GB17 GB19.5 GB24 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 17GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 19.5GB。

阅读 24GB 显存选型指南 →

可以怎样运行

  • 使用 Kairic Edge v1.2 不可变源代码发行版中捆绑的自定义运行器,启用 Kairic Edge、提示缓存、262K 配置与原生 MTP4
  • 标准 llama.cpp / Ollama / LM Studio 标记为不兼容,需自行从源码编译
  • 默认高速贪婪模式仅支持贪婪采样;采样、惩罚、工具调用需切换兼容模式
  • 旧版不安全 M65 验证需环境变量开关才能启用,仅供诊断,模型卡未说明其在生产中的正确性

采用前要知道的限制

  • 仅在 AMD Ryzen AI Max+ 395 + Radeon 8060S / gfx1151 上验证,其他硬件平台兼容性模型卡未说明
  • IU4 加速仅覆盖选定提示与多 token 验证形状,并非整个模型原生 4-bit 推理,M1 target-decode 路径未加速
  • v1.2 默认严格 M65 验证,相对原生 IU4 M65 验证在 exact-M65 重负载上约慢 5–8%
  • 三个 .pfs 伴随文件额外占用约 10.57 GiB,对内存有限的小机型构成门槛