← 返回模型库

peculiar-ragdoll/Tiel-Coder-35B-A3B-GGUF

Tiel-Coder-35B-A3B-GGUF:面向编码与多轮对话的35B MoE

Tiel-Coder-35B-A3B 是 Ornith-1.5-35B-A3B 的自量化 GGUF 版,采用 256 专家 8 激活的 MoE 架构,主打代理式编码与多轮对话,同时支持视觉输入。在 SWE-bench-Live 修复 12/25 题,但 MMLU-Pro 仅 73.7,弱于 Nail 等同档对手。

编程多轮对话视觉理解本地MoE
查看模型源页面
下载量
0
参数
35B
上下文
未说明
架构 / 任务
未分类
许可证
mit

MODEL POSITIONING

这个模型解决什么问题?

区分模型能力、量化仓库、运行工具。模型能力:35B 参数的 MoE 架构,256 专家 8 激活,原生支持中英文与图像输入,擅长代码修复与多轮对话,但通用知识与推理偏弱。量化仓库:本仓库是基于 Ornith-1.5-35B-A3B 的自有 imatrix 加 Unsloth Dynamic 量化版,携带 Sharp 聊天模板,未保留多 token 预测头。运行工具:模型卡未给出具体命令细节,已声明支持 llama.cpp、Ollama、LM Studio 运行时。

更适合谁

  • 需要本地代理式代码修复与多轮编码协作的开发者
  • 希望在 24 GB 组合内存或显存上跑 MoE 的本地推理用户
  • 偏好简短直接回答、减少追问回合的代码协作场景
  • 需要附带视觉识别能力的本地编码助手用户

典型使用场景

  • 本地代理式代码修复与持续多轮编码协作
  • 截图、报错堆栈、设计稿的图像理解与编码辅助
  • 长上下文代码审查与对话型开发
  • 轻量级日常问答与简短多轮对话(不擅长专业考试)

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

代理式编码表现突出

SWE-bench-Live 修复 12/25 题,与 Opus 4.6 medium 同档

多轮对话质量领先

Claw-Eval 多轮任务 67.2,高于同档多数对手

MoE 架构资源占用低

256 专家 8 激活,KV 占用小,可在较小显存运行

支持视觉输入

继承基座视觉塔,可识别截图、报错堆栈与设计稿

自有 imatrix 量化

使用自校准的 imatrix 文件,可由用户自行切档

硬件怎么准备

  • 16 GB 组合内存可选 IQ3_XXS,Q2_K_XL 仅作最后手段
  • 24 GB 组合内存可选 Q3_K_XL、IQ4_XS、Q4_K_S,建议以此为起点
  • 32 GB 组合内存可舒适运行 Q4_K_XL 或 Q5_K_XL
  • 48 GB 组合内存可选 Q6_K_XL 或 Q8_K_XL;模型卡未承诺速度表现

量化版本怎么选

  • 不要为了塞进显存就降到 UD-Q4 以下,应让模型与上下文分布在 RAM+VRAM 合计
  • 24 GB 起步推荐 UD-Q4_K_XL,是模型卡基准测试档
  • 32 GB 推荐 UD-Q5_K_XL,48 GB 选 UD-Q6_K_XL 接近无损
  • 自带 imatrix 文件可让用户自行切分其他未提供的量化档

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q28.1 GB9 GB10.5 GB12.5 GB文件 ↗
IQ312 GB13.5 GB15.5 GB18.5 GB文件 ↗
Q312 GB13.5 GB15.5 GB18.5 GB文件 ↗
IQ416 GB18 GB20.5 GB24.5 GB文件 ↗
Q416 GB18 GB20.5 GB24.5 GB文件 ↗
Q520 GB22.5 GB26 GB31 GB文件 ↗
GGUF20 GB22.5 GB26 GB31 GB文件 ↗
BF1620 GB22.5 GB26 GB31 GB文件 ↗
Q624 GB26.5 GB30.5 GB37 GB文件 ↗
Q833 GB35.5 GB40.5 GB49 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 9GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 10.5GB。

阅读 12GB 显存选型指南 →

可以怎样运行

  • 使用 llama.cpp 的 llama-server 或 llama-quantize 加载 GGUF 文件
  • 通过 Ollama 创建模型并替换为所需 GGUF 量化文件
  • 在 LM Studio 中直接加载 GGUF 量化文件
  • 启用视觉需额外加载共享的 mmproj-BF16.gguf 投影文件

采用前要知道的限制

  • MMLU-Pro 仅 73.7,比同档 Nail 落后 10.3 分
  • 主动追问较少,对模糊需求可能直接作答而非澄清
  • 仅支持中文与英文,继承自基座限制
  • 当前版本未带多 token 预测头,需要投机解码的用户需另寻版本