← 返回模型库

AtomicChat/Ornith-1.5-9B-GGUF

Ornith-1.5-9B-GGUF:9B视觉对话模型量化合集

Ornith-1.5-9B-GGUF 是带视觉理解的 9B 参数对话与智能体编码模型的本地 GGUF 量化仓库,由 AtomicChat 基于自研重要性矩阵调优多档位布局。适合想本地跑多模态对话、图像识别、长上下文问答与代码助手的用户。

多模态对话视觉理解智能体编码本地量化
查看模型源页面
下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
mit

MODEL POSITIONING

这个模型解决什么问题?

模型能力来自上游 ornith-ai/Ornith-1.5-9B,采用 qwen35 混合注意力架构(8 层全注意力 + 24 层线性注意力),支持 262K 长上下文,标榜视觉理解、手写识别、智能体编码与带思考通道的对话推理。本仓库为 AtomicChat 维护的 GGUF 量化仓库,区别于上游权重,专门提供基于自研 imatrix 调优的 AD 命名位布局文件,覆盖 IQ2 到 BF16 多档位。本地运行需依赖 llama.cpp、Ollama 或 LM Studio 等支持 GGUF 的推理工具;模型卡未提供中文训练语料规模说明,也未给出中文硬件复测速度。

更适合谁

  • 想本地部署多模态对话与图像问答的个人开发者
  • 拥有 8 GB 至 24 GB 显存或内存的中端硬件用户
  • 寻找中等体量视觉编码助手的研究者与爱好者
  • 需要长上下文与智能体编码能力的本地化部署者

典型使用场景

  • 本地多模态对话与图表、截图内容解读
  • 智能体编码与代码任务辅助
  • 长文档对话、检索增强与摘要
  • 手写笔迹、文档图像转录

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

视觉理解与手写识别

模型卡展示对未见过书法作品整段转写并识别角落小标记的能力

混合注意力长上下文

qwen35 架构使 262K 上下文每 token 仅约 32 KB,长文本显存占用低

智能体编码与思考推理

标榜 agentic-coding 与自反式思考通道,可质疑自身结论

自研 imatrix 调优布局

AD 命名量化在同尺寸下 KL 散度低于 stock 预设,例如 AD-Q5_K-Q4_K 比 stock Q5_K_M 更小更准

硬件怎么准备

  • 24 GB 及以上显存:BF16 文件,作为参考精度完整保留
  • 16 GB 显存:Q8_0 接近无损
  • 12 GB 显存:AD-Q8_0-Q6_K 填补 Q6_K 与 Q8_0 之间空档
  • 8 GB 显存或内存:AD-Q5_K-Q4_K 为官方推荐甜点档

量化版本怎么选

  • 视觉任务优先选择 Q5_K 及以上以保留图像细节理解
  • 仅文字推理可接受 IQ3 档位,但仍会出现可感质量下降
  • 避免 AD-IQ2_XXS-IQ1_M,与参考模型 top-1 一致率仅约 53.7%
  • 显存紧张时 AD-Q4_K-IQ4_XS 在同尺寸下比 stock Q4_K_M 散度低约三分之一

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
IQ22.1 GB2.5 GB3.5 GB8 GB文件 ↗
IQ33.1 GB3.5 GB4.5 GB8 GB文件 ↗
IQ44.2 GB5 GB6 GB8 GB文件 ↗
Q44.2 GB5 GB6 GB8 GB文件 ↗
Q55.2 GB6 GB7 GB8 GB文件 ↗
BF165.2 GB6 GB7 GB8 GB文件 ↗
F165.2 GB6 GB7 GB8 GB文件 ↗
Q66.3 GB7 GB8 GB9.5 GB文件 ↗
Q88.4 GB9.5 GB11 GB13 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 2.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 3.5GB。

阅读 4GB 显存选型指南 →

可以怎样运行

  • llama.cpp 命令行加载 GGUF 并启用视觉投影文件
  • Ollama 拉取对应量化标签运行
  • LM Studio 图形界面选择本地 GGUF 文件

采用前要知道的限制

  • 上游未发布 generation_config.json,需手动设置 --temp 0.6 --top-p 0.95 --top-k 20
  • 视觉调用必须传 --image-min-tokens 1024,否则会基于已有知识编造图像描述
  • 模型卡未提供非 RTX 5090 硬件的速度实测,跨硬件性能只能参考估算
  • 自转换时需加 --no-nextn 参数,否则会因 config 与权重不匹配导致加载失败