下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
mit
MODEL POSITIONING
这个模型解决什么问题?
模型能力来自上游 ornith-ai/Ornith-1.5-9B,采用 qwen35 混合注意力架构(8 层全注意力 + 24 层线性注意力),支持 262K 长上下文,标榜视觉理解、手写识别、智能体编码与带思考通道的对话推理。本仓库为 AtomicChat 维护的 GGUF 量化仓库,区别于上游权重,专门提供基于自研 imatrix 调优的 AD 命名位布局文件,覆盖 IQ2 到 BF16 多档位。本地运行需依赖 llama.cpp、Ollama 或 LM Studio 等支持 GGUF 的推理工具;模型卡未提供中文训练语料规模说明,也未给出中文硬件复测速度。
更适合谁
- 想本地部署多模态对话与图像问答的个人开发者
- 拥有 8 GB 至 24 GB 显存或内存的中端硬件用户
- 寻找中等体量视觉编码助手的研究者与爱好者
- 需要长上下文与智能体编码能力的本地化部署者
典型使用场景
- 本地多模态对话与图表、截图内容解读
- 智能体编码与代码任务辅助
- 长文档对话、检索增强与摘要
- 手写笔迹、文档图像转录
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
视觉理解与手写识别
模型卡展示对未见过书法作品整段转写并识别角落小标记的能力
混合注意力长上下文
qwen35 架构使 262K 上下文每 token 仅约 32 KB,长文本显存占用低
智能体编码与思考推理
标榜 agentic-coding 与自反式思考通道,可质疑自身结论
自研 imatrix 调优布局
AD 命名量化在同尺寸下 KL 散度低于 stock 预设,例如 AD-Q5_K-Q4_K 比 stock Q5_K_M 更小更准
硬件怎么准备
- 24 GB 及以上显存:BF16 文件,作为参考精度完整保留
- 16 GB 显存:Q8_0 接近无损
- 12 GB 显存:AD-Q8_0-Q6_K 填补 Q6_K 与 Q8_0 之间空档
- 8 GB 显存或内存:AD-Q5_K-Q4_K 为官方推荐甜点档
量化版本怎么选
- 视觉任务优先选择 Q5_K 及以上以保留图像细节理解
- 仅文字推理可接受 IQ3 档位,但仍会出现可感质量下降
- 避免 AD-IQ2_XXS-IQ1_M,与参考模型 top-1 一致率仅约 53.7%
- 显存紧张时 AD-Q4_K-IQ4_XS 在同尺寸下比 stock Q4_K_M 散度低约三分之一
GGUF VARIANTS
量化版本与硬件要求
数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 2.5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 3.5GB。
阅读 4GB 显存选型指南 →可以怎样运行
- llama.cpp 命令行加载 GGUF 并启用视觉投影文件
- Ollama 拉取对应量化标签运行
- LM Studio 图形界面选择本地 GGUF 文件
采用前要知道的限制
- 上游未发布 generation_config.json,需手动设置 --temp 0.6 --top-p 0.95 --top-k 20
- 视觉调用必须传 --image-min-tokens 1024,否则会基于已有知识编造图像描述
- 模型卡未提供非 RTX 5090 硬件的速度实测,跨硬件性能只能参考估算
- 自转换时需加 --no-nextn 参数,否则会因 config 与权重不匹配导致加载失败