← 返回模型库

InternScience/Agents-A1-4B-Q8_0-GGUF

Agents-A1-4B-Q8_0-GGUF:4B 视觉智能体本地小钢炮

Agents-A1-4B-Q8_0-GGUF 是 InternScience 开源的 4B 视觉语言 Agent 模型,专注长程搜索、工具调用与多约束指令遵循,附带 mmproj GGUF 支持图文输入。Q8_0 主文件约 4GB,最低 5GB 内存或 4.5GB 显存,推荐 8GB 内存或 5.5GB 显存。

视觉智能体工具调用长程推理本地部署
查看模型源页面
下载量
0
参数
4B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

Agents-A1-4B 是 InternScience 推出的 4B 稠密视觉语言 Agent 模型,定位小参数下的长程搜索、工程科研推理、工具调用与多约束指令遵循。本仓库是其 Q8_0 GGUF 量化版,附带 mmproj GGUF 视觉投影以启用图文输入。运行工具支持 Ollama、llama.cpp 与 LM Studio 等本地 GGUF 推理方案,模型卡未说明该量化版本的最大上下文长度。性能层面模型卡报告 BrowseComp 66.8、XBench-DS-2510 90.0、GAIA 95.1 与 IFEval 94.8 等成绩,主张在 4B 级别领先。

更适合谁

  • 想在本地搭建多步 Agent 流程的开发者
  • 需要图文输入的多模态任务研究者
  • 关注长程任务规划与工具调用的工程师
  • 硬件受限但想尝试视觉语言模型的轻量部署者

典型使用场景

  • 本地多步搜索与资料整理任务
  • 工具调用驱动的 Agent 原型开发
  • 图像加文本的多模态问答与理解
  • 科学或工程类知识问答与推理

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

长程 Agent 推理

能将复杂任务拆解为可执行子步骤并基于反馈调整策略

原生工具调用与函数支持

内置 function calling,可对接 API、代码解释器与搜索引擎

视觉语言多模态输入

通过 mmproj GGUF 启用图文问答与图像相关推理

多约束指令遵循

在跨领域场景下精确执行含多约束的复杂指令

小参数高效率

4B 稠密架构在多个 Agent 基准上接近更大 MoE 模型

硬件怎么准备

  • Q8_0 主模型约 4GB,最低 5GB 内存或 4.5GB 显存可加载
  • 推荐 8GB 内存或 5.5GB 显存以保证运行稳定
  • 启用视觉能力需额外加载约 2.5GB 的 mmproj 文件,建议预留 3GB 显存或 4GB 内存
  • 模型卡未给出具体推理速度或首字延迟数据,仅以 GGUF 文件估算占用

量化版本怎么选

  • 该仓库仅提供 Q8_0 主量化,体积约 4GB,相对原权重质量损失较小
  • 若显存紧张可自行在 mlx-community 等社区寻找更低位宽的衍生量化
  • 视觉能力依赖 mmproj GGUF,单独主模型文件无法处理图像
  • 模型卡未提供与其它量化的官方速度或质量对比

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
GGUF2.3 GB3 GB4 GB8 GB文件 ↗
Q83.7 GB4.5 GB5.5 GB8 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 3GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4GB。

阅读 4GB 显存选型指南 →

可以怎样运行

  • 通过 Ollama 拉取仓库内的 GGUF 权重直接运行
  • 用 llama.cpp 加载 Q8_0 与 mmproj 文件做本地推理
  • LM Studio 导入仓库内 GGUF 文件即可使用
  • 文本路径可考虑 SGLang 或 vLLM 部署 Transformers 格式权重

采用前要知道的限制

  • 模型卡未给出该 GGUF 仓库的最大上下文长度
  • 模型卡未提供具体推理速度或首字延迟数据
  • 4B 小模型在复杂工程科研任务上仍弱于更大 MoE 版本
  • 量化版本与原 Transformers 权重之间可能存在一致性差异,需自行验证