下载量
0
参数
4B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0
MODEL POSITIONING
这个模型解决什么问题?
Agents-A1-4B 是 InternScience 推出的 4B 稠密视觉语言 Agent 模型,定位小参数下的长程搜索、工程科研推理、工具调用与多约束指令遵循。本仓库是其 Q8_0 GGUF 量化版,附带 mmproj GGUF 视觉投影以启用图文输入。运行工具支持 Ollama、llama.cpp 与 LM Studio 等本地 GGUF 推理方案,模型卡未说明该量化版本的最大上下文长度。性能层面模型卡报告 BrowseComp 66.8、XBench-DS-2510 90.0、GAIA 95.1 与 IFEval 94.8 等成绩,主张在 4B 级别领先。
更适合谁
- 想在本地搭建多步 Agent 流程的开发者
- 需要图文输入的多模态任务研究者
- 关注长程任务规划与工具调用的工程师
- 硬件受限但想尝试视觉语言模型的轻量部署者
典型使用场景
- 本地多步搜索与资料整理任务
- 工具调用驱动的 Agent 原型开发
- 图像加文本的多模态问答与理解
- 科学或工程类知识问答与推理
SOURCE-BASED CAPABILITIES
模型卡透露的核心特点
长程 Agent 推理
能将复杂任务拆解为可执行子步骤并基于反馈调整策略
原生工具调用与函数支持
内置 function calling,可对接 API、代码解释器与搜索引擎
视觉语言多模态输入
通过 mmproj GGUF 启用图文问答与图像相关推理
多约束指令遵循
在跨领域场景下精确执行含多约束的复杂指令
小参数高效率
4B 稠密架构在多个 Agent 基准上接近更大 MoE 模型
硬件怎么准备
- Q8_0 主模型约 4GB,最低 5GB 内存或 4.5GB 显存可加载
- 推荐 8GB 内存或 5.5GB 显存以保证运行稳定
- 启用视觉能力需额外加载约 2.5GB 的 mmproj 文件,建议预留 3GB 显存或 4GB 内存
- 模型卡未给出具体推理速度或首字延迟数据,仅以 GGUF 文件估算占用
量化版本怎么选
- 该仓库仅提供 Q8_0 主量化,体积约 4GB,相对原权重质量损失较小
- 若显存紧张可自行在 mlx-community 等社区寻找更低位宽的衍生量化
- 视觉能力依赖 mmproj GGUF,单独主模型文件无法处理图像
- 模型卡未提供与其它量化的官方速度或质量对比
GGUF VARIANTS
量化版本与硬件要求
HARDWARE MATCH
哪些显卡或设备更适合运行?
按当前最小量化文件估算,至少需要 3GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 4GB。
阅读 4GB 显存选型指南 →可以怎样运行
- 通过 Ollama 拉取仓库内的 GGUF 权重直接运行
- 用 llama.cpp 加载 Q8_0 与 mmproj 文件做本地推理
- LM Studio 导入仓库内 GGUF 文件即可使用
- 文本路径可考虑 SGLang 或 vLLM 部署 Transformers 格式权重
采用前要知道的限制
- 模型卡未给出该 GGUF 仓库的最大上下文长度
- 模型卡未提供具体推理速度或首字延迟数据
- 4B 小模型在复杂工程科研任务上仍弱于更大 MoE 版本
- 量化版本与原 Transformers 权重之间可能存在一致性差异,需自行验证