← 返回模型库

huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF

Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF:百万上下文去限制推理模型

基于 Qwen3.5 架构的 9B 参数文本生成模型,支持 1M 超长上下文,覆盖推理、函数调用、工具使用和网络安全、生物医学等方向。该版本经过 abliteration 处理,安全过滤被显著削弱,更适合研究、测试和受控环境中的技术探索。消费级显卡建议 6GB 显存起运行 Q4_K 量化版本。

长上下文去审查推理代理网络安全
查看模型源页面
下载量
0
参数
9B
上下文
未说明
架构 / 任务
未分类
许可证
apache-2.0

MODEL POSITIONING

这个模型解决什么问题?

模型能力来源于以 Qwen3.5 为基底的 empero-ai/Qwythos-9B-Claude-Mythos-5-1M 全量微调版本,强调长上下文、推理与代理能力,原始模型卡未说明的部分以标签信息为准。本仓库仅提供 GGUF 量化格式,不包含训练数据与原始权重。运行工具兼容 llama.cpp、Ollama 与 LM Studio,需使用最新版 llama.cpp 以支持 MTP 等特性。模型已去除安全限制,输出可能包含敏感或争议内容,定位偏向研究而非生产部署。

更适合谁

  • 研究人员与开发者进行长上下文与代理行为实验
  • 需要 1M token 上下文窗口的代码分析或文档处理
  • 关注网络安全与生物医学文本处理的实验用户
  • 在受控环境下测试去审查模型行为的从业者

典型使用场景

  • 长文档摘要与跨段落问答
  • 函数调用与多步代理工作流原型
  • 网络安全与生物医学文本分析研究
  • 翻译或格式转换等严格遵循首条指令的任务

SOURCE-BASED CAPABILITIES

模型卡透露的核心特点

超长上下文

来自基础模型配置与标签,支持 1M token 输入窗口

推理与代理能力

标签涵盖 reasoning、function-calling、tool-use、agentic

全量微调

模型卡标注 full-fine-tune,覆盖网络安全与生物医学方向

去审查输出

经 abliteration 处理,弱化安全过滤,输出更直接

硬件怎么准备

  • Q4_K 版本约 4.5GB,显存 6GB 或内存 8GB 即可运行
  • Q5_K 与 BF16 版本约 5.6GB,建议显存 7GB 或内存 8GB
  • Q6_K 版本约 6.75GB,建议显存 8GB 或内存 9.5GB
  • Q8_0 版本约 9GB,建议显存 11GB 或内存 13GB

量化版本怎么选

  • 显存紧张时优先选择 Q4_K,体积小且质量损失可控
  • 平衡质量与体积可选 Q5_K 或 Q6_K
  • Q8_0 适合显存充裕且追求更高保真度的研究场景
  • BF16 文件体积与 Q5_K 相近,可作为对照实验参考

GGUF VARIANTS

量化版本与硬件要求

数值根据文件体积和运行余量估算,不是速度或效果承诺;长上下文、并发与 GPU 层数会改变实际占用。

量化文件最低显存推荐显存推荐内存来源
Q44.2 GB5 GB6 GB8 GB文件 ↗
Q55.2 GB6 GB7 GB8 GB文件 ↗
BF165.2 GB6 GB7 GB8 GB文件 ↗
Q66.3 GB7 GB8 GB9.5 GB文件 ↗
Q88.4 GB9.5 GB11 GB13 GB文件 ↗

HARDWARE MATCH

哪些显卡或设备更适合运行?

按当前最小量化文件估算,至少需要 5GB 显存;如果希望为运行框架和上下文保留余量,优先参考推荐显存 6GB。

阅读 8GB 显存选型指南 →

可以怎样运行

  • llama.cpp 命令行方式加载 GGUF 文件
  • Ollama 直接拉取并启动模型
  • LM Studio 图形界面选择对应量化版本
  • 需使用最新版本 llama.cpp 以兼容 MTP 等特性

采用前要知道的限制

  • 安全过滤已削弱,可能输出敏感或争议性内容
  • 模型卡未提供上下文长度的官方基准测试数据
  • 标签以外的训练数据与评测细节模型卡未说明
  • 仅适合研究与受控环境,不建议直接用于生产或面向公众的商用部署