ANTE:原生支持本地 GGUF 的 Coding Agent, Qwen3.6 27B 在 TB 2.1 跑到 56.2%

发布于

Koimiao: ANTE 是一个运行在终端中的 Coding Agent,使用方式类似 Claude Code 和 Codex,但它是从头用 Rust 编写的,下载包约 15 MB,解压后是一个无需 Node.js、Python 等运行时依赖的单文件程序。

ANTE 可以管理 llama.cpp 的安装、GGUF 模型发现、内存预估、加载进度和服务生命周期。模型下载完成后,无需账号、API Key 或网络,模型请求和输出都保留在本机。如果你已经在使用 Ollama、LM Studio、vLLM 或其他兼容 OpenAI 的服务,也可以直接接入。

当然,它还支持 OpenAI、Anthropic、Gemini、DeepSeek、OpenRouter 等在线模型,可以在同一个客户端中切换本地和云端模型。

### 性能测试
使用 Terminal-Bench 2.1 对 ANTE 的 agent harness 进行评测,测试采用 89 个任务、每个任务 5 次,共 445 次试验;每次评测均使用固定公开发布的 ANTE 版本,并提供原始 Harbor 运行记录。目前公开结果包括:

- **ANTE + DeepSeek V4 Flash 0731 max**:82.7% ± 1.79 SE,通过 368/445 次试验,完整评测的推理成本约 68.41 美元。
- **ANTE + 本地 Qwen3.6 27B Q4_K_M**:56.2% ± 2.36 SE。模型下载约 17 GB,完全在本地运行。
- **ANTE + GLM 5.2**:74.6% ± 2.06 SE。
- **ANTE + MiniMax M3**:62.1% ± 2.33 SE。

完整结果、具体版本和原始运行记录可以在这里查看:[https://antigma.ai/eval](https://antigma.ai/eval)

我们还测过 20 个相同任务在 Docker 中并发运行时的资源占用。在相同工作负载下,与 Claude Code 相比,ANTE 测得约:
- 7 倍更低的峰值内存占用
- 9 倍更低的平均 CPU 占用
- 5 倍更少的磁盘 I/O
完整数据可以查阅:[https://docs.antigma.ai/benchmarks/compare_table/](https://docs.antigma.ai/benchmarks/compare_table/)

### 如何尝试
目前支持 macOS 和 Linux,Windows 用户建议使用 WSL:

```bash
curl -fsSL https://ante.run/install.sh | bash
ante
```

进入后使用 `/offline-mode`,可以安装本地推理引擎,选择已经下载的 GGUF,或者从推荐列表下载模型。如果不喜欢 `curl | bash` 的方式,也可以直接从 GitHub Releases 下载:[https://github.com/AntigmaLabs/ante/releases](https://github.com/AntigmaLabs/ante/releases)

GitHub 仓库已经开放文档、协议、Rust SDK、部分基础组件和完整评测管道;核心 harness 目前仍以预编译二进制文件发布,完整开源进展记录在仓库的 issue #21。

### 相关链接
- GitHub: [https://github.com/AntigmaLabs/ante](https://github.com/AntigmaLabs/ante) (如果大家感兴趣,请点个 Star⭐️)
- 官网: [https://antigma.ai/](https://antigma.ai/)
- 评测页面: [https://antigma.ai/eval](https://antigma.ai/eval)
- 文档: [https://docs.antigma.ai/](https://docs.antigma.ai/)

---

原文链接:[点击查看](https://www.v2ex.com/t/1236484)

评论

暂无评论。

0.053964s