# WeaveBench Leaderboard

> Last updated JUL 22, 2026

A current ranking of model and harness pairings on 114 hybrid GUI and CLI tasks. Claude Opus 4.7 with Claude Code leads at 41.2% PassRate.

Data is reproduced from the live leaderboard maintained by the WeaveBench authors. Yutori Scouts monitor the source for changes.

## Live leaderboard

| Model | Harness | PR | Overall | DSK | DOC | GAM | WEB | DAV | OPS | SPA | DES |
| --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- |
| Claude Opus 4.7 | Claude Code | 41.2% | 0.532 | 55.6% | 47.1% | 23.5% | 53.3% | 23.1% | 50.0% | 33.3% | 40.0% |
| GPT-5.5 | Codex CLI | 35.1% | 0.499 | 38.9% | 29.4% | 23.5% | 53.3% | 15.4% | 50.0% | 58.3% | 10.0% |
| Claude Opus 4.7 | OpenClaw | 35.1% | 0.482 | 55.6% | 29.4% | 23.5% | 66.7% | 15.4% | 41.7% | 16.7% | 20.0% |
| GPT-5.5 | OpenClaw | 33.3% | 0.466 | 38.9% | 35.3% | 35.3% | 21.4% | 23.1% | 38.5% | 33.3% | 40.0% |
| GPT-5.5 | Hermes Agent | 31.6% | 0.466 | 55.6% | 29.4% | 35.3% | 40.0% | 7.7% | 25.0% | 25.0% | 20.0% |
| Seed 2.1 pro | Claude Code | 30.7% | 0.551 | 44.4% | 41.2% | 17.6% | 40.0% | 30.8% | 8.3% | 33.3% | 20.0% |
| Seed 2.1 turbo | Claude Code | 28.9% | 0.571 | 38.9% | 35.3% | 17.6% | 33.3% | 30.8% | 16.7% | 33.3% | 20.0% |
| Claude Opus 4.7 | Hermes Agent | 28.1% | 0.516 | 33.3% | 47.1% | 11.8% | 26.7% | 30.8% | 50.0% | 8.3% | 10.0% |
| GPT-5.4 | OpenClaw | 22.8% | 0.465 | 55.6% | 35.3% | 5.9% | 0.0% | 23.1% | 23.1% | 8.3% | 20.0% |
| GPT-5.3-codex | OpenClaw | 18.4% | 0.456 | 33.3% | 23.5% | 29.4% | 0.0% | 7.7% | 16.7% | 8.3% | 20.0% |
| GPT-5.5 | Claude Code | 14.9% | 0.299 | 33.3% | 11.8% | 11.8% | 0.0% | 15.4% | 16.7% | 25.0% | 0.0% |
| Claude Opus 4.7 | Codex CLI | 13.2% | 0.378 | 16.7% | 11.8% | 11.8% | 6.7% | 7.7% | 25.0% | 16.7% | 10.0% |
| GPT-5.2-codex | OpenClaw | 6.1% | 0.321 | 5.6% | 11.8% | 0.0% | 0.0% | 15.4% | 16.7% | 0.0% | 0.0% |
| GPT-5.1-codex | OpenClaw | 1.8% | 0.226 | 0.0% | 5.9% | 0.0% | 0.0% | 7.7% | 0.0% | 0.0% | 0.0% |
| Gemini 3.1 Pro | OpenClaw | 1.8% | 0.223 | 0.0% | 0.0% | 0.0% | 0.0% | 0.0% | 8.3% | 8.3% | 0.0% |
| Qwen3.5-397B-A17B | OpenClaw | 0.9% | 0.318 | 0.0% | 0.0% | 0.0% | 0.0% | 0.0% | 8.3% | 0.0% | 0.0% |
| Qwen3-VL-8B-Think | OpenClaw | 0.9% | 0.092 | 0.0% | 0.0% | 0.0% | 0.0% | 8.3% | 0.0% | 0.0% | 0.0% |
| GUI-Owl-1.5-32B | OpenClaw | 0.0% | 0.065 | 0.0% | 0.0% | 0.0% | 0.0% | 0.0% | 0.0% | 0.0% | 0.0% |

## About the benchmark

WeaveBench evaluates 114 long-horizon tasks across 8 work domains. Every task requires an agent to interleave GUI observation or action with CLI or code execution in one trajectory inside a real Ubuntu sandbox.

## Official sources

- [Paper (arXiv 2606.09426)](<https://arxiv.org/abs/2606.09426>)
- [Code (GitHub)](<https://github.com/weavebench/WeaveBench>)
- [Dataset (Hugging Face)](<https://huggingface.co/datasets/wanlilll/WeaveBench>)
- [Official leaderboard](<https://weavebench.github.io/#leaderboard>)

Source revision (SHA-256): `8ddbbd4540e18054a1f22f062561817c34285697a9d2b7f6560d1825443686f9`
