Yutori

Last updated Jul 22, 2026

WeaveBench Leaderboard

The official leaderboard's latest evaluation data, as reported by our Scout

Live leaderboard selected

ModelHarnessPROverallDSKDOCGAMWEBDAVOPSSPADES
Claude Opus 4.7Claude Code41.2%0.53255.6%47.1%23.5%53.3%23.1%50.0%33.3%40.0%
GPT-5.5Codex CLI35.1%0.49938.9%29.4%23.5%53.3%15.4%50.0%58.3%10.0%
Claude Opus 4.7OpenClaw35.1%0.48255.6%29.4%23.5%66.7%15.4%41.7%16.7%20.0%
GPT-5.5OpenClaw33.3%0.46638.9%35.3%35.3%21.4%23.1%38.5%33.3%40.0%
GPT-5.5Hermes Agent31.6%0.46655.6%29.4%35.3%40.0%7.7%25.0%25.0%20.0%
Seed 2.1 proClaude Code30.7%0.55144.4%41.2%17.6%40.0%30.8%8.3%33.3%20.0%
Seed 2.1 turboClaude Code28.9%0.57138.9%35.3%17.6%33.3%30.8%16.7%33.3%20.0%
Claude Opus 4.7Hermes Agent28.1%0.51633.3%47.1%11.8%26.7%30.8%50.0%8.3%10.0%
GPT-5.4OpenClaw22.8%0.46555.6%35.3%5.9%0.0%23.1%23.1%8.3%20.0%
GPT-5.3-codexOpenClaw18.4%0.45633.3%23.5%29.4%0.0%7.7%16.7%8.3%20.0%
GPT-5.5Claude Code14.9%0.29933.3%11.8%11.8%0.0%15.4%16.7%25.0%0.0%
Claude Opus 4.7Codex CLI13.2%0.37816.7%11.8%11.8%6.7%7.7%25.0%16.7%10.0%
GPT-5.2-codexOpenClaw6.1%0.3215.6%11.8%0.0%0.0%15.4%16.7%0.0%0.0%
GPT-5.1-codexOpenClaw1.8%0.2260.0%5.9%0.0%0.0%7.7%0.0%0.0%0.0%
Gemini 3.1 ProOpenClaw1.8%0.2230.0%0.0%0.0%0.0%0.0%8.3%8.3%0.0%
Qwen3.5-397B-A17BOpenClaw0.9%0.3180.0%0.0%0.0%0.0%0.0%8.3%0.0%0.0%
Qwen3-VL-8B-ThinkOpenClaw0.9%0.0920.0%0.0%0.0%0.0%8.3%0.0%0.0%0.0%
GUI-Owl-1.5-32BOpenClaw0.0%0.0650.0%0.0%0.0%0.0%0.0%0.0%0.0%0.0%

Frequently asked questions

Resources

Citation
@article{li2026weavebench,
  title={WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces},
  author={Li, Wanli and Zhou, Bowen and Yu, Yunyao and Xu, Zhou and Yang, Yifan and Li, Dongsheng and Shan, Caihua},
  year={2026},
  eprint={2606.09426},
  archivePrefix={arXiv},
  primaryClass={cs.AI},
}