Last updated Jul 15, 2026
OSWorld 2.0 Leaderboard
The official leaderboard's latest evaluation data, as reported by our Scout
500 steps selected
| Model | Organization | Reasoning | Tool setting | Binary accuracy | Partial score | Est. cost |
|---|---|---|---|---|---|---|
| Claude Opus 4.8 | Anthropic | Max | Batched Tool | 20.60% | 54.80% | – |
| Claude Opus 4.8 | Anthropic | Max | Standard | 18.52% | 49.33% | – |
| Claude Opus 4.7 | Anthropic | Max | Batched Tool | 18.20% | 48.91% | – |
| Claude Opus 4.7 | Anthropic | Max | Standard | 13.90% | 49.10% | $3,870 |
| GPT-5.5 | OpenAI | XHigh | Batch Tool | 13.00% | 49.50% | $2,750 |
| Claude Sonnet 4.6 | Anthropic | Medium | Standard | 9.30% | 33.90% | $1,550 |
| Claude Sonnet 4.6 | Anthropic | Max | Standard | 8.30% | 41.50% | $2,410 |
| MiniMax M3 | MiniMax | Enabled | Standard | 4.60% | 22.30% | $259 |
| Kimi 2.6 | Moonshot AI | Enabled | Standard | 4.60% | 22.10% | $708 |
| Qwen 3.7-Plus | Alibaba | Thinking | Standard | 2.80% | 21.50% | $412 |
Frequently asked questions
Resources
Citation
@misc{yuan2026osworld2,
title={OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks},
author={Mengqi Yuan and Zilong Zhou and Xinzhuang Xiong and Weiming Wu and Jiayang Sun and Jiamin Song and Kaiqian Cui and Bowen Wang and Haoyuan Wu and Yitong Li and Dunjie Lu and Haikong Lu and Qi Zhen and Xinyuan Wang and Jiaqi Deng and Yuhao Yang and Cheng Chen and Boyuan Zheng and Alex Su and Xiao Yu and Hao Zou and Saaket Agashe and Xing Han Lu and Manpreet Kaur and Zhengyang Qi and Vincent Sunn Chen and Frederic Sala and Dayiheng Liu and Junyang Lin and Zhou Yu and Yu Su and Siva Reddy and Xin Eric Wang and Peng Qi and Tianbao Xie and Tao Yu},
year={2026},
eprint={2606.29537},
archivePrefix={arXiv},
primaryClass={cs.AI},
}