Yutori

Last updated Jul 15, 2026

OSWorld 2.0 Leaderboard

The official leaderboard's latest evaluation data, as reported by our Scout

Markdown for agents

500 steps selected

ModelOrganizationReasoningTool settingBinary accuracyPartial scoreEst. cost
Claude Opus 4.8AnthropicMaxBatched Tool20.60%54.80%
Claude Opus 4.8AnthropicMaxStandard18.52%49.33%
Claude Opus 4.7AnthropicMaxBatched Tool18.20%48.91%
Claude Opus 4.7AnthropicMaxStandard13.90%49.10%$3,870
GPT-5.5OpenAIXHighBatch Tool13.00%49.50%$2,750
Claude Sonnet 4.6AnthropicMediumStandard9.30%33.90%$1,550
Claude Sonnet 4.6AnthropicMaxStandard8.30%41.50%$2,410
MiniMax M3MiniMaxEnabledStandard4.60%22.30%$259
Kimi 2.6Moonshot AIEnabledStandard4.60%22.10%$708
Qwen 3.7-PlusAlibabaThinkingStandard2.80%21.50%$412

Frequently asked questions

Resources

Citation
@misc{yuan2026osworld2,
  title={OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks},
  author={Mengqi Yuan and Zilong Zhou and Xinzhuang Xiong and Weiming Wu and Jiayang Sun and Jiamin Song and Kaiqian Cui and Bowen Wang and Haoyuan Wu and Yitong Li and Dunjie Lu and Haikong Lu and Qi Zhen and Xinyuan Wang and Jiaqi Deng and Yuhao Yang and Cheng Chen and Boyuan Zheng and Alex Su and Xiao Yu and Hao Zou and Saaket Agashe and Xing Han Lu and Manpreet Kaur and Zhengyang Qi and Vincent Sunn Chen and Frederic Sala and Dayiheng Liu and Junyang Lin and Zhou Yu and Yu Su and Siva Reddy and Xin Eric Wang and Peng Qi and Tianbao Xie and Tao Yu},
  year={2026},
  eprint={2606.29537},
  archivePrefix={arXiv},
  primaryClass={cs.AI},
}