Yutori

Last updated Jul 15, 2026

MyPCBench Leaderboard

The official leaderboard's latest evaluation data, as reported by our Scout

Live leaderboard selected

ModelVendorWeightsPerfectRubric scorePerfect tasksMax stepsAvg. stepsTraj. efficiencyAgent interfaceSelf-reported
Claude Opus 4.8AnthropicClosed62.0%88.8%114200Computer onlyYes
Qwen-CUAQwen × XLangUnreleased58.7%84.3%108200Computer onlyYes
Claude Opus 4.6AnthropicClosed58.2%85.1%10710046.53.78Computer + BashNo
GPT-5.6-solOpenAIClosed55.4%85.3%10210057.22.26Computer + BashNo
GPT-5.6-lunaOpenAIClosed55.4%83.2%10210063.52.00Computer + BashNo
Qwen-3.7QwenUnreleased51.6%81.5%95200Computer onlyYes
Claude Sonnet 4.6AnthropicClosed50.5%78.5%9310045.83.68Computer + BashNo
GPT-5.5OpenAIClosed45.1%83.6%8310043.52.80Computer + BashNo
GPT-5.4 miniOpenAIClosed23.9%53.5%4410049.51.64Computer + BashNo
Qwen 3.5 35B-A3BAlibabaOpen7.6%42.4%1410066.01.41Computer + BashNo
Qwen 3.5 9BAlibabaOpen6.5%24.1%1210069.21.09Computer + BashNo

Frequently asked questions

Resources

Citation
@misc{jang2026mypcbench,
  title={MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents},
  author={Jang, Lawrence Keunho and Jang, Andrew Keunwoo and Koh, Jing Yu and Salakhutdinov, Ruslan},
  year={2026},
  eprint={2606.16748},
  archivePrefix={arXiv},
  primaryClass={cs.AI},
  url={https://mypcbench.com},
}