Anthropic continue la démonstration. Sur le classement agentic coding DeepSWE v1.1, Opus 5 (68,8 %) se fait doubler par Fable 5 (69,7 %) et surtout par GPT-5.6 Sol (72,7 %). Il cède aussi du terrain sur un test juridique face à Fable 5, et sur HealthBench, un test médical, où Mythos 5 le devance nettement (66,0 % contre 59,8 %). En sciences en revanche, la progression sur des tâches de chimie organique comme la déduction de structures moléculaires par spectroscopie est importante, puisqu’Opus 5 gagne plus de 10 points de pourcentage face à Opus 4.8, et près de 8 points sur des tâches liées aux protéines.
Source:
www.clubic.com






