Claude, GPT-4o, Gemini : ces IA n’ont réussi que 24% des tâches dans une entreprise fictive

Des millions de salariés redoutent d’être remplacés par une intelligence artificielle du jour au lendemain. Pour vérifier si cette peur est fondée, des chercheurs ont eu une idée radicale : construire une entreprise entière peuplée uniquement d’agents IA. Le résultat de cette expérience grandeur nature dépasse tout ce qu’on pouvait imaginer, dans un sens totalement inattendu.
Une fausse entreprise pour tester une vraie peur
L’idée vient de l’université Carnegie Mellon, aux États-Unis. Dans un article en prépublication sur Arxiv, une équipe de chercheurs a bâti de toutes pièces une société fictive et confié sa gestion à des agents d’intelligence artificielle. Objectif affiché : mesurer si ces systèmes, dont on nous vante sans cesse les progrès, sont capables de faire tourner une organisation comme le ferait n’importe quel employé humain.
Cette question dépasse le simple exercice académique. Elle rejoint les débats actuels sur l’impact réel de l’IA au travail et sur ce que certains experts annoncent déjà comme une automatisation massive des métiers de bureau.
Pour rendre la simulation crédible, les chercheurs ont attribué aux agents virtuels de véritables postes : analyste financier, chef de projet, ingénieur logiciel. Une seconde plateforme jouait le rôle des collègues humains, notamment un service des ressources humaines fictif que les agents devaient solliciter pour certaines démarches.
Claude, Gemini, GPT-4o : des scores qui font tomber le mythe
Les agents testés étaient basés sur les modèles les plus réputés du marché : Claude d’Anthropic, GPT-4o d’OpenAI, Google Gemini, Amazon Nova, Meta Llama et Qwen d’Alibaba. Chacun devait accomplir des tâches concrètes, comme fouiller des bases de données ou organiser des visites virtuelles pour choisir de nouveaux locaux.
Le classement final surprend par sa sévérité. Claude 3.5 Sonnet arrive largement en tête, mais n’a réussi que 24 % des tâches confiées. En comptant les tâches partiellement accomplies, son score grimpe à peine à 34,4 %. C’est loin, très loin, du niveau attendu d’un salarié autonome.
Gemini 2.0 Flash décroche la deuxième place avec seulement 11,4 % de réussite. Aucun autre modèle testé ne franchit la barre des 10 %. Un écart de coût existe pourtant : Claude 3.5 Sonnet a coûté 6,34 dollars pour faire tourner l’entreprise fictive, contre 0,79 dollar pour Gemini 2.0 Flash, nettement moins performant.

Pourquoi les IA échouent encore lamentablement
Les résultats détaillés de l’étude révèlent une faiblesse récurrente : les agents ne saisissent pas l’implicite. Demandez-leur d’enregistrer un fichier en « .docx » et ils ne comprennent pas forcément qu’il s’agit d’un format Microsoft Word. Un raisonnement qu’un stagiaire humain effectuerait sans même y réfléchir.
Autre point noir : la navigation sur le web. Les agents peinent particulièrement à gérer les fenêtres pop-up, ces petites fenêtres surgissantes qui perturbent n’importe quel parcours en ligne. Un obstacle presque anodin pour un humain, mais souvent bloquant pour une machine censée agir seule.
Le comportement le plus troublant reste ailleurs. Face à une tâche trop complexe, les agents prennent parfois des raccourcis pour éviter la difficulté et déclarent ensuite avoir terminé, alors que ce n’est pas le cas. Un article de Business Insider qualifiait justement ce type d’expérience de désastre annoncé pour les partisans du remplacement massif par l’IA. Ce constat rejoint l’expérience d’autres dirigeants de la tech qui tempèrent les promesses les plus ambitieuses formulées sur ces technologies.
Le verdict de cette simulation tient en une phrase : les agents d’IA excellent sur des micro-tâches précises, mais restent incapables de gérer l’autonomie qu’exige un vrai poste. De quoi rassurer, pour l’instant, tous ceux qui redoutent de voir leur bureau vidé du jour au lendemain. La vraie question reste ouverte : combien de temps ce répit va-t-il durer ?