Icône menu hamburger Icône loupe de recherche
  1. TDN >
  2. High-Tech

Ils ont confié une entreprise fictive à des IA : le score de 24% qui devrait vous rassurer

Publié par Elodie le 28 Sep 2026 à 7:23
Bureaux vides avec écrans allumés sans employés

Et si votre entreprise était demain dirigée uniquement par des intelligences artificielles ? C’est exactement l’expérience que des chercheurs de l’université Carnegie Mellon viennent de mener, en créant une société entièrement fictive peuplée d’agents IA. L’objectif : vérifier, chiffres à l’appui, si ces agents peuvent vraiment remplacer des salariés. Le verdict, publié en prépublication, est sans appel et devrait faire du bien à tous ceux qui redoutent pour leur poste.

Une entreprise fantôme pour tester l’IA grandeur nature

Le principe de l’étude est simple, presque vicieux : recréer une entreprise de A à Z, avec ses postes, ses dossiers, ses collègues virtuels, mais en confiant les commandes à des agents d’intelligence artificielle. Les chercheurs y ont placé plusieurs modèles très connus du grand public : Claude d’Anthropic, GPT-4o d’OpenAI, Google Gemini, mais aussi Amazon Nova, Meta Llama et Qwen d’Alibaba.

Chacun de ces agents a reçu un poste précis : analyste financier, chef de projet ou encore ingénieur logiciel. Une seconde plateforme simulait en parallèle des collègues humains à contacter, comme un service des ressources humaines, pour rendre le décor le plus réaliste possible. De quoi tester si l’IA sait vraiment naviguer dans les rouages, parfois absurdes, de la vie de bureau.

Cette question n’est pas anodine : partout, des experts s’interrogent sur les emplois menacés par l’IA dans les dix prochaines années. Mais avant de trancher, encore fallait-il observer ces agents à l’œuvre sur des tâches concrètes de bureau. Et c’est là que les choses se corsent.

Des missions simples, un classement qui surprend

Les agents devaient accomplir des tâches très concrètes : fouiller des fichiers pour analyser une base de données, ou encore effectuer plusieurs visites virtuelles afin de choisir de nouveaux locaux pour l’entreprise. Rien d’extraordinaire, en somme, mais des missions qui exigent du bon sens, de la rigueur et une vraie compréhension du contexte.

Le classement final a de quoi surprendre ceux qui imaginaient une intelligence artificielle capable de tout gérer sans accroc. Ce genre de désillusion n’est pas isolé : un jeune consultant en intelligence artificielle a lui aussi découvert les limites du secteur à ses dépens, à seulement 26 ans. Ici, c’est un modèle censé être parmi les plus performants du marché qui domine, mais avec un score qui interroge davantage qu’il ne rassure les entreprises pressées d’automatiser.

Claude 3.5 Sonnet termine largement en tête du classement établi par les chercheurs. Sauf que cet agent, présenté comme le meilleur de la simulation, n’est parvenu à terminer intégralement que 24 % des tâches confiées. En comptant aussi les tâches partiellement réalisées, son score grimpe à peine à 34,4 %. Autant dire qu’aux deux tiers du travail, le patron virtuel aurait eu de quoi s’arracher les cheveux.

Salarié soulagé devant son écran d'ordinateur

Le détail qui change tout : pourquoi l’IA rate autant de tâches simples

Reste à comprendre ce qui coince vraiment, et c’est là que l’étude devient passionnante. Comme le rappelait récemment un patron allemand voulant faire travailler ses salariés plus longtemps, la productivité humaine reste un sujet sensible : celle des IA testées ici l’est tout autant, pour des raisons bien différentes.

Derrière Claude, l’écart se creuse sérieusement. Gemini 2.0 Flash de Google arrive en seconde position du classement, mais ne complète que 11,4 % des tâches demandées. Aucun autre agent testé, parmi Amazon Nova, Meta Llama ou Qwen d’Alibaba, ne parvient à dépasser la barre des 10 %. Un fossé énorme entre le premier et tous les suivants.

Le coût, lui, raconte une autre histoire : faire tourner Claude 3.5 Sonnet sur l’ensemble des tâches a coûté 6,34 dollars, contre seulement 0,79 dollar pour Gemini 2.0 Flash. Un modèle bien moins cher, mais bien moins fiable aussi.

Les chercheurs pointent surtout des lacunes très humaines, presque touchantes : les agents ne comprennent pas toujours l’implicite d’une consigne. Demandez-leur d’enregistrer un fichier au format « .docx » et certains n’en déduisent même pas qu’il s’agit d’un document Word. Ils échouent aussi par manque pur et simple de compétences sociales, incapables de deviner ce qu’un collègue humain attend d’eux sans que tout soit épelé noir sur blanc.

Mais le vrai point noir, c’est la navigation sur le web. Les fenêtres pop-up, ces petites bannières qui s’ouvrent sans prévenir, désorientent complètement les agents. Pire : quand ils se retrouvent perdus, beaucoup prennent des raccourcis pour éviter la partie difficile d’une tâche, tout en étant persuadés d’avoir réussi. Un mensonge à eux-mêmes qui en dit long sur les limites actuelles de l’autonomie artificielle.

Ce que ça change vraiment pour les salariés

Ces résultats ne signifient pas que l’intelligence artificielle est inutile en entreprise, loin de là. Sur des tâches très ciblées et bien cadrées, les modèles comme Claude ou GPT-4o peuvent donner d’excellents résultats. Le problème apparaît dès qu’on leur demande une autonomie complète, sur la durée, avec des imprévus à gérer.

Cette fragilité rejoint d’autres histoires déjà documentées : certaines directions ont testé le pari inverse, en misant sur l’IA plutôt que sur des humains, avant de faire marche arrière. Le sujet dépasse d’ailleurs la seule question technique : il touche aussi à des enjeux très concrets comme la transparence sur les salaires qui arrive dès 2026 en France, un rappel que le monde du travail reste avant tout une affaire humaine, faite de règles, de droits et de rapports de force.

Pour les salariés inquiets de voir leur poste automatisé du jour au lendemain, cette étude de Carnegie Mellon offre un répit bienvenu. Reste que les modèles évoluent vite, et que le score de 24 % d’aujourd’hui pourrait ne pas être celui de demain. D’ici là, mieux vaut aussi surveiller de près des sujets tout aussi concrets, comme l’évolution des règles de cumul emploi-retraite prévue pour 2027, qui touchera directement le pouvoir d’achat de millions de Français.

Un score de 24 %, c’est loin, très loin, du remplacement total redouté par tant de salariés. L’IA sait briller sur une tâche isolée, mais s’égare encore dès qu’il faut tenir un poste entier sans filet. Et si l’intelligence artificielle peut échouer à gérer une entreprise fictive, elle sait en revanche parfaitement piéger une acheteuse Vinted avec une simple photo truquée. De son côté, un habitué des plateaux télé n’a pas hésité à révéler des chiffres tout aussi étonnants sur le montant hallucinant de sa future retraite, preuve que les surprises ne viennent pas toujours des machines.

Laissez un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *