Skip to main content
Key Takeaways

Changement fondamental: Upwork vend désormais la réalisation du travail, en combinant des personnes et des machines pour obtenir des résultats plutôt que pour pourvoir des postes.

Limites de l’évaluation comparative: L’évaluation comparative de l’automatisation d’Upwork a porté sur des tâches sélectionnées et peu complexes ; ses résultats ne peuvent donc pas représenter la plupart des travaux proposés sur la plateforme.

Valeur humaine: Les retours humains ont amélioré l’exécution des tâches par les agents, mais ils ont nécessité beaucoup plus de temps et n’ont jamais produit de résultats fiables pour l’ensemble des tâches.

Lacune de la vérification: L’automatisation fonctionne le mieux lorsque les résultats peuvent être vérifiés objectivement ; les travaux exigeant du jugement et une collaboration entre plusieurs fonctions nécessitent encore la responsabilité directe d’un humain.

Test commercial: Mesurez l’automatisation à partir des résultats acceptés, considérez la vérification experte comme une étape de production à part entière et protégez les postes intermédiaires qui développent le jugement de demain.

Upwork a cessé de se définir comme une place de marché de talents. Désormais, le terme employé est « plateforme de livraison du travail », et ce changement va au-delà du simple positionnement.

Sur une place de marché, un client embauche une personne. Sur une plateforme de livraison du travail, un client énonce un résultat attendu et le système détermine quelle combinaison de personnes et de machines permettra de l'obtenir.

Andrew Rabinovich, qui dirige l'IA chez Upwork, décrit l'unité achetée comme quelque chose de plus petit qu'un emploi et de plus petit qu'un rôle. Deux décennies de données issues de la plateforme, a-t-il déclaré lors d'AI4, suggèrent que l'immense variété des travaux publiés sur Upwork se décompose en environ 500 à 1 000 tâches récurrentes. Il les appelle des « unités de travail atomiques », des fonctions de base qui se recombinent pour former n'importe quelle mission qu'un client pourrait publier.

Continuez à lire—et continuez à diriger plus intelligemment

Créez un compte gratuit pour terminer cet article et rejoindre une communauté de leaders tournés vers l'avenir exploitant outils, guides pratiques et perspectives pour prospérer à l'ère de l'IA.

Name*
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
By submitting this form, you agree to receive our newsletter, and occasional emails related to People Managing People. You can unsubscribe at any time. For more details, please review our Privacy Policy

Une entreprise qui entend vendre du travail décomposé hérite d'une obligation. Elle doit savoir quelles composantes décomposées une machine peut achever seule, et elle doit le savoir avec suffisamment de précision pour engager de l'argent sur cette réponse.

Upwork a donc soumis de véritables missions de clients à un test de référence, a publié les résultats sous le nom d'indice de productivité humain-agent, et a documenté la méthodologie dans un article publié via arXiv en décembre.

Le principal enseignement concerne ce que les agents ont achevé. L'enseignement le plus utile concerne le coût nécessaire pour les amener à l'achever, et la personne à qui ce coût incombe finalement.

Les travaux les plus favorables à l'automatisation

La méthodologie mérite davantage d'attention que les résultats, car elle fixe le plafond de ce que ces résultats peuvent signifier.

Upwork a sélectionné 322 missions réelles déjà publiées par des clients payants et déjà menées à bien jusqu'à leur acceptation par les clients, par des travailleurs indépendants humains. Des travailleurs indépendants experts ont rédigé une grille d'évaluation pour chacune d'elles, comportant entre 5 et 20 critères d'acceptation, classés comme critiques, importants, facultatifs ou comportant un risque d'échec. Une mission n'était considérée comme terminée que si tous les critères critiques et importants étaient satisfaits.

Trois modèles ont réalisé le travail : Claude, Gemini et GPT-5.

Ce sont les critères de sélection qui doivent inciter un dirigeant à examiner les choses plus attentivement. Les missions étaient limitées à des contrats à prix fixe, comportant une seule étape et dont le périmètre était clairement défini. Leur durée allait de neuf heures à plus de 100 jours ; il ne s'agissait donc pas uniformément de microtâches. Les travaux ouverts et complexes ont été exclus au motif déclaré que les agents n'avaient aucune chance raisonnable de les mener à bien.

Upwork décrit cette catégorie exclue comme représentant la grande majorité de ce qui est réalisé sur la plateforme.

Une autre contrainte est importante pour quiconque s'apprête à écarter ces résultats. Les agents ont été volontairement maintenus dans une configuration élémentaire. Chacun lisait l'offre de mission et les pièces jointes éventuelles, établissait un plan, produisait un livrable, puis s'arrêtait. Pas de recherche sur le Web, pas d'accès à des données externes, pas d'outils supplémentaires et aucun entraînement sur le type de tâche.

Par conséquent, les auteurs précisent que les résultats ne sont pas représentatifs de systèmes riches en outils et qualifient leurs propres chiffres d'estimations prudentes.

Ainsi, chaque chiffre ci-dessous a été mesuré sur le travail le plus facile à réaliser, les cas difficiles ayant été retirés à l'avance, avec des agents privés des outils que la plupart des entreprises utilisent réellement.

Rejoignez la communauté People Managing People pour accéder à du contenu exclusif, des modèles pratiques, des événements réservés aux membres et des conseils hebdomadaires en leadership—c'est gratuit de s'inscrire.

Name*
This field is hidden when viewing the form
This field is hidden when viewing the form
By submitting this form, you agree to receive our newsletter, and occasional emails related to People Managing People. You can unsubscribe at any time. For more details, please review our Privacy Policy
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form

Le soutien administratif est plus difficile qu'il n'y paraît

En travaillant seuls, les agents ont satisfait tous les critères dans 4 à 68 % des missions, selon la catégorie et le modèle. Le développement Web et logiciel arrivait en tête. La science des données suivait de près.

En moyenne, le soutien administratif arrivait dernier parmi les trois modèles, avec un score de 6 % pour deux d'entre eux.

Ce classement va directement à l'encontre de la manière dont la plupart des feuilles de route d'automatisation sont structurées. Le travail administratif est ciblé en premier, selon l'hypothèse raisonnable en apparence qu'il s'agit de la tâche la plus simple de l'entreprise.

Le test de référence suggère qu'il est simple de décrire une tâche et qu'il est simple de la vérifier sont deux propriétés distinctes, et que seule la seconde permet de prédire si un agent peut mener la mission à bien.

La propre formulation de Rabinovich montre à quel point cette hypothèse est facile à faire. Interrogé sur l'effet sur les travailleurs indépendants, il a décrit les tâches élémentaires — créer des logos, rédiger des résumés — comme étant déjà entièrement automatisées. Le test de référence de son entreprise a évalué la rédaction entre 4 % et 51 % selon le modèle, Gemini se situant au bas de cette fourchette. L'intuition et la mesure vont dans des directions différentes. 

L'ajout d'une phase de retour d'information d'un expert a amélioré le taux global d'achèvement pour chaque modèle. Claude est passé de 39.8 % à 51.2 % pour les tâches de faible complexité après une seule intervention humaine. Gemini est passé de 19.9 % à 32.3 %. GPT-5 est passé de 19.6 % à 33.5 %. En termes absolus, cela représente une amélioration de 11 à 14 points de pourcentage grâce à une seule intervention humaine. 

Upwork présente le haut de la fourchette relative comme une hausse pouvant atteindre 70 %, ce qui constitue un calcul arithmétique exact basé sur le faible niveau de référence de GPT-5 et qu'il convient de lire parallèlement aux chiffres absolus.

Les évolutions variaient selon les catégories. Le taux de réalisation de Claude en science des données est passé de 64 % à 93 %. Celui de Gemini en rédaction est passé de 4 % à 16 %. Les résultats de Gemini en science des données n'ont pas bougé.

Rien n'a atteint 100 %. Même pas sur les tâches les plus faciles disponibles, avec un expert pour le guider.

La vérification est la partie que nous n'avons pas résolue

Rabinovich estime que la part qualitative du travail sur la plateforme dépasse 90 %, et il explique clairement ce que cela implique pour l'évaluation. Le travail déterministe comporte son propre contrôle. Une traduction peut être vérifiée par un autre modèle. Le code compile et passe les tests, ou ce n'est pas le cas. Pour tout le reste, la seule vérification disponible consiste à faire examiner le résultat par une personne capable de discernement et à lui faire décider s'il est satisfaisant.

Il a décrit cette question comme largement non résolue, et est allé plus loin. 

Résolvez la validation fiable des résultats qualitatifs et vous aurez, à peu de choses près, résolu l’IA.

Andrew Rabinovich-63168
Andrew RabinovichOpens new window

Directeur technique et responsable de l'IA chez Upwork

Les auteurs de l'étude prennent soin de préciser ce que leurs propres chiffres démontrent sur ce point. Ils n'ont pas effectué de secondes tentatives comparables, réalisées uniquement par des agents, sur les tâches ayant échoué, ce qui signifie que l'amélioration ne peut pas être dissociée de l'effet du simple fait de laisser le modèle réessayer. C'est ce qu'ils indiquent dans leurs limites.

Ce que le référentiel établit est plus limité que ne le suggère la présentation d'Upwork. Une seconde tentative après un retour d'expert obtient de meilleurs résultats qu'une première tentative. La part de l'amélioration attribuable au retour et celle attribuable à la nouvelle tentative n'ont pas été mesurées.

Le plafond constitue le constat durable. Dans des conditions choisies pour favoriser la réussite des agents, environ une tâche initialement échouée sur cinq a été récupérée grâce à une seconde tentative guidée par un humain, et le taux de réalisation a plafonné à 51 % pour le modèle le plus performant. Les exécutions guidées par un humain ont également pris environ quatre fois plus de temps : 14,5 minutes contre 3,6.

La propre décision produit d'Upwork va dans le même sens. UMA, le système d'IA phare de l'entreprise, a été conçu comme un agent d'orchestration plutôt que comme un exécutant. Il interprète l'intention, la décompose, achemine les éléments vers des humains ou des machines et vérifie le résultat. Il n'effectue pas la tâche.

Une entreprise qui a tout intérêt commercial à vendre une prestation autonome a conçu son système central autour de l'hypothèse qu'un humain reste impliqué dans le travail.

Deux questions à se poser avant de financer un flux de travail

Deux questions essentielles doivent être posées concernant ce que vous voulez faire accomplir aux agents. 

Le résultat peut-il être vérifié par rapport à un élément objectif ? Une suite de tests, un rapprochement, une règle de conformité, un nombre qui correspond ou non.

Le travail reste-t-il au sein d'une seule fonction et d'un seul format ? Ou passe-t-il de l'arrière-plan à l'interface utilisateur, puis à la rédaction et à la validation de la marque avant que quiconque puisse le considérer comme terminé ?

Vérification objective et travail autonome : c'est là que les agents autonomes ont leur place. Financez-le, mesurez-le, développez-le.

Vérification objective et travail transversal signifient généralement que les éléments sont automatisables, mais pas les interfaces entre eux. Automatisez les composants et confiez à une personne la responsabilité des transmissions.

Travail fondé sur le jugement et autonome : c'est le quadrant qui a produit les plus fortes progressions du référentiel, et celui dont le budget est mal estimé. Nous y reviendrons ci-dessous.

Travail fondé sur le jugement et transversal : c'est dans ce quadrant que les agents ont échoué dans toutes les catégories testées par Upwork. Considérez-le comme un travail humain assisté par l'IA et cessez de lui associer des promesses en matière d'effectifs.

La modélisation économique d'Upwork aboutit à peu près à la même conclusion. Les agents seuls sont avantageux pour les tâches de faible valeur où le coût de l'échec est limité, la collaboration est gagnante dans la zone intermédiaire, et l'exécution entièrement humaine l'emporte pour les travaux à forte valeur, lorsqu'un mauvais résultat coûte plus cher que les économies réalisées grâce à l'automatisation. 

La tâche qu'Upwork a choisi de présenter

La page HAPI présente cinq tâches types avec des livrables que vous pouvez télécharger. L'une d'elles concerne la génération de prospects. Il faut filtrer une feuille de calcul d'applications mobiles pour ne conserver que celles dont le siège se trouve aux États-Unis, trouver deux à quatre contacts marketing pour chacune et remplir neuf colonnes nommées.

Vérifiable objectivement. Une seule fonction, un seul format. Les critères de l'évaluation sont visibles sur la page et aucun d'entre eux ne fait appel au goût.

Les deux livrables ont été déclarés non conformes à l'évaluation. L'agent travaillant seul a échoué. Le freelance travaillant avec un expert pour le guider a également échoué.

Upwork a publié cela sur sa propre page marketing, à côté d'une affirmation selon laquelle la collaboration augmenterait le taux d'achèvement de 70 % au maximum. Il faut reconnaître à l'entreprise le mérite d'avoir divulgué cette information, puis en tirer la leçon, car cette mission correspond étroitement à un travail que les entreprises confient déjà à un agent.

La bonne personne dans la boucle ?

Chaque présentation commerciale de fournisseur présente l'humain dans la boucle comme une fonctionnalité de sécurité. Lisez les critères de l'évaluation et une autre question apparaît.

Les évaluateurs d'Upwork avaient tous un taux de réussite de 100 % avec le statut Top Rated ou Top Rated Plus. Collectivement, ils avaient gagné plus d'un million de dollars sur la plateforme en travaillant plus de 96 000 heures.

C'est le sommet d'une place de marché mondiale des talents. C'est également la seule population d'évaluateurs testée. L'étude précise que l'équipe n'a pas établi le profil de l'expertise des évaluateurs ni étudié la manière dont le parcours d'un évaluateur modifie la valeur de ses commentaires. Aucune condition impliquant un profil junior n'a été prévue.

Ainsi, chaque chiffre de l'étude décrit le meilleur scénario possible pour la supervision humaine, tandis que l'effet du fait d'attribuer ce rôle à la personne disponible n'a été mesuré par personne.

C'est mon argument plutôt que celui de l'étude comparative, et il entraîne deux conséquences que la plupart des plans de main-d'œuvre n'ont pas chiffrées.

La première est que la vérification constitue une capacité de production, et non des frais généraux. Dans le quadrant fondé sur le jugement, l'expert n'est pas un point de contrôle ajouté à un processus automatisé. L'expert est l'apport qui transforme une ébauche en un résultat prêt à être livré, et la différence de temps, qui est d'un facteur quatre entre les deux conditions, correspond au coût de cet apport. 

En la classant dans la supervision, vous sous-estimez le flux de travail tout en surestimant les économies. Le calcul qui justifiait l'investissement cesse de décrire le processus que vous avez réellement construit.

La deuxième conséquence est plus lente et plus grave. Chaque plan qui réduit les postes intermédiaires pour financer les dépenses liées à l'IA réduit également la population qui deviendra suffisamment expérimentée pour contredire un modèle dans trois ans.

Le jugement d'un expert n'est pas un titre, c'est un résidu. Il s'accumule en faisant le travail, d'abord maladroitement, tandis qu'une personne plus expérimentée vous corrige. Automatisez les premiers échelons et vous conservez les évaluateurs d'aujourd'hui tout en supprimant le mécanisme qui produit ceux de demain.

C'est un problème de leadership avant d'être un problème d'effectifs, et il relève de la personne qui approuve le dossier d'investissement dans l'automatisation.

Si les agents deviennent des acheteurs, le jugement est le produit

Selon Rabinovich, l'évolution probable de ce marché est que les agents deviennent une source de demande plutôt qu'une simple source d'offre. Un modèle qui traite une tâche qu'il ne peut pas vérifier, qu'il s'agisse d'une question médicale, d'une recommandation de restaurant ou de tout autre sujet reposant sur le goût, engage un humain en temps réel pour la contrôler. L'humain ne réalise pas le projet ; il valide simplement le résultat.

C'est un dirigeant de plateforme qui décrit les perspectives de croissance de sa propre entreprise, et il faut l'évaluer comme tel.

La conséquence pour la main-d'œuvre reste valable, quelle que soit la forme sous laquelle le mécanisme apparaît. Si la vérification est la contribution humaine durable, les rôles qui conservent leur valeur sont définis par le jugement porté sur la qualité des résultats plutôt que par le volume de production.

Ces rôles sont actuellement dispersés entre différents niveaux d'ancienneté, familles de métiers et centres de coûts qui restent souvent non cartographiés, ce qui signifie que la plupart des organisations ne peuvent pas dire qui les occupe ni combien coûterait leur remplacement.

Quatre mesures

Alors, que pouvez-vous faire pour déterminer si vous êtes prêt à commencer à confier aux agents l'exécution d'au moins une partie du travail ? 

  1. Prélevez dix résultats de votre flux de travail le plus automatisé et présentez-les à la personne qui était auparavant responsable de ce travail. Demandez-lui combien elle aurait envoyés à un client sans modification. Ce nombre correspond à votre véritable taux d'automatisation.
  1. Pour chaque flux de travail automatisé, nommez la personne habilitée à rejeter le résultat. Vérifiez ensuite qu'elle peut exercer ce pouvoir sans devoir remonter la décision.
  1. Reclassez le temps de vérification dans les flux de travail qui relèvent du quadrant fondé sur le jugement. Faites-le passer de la supervision à la production et recalculez le dossier d'investissement.
  2. Lisez vos contrats fournisseurs pour vérifier ce que signifie l'achèvement. L'acceptation évaluée selon une grille par rapport à chaque critère et la mention « tâche tentée » correspondent à deux affirmations différentes, et une seule d'entre elles est celle que l'étude comparative a mesurée.
David Rice

David Rice est un journaliste et rédacteur chevronné, spécialisé dans les sujets liés aux ressources humaines et au leadership. Sa carrière s'est concentrée sur divers secteurs pour des publications imprimées et numériques aux États-Unis et au Royaume-Uni.