Skip to main content
Key Takeaways

Cambiamento fondamentale: Upwork ora vende la realizzazione del lavoro, in cui sistemi combinano persone e macchine per ottenere risultati anziché ricoprire ruoli.

Limiti del parametro di riferimento: Il parametro di riferimento sull'automazione di Upwork ha testato attività selezionate e poco complesse, quindi i suoi risultati non possono rappresentare la maggior parte del lavoro sulla piattaforma.

Valore umano: Il feedback umano ha migliorato il completamento da parte degli agenti, ma ha richiesto molto più tempo e non ha mai prodotto risultati affidabili per tutte le attività.

Lacuna nella verifica: L'automazione funziona meglio quando i risultati possono essere sottoposti a controlli oggettivi; il lavoro che richiede molto giudizio e coinvolge più funzioni ha ancora bisogno di una responsabilità umana identificabile.

Prova aziendale: Misura l'automazione in base ai risultati accettati, considera la revisione degli esperti come parte della produzione e proteggi i ruoli di livello intermedio che sviluppano il giudizio futuro.

Upwork ha smesso di definirsi un mercato di talenti. Ora il termine è “piattaforma per l'erogazione del lavoro” e il cambiamento va oltre il semplice posizionamento.

In un mercato, un cliente assume una persona. Su una piattaforma per l'erogazione del lavoro, un cliente indica un risultato e il sistema decide quale combinazione di persone e macchine lo produrrà.

Andrew Rabinovich, responsabile dell'AI presso Upwork, descrive l'unità acquistata come qualcosa di più piccolo di un lavoro e di un ruolo. Due decenni di dati della piattaforma, ha dichiarato all'AI4, suggeriscono che l'enorme varietà di lavori pubblicati su Upwork si scomponga in circa 500-1.000 attività ricorrenti. Le definisce “unità atomiche di lavoro”, funzioni di base che si ricombinano in qualsiasi incarico un cliente possa pubblicare.

Continua a leggere—e continua a guidare con intelligenza

Crea un account gratuito per terminare la lettura e unirti a una community di leader lungimiranti che sbloccano strumenti, playbook e approfondimenti per prosperare nell'era dell'IA.

Name*
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
By submitting this form, you agree to receive our newsletter, and occasional emails related to People Managing People. You can unsubscribe at any time. For more details, please review our Privacy Policy

Un'azienda che intende vendere lavoro scomposto eredita un obbligo. Deve sapere quali componenti scomposti una macchina può completare autonomamente e deve saperlo con sufficiente precisione da poter investire denaro sulla base di questa risposta.

Per questo Upwork ha sottoposto lavori reali di clienti a un benchmark, ha pubblicato i risultati come Indice di produttività umani+agenti e ha documentato la metodologia in un articolo pubblicato tramite arXiv a dicembre.

Il risultato principale riguarda ciò che gli agenti hanno completato. Quello più utile riguarda il costo necessario per far sì che lo completino e chi, alla fine, sostiene quel costo.

Il lavoro più favorevole all'automazione

La metodologia merita più attenzione dei risultati, perché stabilisce il limite massimo di ciò che i risultati possono significare.

Upwork ha selezionato 322 lavori reali già pubblicati da clienti paganti e già completati con l'accettazione del cliente da freelance umani. Freelance esperti hanno redatto una griglia di valutazione per ciascuno, composta da 5 a 20 criteri di accettazione, suddivisi in critici, importanti, facoltativi e problematici. Un lavoro veniva considerato completato solo se superava ogni criterio critico e importante.

Tre modelli hanno eseguito il lavoro: Claude, Gemini e GPT-5.

I criteri di selezione sono il punto su cui un dirigente dovrebbe soffermarsi. I lavori erano limitati a contratti a prezzo fisso, con un unico traguardo e un ambito chiaramente definito. La durata andava da nove ore a più di 100 giorni, quindi non si trattava uniformemente di microattività. I lavori aperti e complessi sono stati esclusi con la motivazione dichiarata che gli agenti non avrebbero avuto una possibilità ragionevole di portarli a termine.

Upwork descrive la categoria esclusa come la stragrande maggioranza di ciò che viene svolto sulla piattaforma.

Un ulteriore vincolo è importante per chiunque stia per liquidare i risultati. Gli agenti sono stati mantenuti deliberatamente essenziali. Ognuno leggeva l'annuncio del lavoro e gli eventuali allegati, elaborava un piano, produceva un risultato e si fermava. Nessuna ricerca sul web, nessun accesso a dati esterni, nessuno strumento aggiuntivo e nessun addestramento sul tipo di attività.

Di conseguenza, gli autori osservano che i risultati non sono rappresentativi di sistemi ricchi di strumenti e descrivono i propri numeri come stime conservative.

Ogni cifra riportata di seguito è stata quindi misurata sul lavoro più semplice disponibile, dopo aver rimosso in anticipo i casi difficili, utilizzando agenti privati degli strumenti che la maggior parte delle aziende impiega effettivamente.

Unisciti alla community di People Managing People per accedere a contenuti esclusivi, modelli pratici, eventi riservati ai membri e approfondimenti settimanali sulla leadership—l'iscrizione è gratuita.

Name*
This field is hidden when viewing the form
This field is hidden when viewing the form
By submitting this form, you agree to receive our newsletter, and occasional emails related to People Managing People. You can unsubscribe at any time. For more details, please review our Privacy Policy
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form

Il supporto amministrativo è più difficile di quanto sembri

Lavorando da soli, gli agenti hanno superato ogni criterio in una percentuale di lavori compresa tra il 4% e il 68%, a seconda della categoria e del modello. Lo sviluppo web e software si trovava in cima. La scienza dei dati seguiva a breve distanza.

In media, il supporto amministrativo si è classificato all'ultimo posto tra i tre modelli, con un punteggio del 6% per due di essi.

Questo ordine contrasta direttamente con il modo in cui vengono sequenziate la maggior parte delle roadmap di automazione. Il lavoro amministrativo viene preso di mira per primo, sulla base del ragionevole presupposto che sia l'attività più semplice dell'edificio.

Il benchmark suggerisce che facilità di descrizione e facilità di verifica siano proprietà separate, e che solo la seconda predica la capacità di un agente di completare il lavoro.

La stessa formulazione di Rabinovich mostra quanto sia facile adottare questo presupposto. Interrogato sull'effetto sui freelance, ha descritto i lavori di basso livello, come creare loghi e scrivere sintesi, come attività già completamente automatizzate. Il benchmark della sua azienda ha assegnato alla scrittura un punteggio compreso tra il 4% e il 51%, a seconda del modello, con Gemini in fondo a questo intervallo. L'intuizione e la misurazione indicano direzioni diverse. 

L'aggiunta di un ciclo di riscontri da parte di esperti ha aumentato il completamento complessivo per ogni modello. Claude è passato dal 39,8% al 51,2% nelle attività a bassa complessità dopo un solo intervento umano. Gemini è passato dal 19,9% al 32,3%. GPT-5 è passato dal 19,6% al 33,5%. In termini assoluti, si tratta di un miglioramento di 11-14 punti percentuali ottenuto con un solo intervento umano. 

Upwork presenta la parte superiore dell'intervallo relativo come un incremento fino al 70%, un calcolo aritmeticamente corretto sulla bassa base di GPT-5 e che vale la pena leggere insieme ai valori assoluti.

L'andamento a livello di categoria è stato disomogeneo. Il completamento di attività di data science da parte di Claude è passato dal 64% al 93%. La scrittura di Gemini è passata dal 4% al 16%. Le attività di data science di Gemini non sono cambiate affatto.

Nulla ha raggiunto il 100%. Nemmeno il lavoro più semplice disponibile, con un esperto a guidarlo.

La verifica è la parte che non abbiamo risolto

Rabinovich stima che la quota qualitativa del lavoro sulla piattaforma superi il 90% ed è diretto riguardo a cosa questo significhi per la valutazione. Il lavoro deterministico porta con sé il proprio controllo. Una traduzione può essere verificata da un altro modello. Il codice o compila e supera i test, oppure non lo fa. Per tutto il resto, l'unica verifica disponibile è una persona dotata di capacità di giudizio che esamina il risultato e decide se è valido.

Ha descritto questa situazione come in gran parte irrisolta, andando anche oltre. 

Risolvi la validazione affidabile dei risultati qualitativi e avrai più o meno risolto l’IA.

Andrew Rabinovich-63168
Andrew RabinovichOpens new window

CTO e responsabile dell'IA presso Upwork

Gli autori dell'articolo sono cauti riguardo a ciò che i loro stessi numeri dimostrano su questo punto. Non hanno eseguito seconde prove abbinate condotte esclusivamente dall'agente sui lavori falliti, il che significa che il miglioramento non può essere separato dall'effetto del semplice fatto di lasciare che il modello ci riprovi. Questa è la loro precisazione, riportata nella sezione sulle limitazioni.

Ciò che la valutazione comparativa dimostra è più limitato di quanto suggerisca l'impostazione di Upwork. Un secondo tentativo dopo il feedback di un esperto supera il primo tentativo. Quanto di questo risultato sia dovuto al feedback e quanto al nuovo tentativo non è stato misurato.

Il limite massimo è il risultato più significativo e duraturo. In condizioni selezionate per favorire il successo dell'agente, circa un lavoro inizialmente fallito su cinque è stato recuperato da un secondo tentativo guidato da una persona, e il completamento si è fermato al 51% per il modello più avanzato. Le esecuzioni guidate da una persona hanno richiesto inoltre circa quattro volte più tempo: 14.5 minuti contro 3.6.

La stessa decisione di prodotto di Upwork va nella medesima direzione. UMA, il principale sistema di IA dell'azienda, è stato progettato come agente di orchestrazione anziché come esecutore. Interpreta l'intento, lo scompone, assegna le parti a persone o macchine e verifica il risultato. Non svolge l'attività.

Un'azienda con ogni incentivo commerciale a vendere un'esecuzione autonoma ha progettato il proprio sistema centrale partendo dal presupposto che una persona rimanga coinvolta nel lavoro.

Due domande da porsi prima di finanziare un flusso di lavoro

Ci sono due domande fondamentali da porsi riguardo a ciò che si vuole far fare agli agenti. 

Il risultato può essere verificato rispetto a qualcosa di oggettivo? Una suite di test, una riconciliazione, una regola di conformità, un numero che o corrisponde oppure no.

Il lavoro rimane all'interno di una sola funzione e di un solo formato? Oppure passa dal backend al frontend, poi al testo e infine all'approvazione del marchio prima che qualcuno possa dichiararlo concluso?

Verifica oggettiva più lavoro autonomo è l'ambito in cui gli agenti autonomi hanno senso. Finanzialo, misuralo, amplialo.

Verifica oggettiva più lavoro interfunzionale di solito significa che le singole parti sono automatizzabili, ma non lo sono i punti di raccordo. Automatizza i componenti e mantieni una persona responsabile dei passaggi di consegne.

Basato sul giudizio più lavoro autonomo è il quadrante che ha prodotto i maggiori incrementi nella valutazione comparativa ed è quello a cui viene assegnato il budget in modo errato. Ne parleremo più avanti.

Basato sul giudizio più lavoro interfunzionale è l'ambito in cui gli agenti hanno fallito in ogni categoria testata da Upwork. Consideralo lavoro umano con assistenza dell'IA e smetti di promettere un numero di posti di lavoro eliminati.

La stessa modellazione economica di Upwork arriva più o meno alla medesima conclusione. L'esecuzione affidata esclusivamente all'agente prevale nelle attività di basso valore, dove il costo dell'errore è contenuto; la collaborazione prevale nella fascia intermedia; mentre l'esecuzione interamente umana prevale nei lavori di alto valore, dove un risultato scadente costa più di quanto faccia risparmiare l'automazione. 

Il lavoro che Upwork ha scelto di mostrare

La pagina HAPI include cinque lavori di esempio con risultati scaricabili. Uno è un'attività di generazione di lead. Filtrare un foglio di calcolo di applicazioni mobili per individuare quelle con sede negli Stati Uniti, trovare da due a quattro contatti di marketing per ciascuna e compilare nove colonne denominate.

Verificabile oggettivamente. Una sola funzione, un solo formato. I criteri di valutazione sono visibili sulla pagina e nessuno di essi richiede gusto personale.

Entrambi i risultati sono stati giudicati insufficienti. L'agente che lavorava da solo ha fallito. Ha fallito anche il professionista freelance che guidava l'agente lavorando insieme a un esperto.

Upwork lo ha riportato sulla propria pagina di marketing, accanto a una dichiarazione secondo cui la collaborazione aumenta il completamento fino al 70%. Bisogna riconoscere all'azienda il merito della trasparenza e poi trarne la lezione, perché quell'incarico è molto simile al lavoro che le aziende stanno già affidando a un agente.

La persona giusta nel processo?

Ogni presentazione commerciale dei fornitori vende la presenza di un essere umano nel processo come funzione di sicurezza. Leggendo i criteri di valutazione emerge una domanda diversa.

Tutti i valutatori di Upwork avevano ottenuto un punteggio di successo del 100% e lo stato di massima valutazione o di massima valutazione Plus. Nel complesso avevano guadagnato oltre 1 milione di dollari sulla piattaforma lavorando per più di 96.000 ore.

Si tratta del vertice di un mercato globale dei talenti. È anche l'unica popolazione di valutatori sottoposta al test. Il documento osserva che il team non ha delineato le competenze dei valutatori né studiato come il background di un valutatore modifichi il valore del suo feedback. Non esisteva una condizione con valutatori junior.

Quindi ogni numero dello studio descrive il caso migliore per la supervisione umana, mentre l'effetto di assegnare quel ruolo a chiunque avesse disponibilità non è stato misurato da nessuno.

Questa è la mia argomentazione, non quella del parametro di riferimento, e comporta due conseguenze che la maggior parte dei piani della forza lavoro non ha quantificato.

La prima è che la revisione rappresenta capacità produttiva, non spese generali. Nel quadrante basato sul giudizio, l'esperto non è un controllo aggiunto a un processo automatizzato. L'esperto è l'input che trasforma una bozza in qualcosa di pronto per essere consegnato, e la differenza di tempo di quattro volte tra le due condizioni è il costo di quell'input. 

Classificarla come supervisione significa sottostimare il flusso di lavoro e sovrastimare i risparmi. Il calcolo che ha giustificato l'investimento smette di descrivere il processo che avete effettivamente costruito.

La seconda conseguenza è più lenta e peggiore. Ogni piano che riduce i ruoli intermedi per finanziare la spesa per l'IA sta anche riducendo la popolazione che, entro tre anni, diventerà abbastanza senior da contraddire un modello.

Il giudizio degli esperti non è una credenziale, è un residuo. Si accumula svolgendo il lavoro, all'inizio male, mentre qualcuno con maggiore esperienza ci corregge. Automatizzate i gradini iniziali e conserverete i valutatori di oggi, eliminando però il meccanismo che produce quelli di domani.

È un problema di leadership prima ancora che di personale, e riguarda chiunque approvi il piano aziendale per l'automazione.

Se gli agenti diventano acquirenti, il giudizio è il prodotto

Secondo Rabinovich, il futuro di questo mercato vedrà gli agenti diventare una fonte di domanda anziché soltanto una fonte di offerta. Un modello che svolge un'attività che non è in grado di verificare, una domanda medica, una raccomandazione su un ristorante o qualsiasi altra cosa basata sul gusto, assume una persona in tempo reale per controllarla. La persona non realizza il progetto, si limita a convalidare il risultato.

È un dirigente di piattaforma che descrive le prospettive positive della propria azienda, e dovrebbe essere valutato di conseguenza.

L'implicazione per la forza lavoro rimane valida indipendentemente dal fatto che il meccanismo si manifesti in quella forma. Se la verifica è il contributo umano duraturo, allora i ruoli che conservano valore sono definiti dal giudizio sulla qualità del risultato, non dal volume della produzione.

Attualmente questi ruoli sono distribuiti tra diversi livelli di anzianità, famiglie professionali e centri di costo che spesso non vengono mappati; ciò significa che la maggior parte delle organizzazioni non sa dire chi li ricopre né quanto costerebbe sostituirli.

Quattro mosse

Quindi cosa potete fare per valutare se siete pronti a iniziare ad affidare agli agenti almeno una parte del lavoro? 

  1. Prendete dieci risultati dal vostro flusso di lavoro più automatizzato e sottoponeteli a chi era precedentemente responsabile di quel lavoro. Chiedete quanti ne avrebbe inviati a un cliente senza modificarli. Quel numero è il vostro tasso reale di automazione.
  1. Per ogni flusso di lavoro automatizzato, indicate la persona autorizzata a rifiutare il risultato. Verificate poi se può esercitare tale autorità senza dover effettuare un'escalation.
  1. Riclassificate il tempo dedicato alla revisione nei flussi di lavoro che rientrano nel quadrante del giudizio. Spostatelo dalla supervisione alla produzione e ricalcolate il piano aziendale.
  2. Leggete nei contratti con i fornitori cosa si intende per completamento. L'accettazione valutata secondo una griglia rispetto a ogni criterio e la dicitura "attività tentata" sono affermazioni diverse, e solo una di esse corrisponde a ciò che ha misurato il parametro di riferimento.
David Rice

David Rice è un giornalista ed editor di lunga esperienza, specializzato in risorse umane e temi legati alla leadership. Ha lavorato in diversi settori per pubblicazioni cartacee e digitali negli Stati Uniti e nel Regno Unito.