Keskeinen muutos: Upwork myy nykyään työn toimittamista, jossa järjestelmät yhdistävät ihmiset ja koneet tulosten saavuttamiseksi sen sijaan, että ne vain täyttäisivät rooleja.
Vertailuarvon rajoitukset: Upworkin automaation vertailuarvossa testattiin valikoituja ja vähän monimutkaisuutta sisältäviä töitä, joten tulokset eivät voi edustaa suurinta osaa alustan töistä.
Ihmisen arvo: Ihmisten palaute paransi agenttien suoriutumista, mutta vaati huomattavasti enemmän aikaa eikä tuottanut koskaan luotettavaa onnistumista kaikissa töissä.
Todentamisaukko: Automaatio toimii parhaiten, kun tuotoksille on objektiiviset tarkistukset; harkintaa vaativa, eri toimintoja yhdistävä työ tarvitsee edelleen vastuullisen ihmisen omistajuutta.
Liiketoimintatesti: Mittaa automaatiota hyväksyttyjen tuotosten perusteella, hinnoittele asiantuntijatarkistus osaksi tuotantoa ja suojaa keskitason rooleja, joissa kehitetään tulevaa harkintakykyä.
Upwork on lopettanut itsensä kutsumisen osaajamarkkinapaikaksi. Nyt käytössä on termi ”työn toimitusalusta”, eikä kyse ole pelkästä asemoinnista.
Markkinapaikalla asiakas palkkaa henkilön. Työn toimitusalustalla asiakas määrittelee tavoitteen, ja järjestelmä päättää, millainen ihmisten ja koneiden yhdistelmä tuottaa sen.
Upworkin tekoälystä vastaava Andrew Rabinovich kuvailee ostettavaa yksikköä joksikin, joka on pienempi kuin työtehtävä ja pienempi kuin rooli. Hän sanoi AI4-tapahtumassa, että kahden vuosikymmenen alustadata viittaa siihen, että Upworkissa julkaistu työn valtava monimuotoisuus jakautuu noin 500–1 000 toistuvaan tehtävään. Hän kutsuu niitä ”työn atomiyksiköiksi”, perusfunktioiksi, jotka voidaan yhdistää uudelleen mihin tahansa asiakkaan julkaisemaan toimeksiantoon.
Yritys, joka aikoo myydä pilkottua työtä, ottaa samalla vastuulleen tietyn velvoitteen. Sen on tiedettävä, mitkä pilkotut osat kone voi suorittaa itsenäisesti, ja sen on tiedettävä tämä riittävän tarkasti voidakseen perustaa päätökseen taloudellisen panostuksen.
Siksi Upwork ajoi todellisia asiakastöitä vertailuanalyysin läpi, julkaisi tulokset nimellä Ihminen+agentti-tuottavuusindeksi ja dokumentoi menetelmän arXivin kautta julkaistussa artikkelissa joulukuussa.
Otsikoihin noussut havainto koskee sitä, mitä agentit saivat valmiiksi. Hyödyllisempi havainto koskee sitä, mitä niiden saaminen suoriutumaan maksaa ja kuka tuon hinnan lopulta maksaa.
Automatisoinnille suotuisin työ
Menetelmä ansaitsee tuloksia enemmän huomiota, koska se asettaa ylärajan sille, mitä tulokset voivat tarkoittaa.
Upwork valitsi 322 todellista työtä, jotka maksavat asiakkaat olivat jo julkaisseet ja jotka ihmistyötä tekevät freelancerit olivat jo saaneet valmiiksi asiakkaan hyväksyntää varten. Asiantuntijafreelancerit laativat jokaista työtä varten arviointikriteeristön, jossa oli 5–20 hyväksymiskriteeriä. Kriteerit luokiteltiin kriittisiin, tärkeisiin, valinnaisiin ja sudenkuoppiin. Työ katsottiin valmiiksi vain, jos kaikki kriittiset ja tärkeät kriteerit täyttyivät.
Työt suoritti kolme mallia: Claude, Gemini ja GPT-5.
Valintakriteerit ovat kohta, jossa johtajan tulisi hidastaa tahtia. Työt rajattiin kiinteähintaisiin, yhden virstanpylvään sopimuksiin, joiden laajuus oli selkeästi määritelty. Kestot vaihtelivat yhdeksästä tunnista yli 100 päivään, joten kyse ei ollut kaikilta osin mikrotehtävistä. Avoimet ja monimutkaiset työt jätettiin pois sillä perusteella, ettei agenteilla ollut niiden suorittamiseen kohtuullisia mahdollisuuksia.
Upwork kuvailee tämän ulkopuolelle jätetyn kategorian kattavan valtaosan alustalla suoritettavasta työstä.
Yksi lisärajoite on tärkeä kaikille, jotka ovat aikeissa torjua tulokset. Agentit pidettiin tarkoituksella perustasolla. Kukin luki työilmoituksen ja mahdolliset liitteet, laati suunnitelman, tuotti lopputuloksen ja lopetti. Ei verkkohakuja, pääsyä ulkopuoliseen dataan, lisätyökaluja eikä tehtävätyyppiin liittyvää koulutusta.
Siksi kirjoittajat huomauttavat, etteivät havainnot edusta työkaluilla varustettuja järjestelmiä, ja kuvailevat omia lukujaan varovaisiksi arvioiksi.
Jokainen alla oleva luku mitattiin siis puhtaimmassa saatavilla olevassa työssä, vaikeiden tapausten poistamisen jälkeen, ja käyttämällä agenteiksi riisuttuja järjestelmiä, joilta puuttuivat useimpien yritysten tosiasiassa käyttöön ottamat työkalut.
Hallinnollinen tuki on vaikeampaa kuin miltä se näyttää
Yksin työskennellessään agentit täyttivät kaikki kriteerit 4–68 prosentissa töistä kategoriasta ja mallista riippuen. Verkko- ja ohjelmistokehitys sijoittui kärkeen. Datatiede seurasi heti perässä.
Hallinnollinen tuki sijoittui kolmen mallin keskiarvossa viimeiseksi: kahden mallin tulos oli 6 prosenttia.

Tämä järjestys on suoraan ristiriidassa sen kanssa, miten useimmat automaatiosuunnitelmat jaksotetaan. Hallinnollinen työ otetaan ensin kohteeksi sillä järkevältä kuulostavalla oletuksella, että se on rakennuksen yksinkertaisin asia.
Vertailuanalyysi viittaa siihen, että yksinkertainen kuvattavuus ja yksinkertainen todennettavuus ovat eri ominaisuuksia, ja vain jälkimmäinen ennustaa, pystyykö agentti suorittamaan työn loppuun.
Rabinovichin oma kehystys osoittaa, kuinka helppo oletus on tehdä. Kun häneltä kysyttiin vaikutuksesta freelancereihin, hän kuvaili matalan tason työn, kuten logojen tekemisen ja asioiden tiivistämisen, olevan jo täysin automatisoitua. Hänen yrityksensä vertailuanalyysissä kirjoittamisen tulos oli mallista riippuen 4–51 prosenttia, ja Gemini sijoittui tämän vaihteluvälin alapäähän. Intuitio ja mittaus osoittavat eri suuntiin.
Asiantuntijapalautekierroksen lisääminen paransi jokaisen mallin kokonaissuoriutumista. Clauden tulos nousi 39,8 prosentista 51,2 prosenttiin matalan monimutkaisuuden tehtävissä vain yhden ihmisen väliintulon jälkeen. Geminin tulos nousi 19,9 prosentista 32,3 prosenttiin. GPT-5:n tulos nousi 19,6 prosentista 33,5 prosenttiin. Absoluuttisesti tämä tarkoittaa 11–14 prosenttiyksikön parannusta yhden ihmisen osallistumisella.

Upwork markkinoi suhteellisen vaihteluvälin yläpäätä jopa 70 prosentin nousuna. Tämä on tarkkaa laskentaa GPT-5:n matalaan lähtötasoon nähden, ja sitä kannattaa tarkastella absoluuttisten lukujen rinnalla.
Kategorioiden tason kehitys oli epätasaista. Clauden datatieteen tehtävien suoritus nousi 64 prosentista 93 prosenttiin. Geminin kirjoitustehtävien suoritus nousi 4 prosentista 16 prosenttiin. Geminin datatieteen tehtävissä ei tapahtunut lainkaan muutosta.
Yksikään tulos ei saavuttanut 100 prosenttia. Ei edes helpoimmissa saatavilla olleissa tehtävissä, vaikka asiantuntija ohjasi sitä.
Varmennus on osa-alue, jota emme ole ratkaisseet
Rabinovich arvioi laadullisen työn osuuden alustalla yli 90 prosentiksi ja kertoo suoraan, mitä tämä tarkoittaa arvioinnin kannalta. Deterministiseen työhön kuuluu oma tarkistusmenetelmänsä. Toinen malli voi varmentaa käännöksen. Koodi joko kääntyy ja läpäisee testit tai ei. Kaiken muun osalta ainoa käytettävissä oleva varmennus on harkintakykyinen ihminen, joka tarkastelee tuotosta ja päättää, onko se riittävän hyvä.
Hän kuvasi tätä suurelta osin ratkaisemattomaksi ongelmaksi ja meni vielä pidemmälle.
Ratkaise laadullisen tuotoksen luotettava validointi, niin olet enemmän tai vähemmän ratkaissut tekoälyn.
Artikkelin kirjoittajat ovat tarkkoja siitä, mitä heidän omat lukunsa tämän asian osalta osoittavat. He eivät tehneet epäonnistuneille tehtäville vastaavia pelkän agentin toisia yrityksiä, mikä tarkoittaa, ettei parannusta voida erottaa siitä vaikutuksesta, että mallin annettiin yksinkertaisesti yrittää uudelleen. Tämä on heidän ilmoittamansa rajoitus, joka on lueteltu tutkimuksen rajoituksissa.
Vertailu osoittaa jotain suppeampaa kuin Upworkin esitys antaa ymmärtää. Asiantuntijan palautteen jälkeinen toinen yritys suoriutuu ensimmäistä yritystä paremmin. Sitä, kuinka suuri osa kuuluu palautteelle ja kuinka suuri osa uudelle yritykselle, ei ole mitattu.
Yläraja on pysyvä havainto. Agentin onnistumiselle valituissa olosuhteissa noin yksi viidestä alun perin epäonnistuneesta tehtävästä saatiin pelastettua ihmisen ohjaamalla toisella yrityksellä, ja vahvimman mallin suoritustaso ylsi enintään 51 prosenttiin. Ihmisen ohjaamat suoritukset kestivät myös noin neljä kertaa kauemmin: 14,5 minuuttia verrattuna 3,6 minuuttiin.
Myös Upworkin oma tuoteratkaisu osoittaa samaan suuntaan. Yrityksen lippulaivana toimiva tekoälyjärjestelmä UMA rakennettiin orkestrointiagentiksi eikä työntekijäksi. Se tulkitsee tarkoituksen, pilkkoo sen osiin, ohjaa osat ihmisille tai koneille ja tarkistaa lopputuloksen. Se ei tee tehtävää.
Yritys, jolla on kaikki kaupalliset kannustimet myydä autonomista toimitusta, suunnitteli keskeisen järjestelmänsä sen oletuksen varaan, että ihminen pysyy mukana työssä.
Kaksi kysymystä ennen työnkulun rahoittamista
On kaksi keskeistä kysymystä, jotka on tärkeää esittää siitä, mitä haluat agenttien tekevän.
Voidaanko tuotos tarkistaa jotakin objektiivista vasten? Testikokonaisuus, täsmäytys, vaatimustenmukaisuussääntö tai luku, joka joko täsmää tai ei täsmää.
Pysyykö työ yhden toiminnon ja yhden formaatin sisällä? Vai siirtyykö se taustajärjestelmästä käyttöliittymään, tekstisisältöön ja brändihyväksyntään ennen kuin kukaan voi todeta sen valmiiksi?

Objektiivinen tarkistus ja itsenäinen työ ovat alue, jolle autonomiset agentit kuuluvat. Rahoita, mittaa ja laajenna sitä.
Objektiivinen tarkistus ja monialainen työ tarkoittavat yleensä sitä, että osat ovat automatisoitavissa, mutta niiden väliset rajapinnat eivät ole. Automatisoi komponentit ja pidä yksi ihminen vastuussa siirtymistä.
Harkintaan perustuva ja itsenäinen työ on neljännes, joka tuotti vertailun suurimmat parannukset ja jonka budjetointi tehdään väärin. Tästä lisää jäljempänä.
Harkintaan perustuva ja monialainen työ on alue, jolla agentit epäonnistuivat jokaisessa Upworkin testaamassa kategoriassa. Kohtele sitä ihmisen työnä, jota tekoäly avustaa, ja lopeta siihen liittyvien henkilöstömäärien lupaaminen.
Myös Upworkin oma taloudellinen mallinnus päätyy suunnilleen samaan johtopäätökseen. Pelkkä agentti voittaa vähäarvoisissa tehtävissä, joissa epäonnistumisen kustannus on pieni, yhteistyö voittaa keskitasolla ja kokonaan ihmisen tekemä työ voittaa arvokkaissa tehtävissä, joissa huono tuotos maksaa enemmän kuin automaatio säästää.
Tehtävä, jonka Upwork päätti esitellä
HAPI-sivulla on viisi esimerkkitehtävää, joiden tuotokset voi ladata. Yksi niistä on liidien generointitehtävä. Suodata mobiilisovellusten taulukosta yhdysvaltalaisten pääkonttoreiden sovellukset, etsi kustakin kahdesta neljään markkinointikontaktia ja täytä yhdeksän nimettyä saraketta.
Objektiivisesti tarkistettavissa. Yksi toiminto, yksi muoto. Arviointikriteerit ovat näkyvillä sivulla, eikä mikään niistä edellytä makuasioiden arviointia.
Molemmat toimitukset hylättiin arvioinnissa. Yksin työskennellyt agentti epäonnistui. Myös asiantuntijan kanssa työskennellyt agentti, jota ohjasi itsenäinen ammatinharjoittaja, epäonnistui.
Upwork julkaisi tämän omalla markkinointisivullaan väitteen vieressä, jonka mukaan yhteistyö voi kasvattaa tehtävien loppuun saattamista jopa 70 prosenttia. Yritykselle voi antaa tunnustusta asian paljastamisesta, mutta opetus kannattaa ottaa talteen, sillä tehtävä vastaa läheisesti työtä, jota yritykset jo antavat agenteille.
Oikea ihminen osana prosessia?
Jokainen toimittajan esitysmateriaali myy ihmistä osana prosessia turvallisuusominaisuutena. Kun lukee arviointikriteerit, esiin nousee toinen kysymys.
Kaikilla Upworkin arvioijilla oli 100 prosentin työmenestyspistemäärä sekä huippuarvioidun tai erittäin huippuarvioidun asema. Yhdessä he olivat ansainneet alustalla yli miljoona dollaria yli 96 000 työtunnin aikana.
Se edustaa maailmanlaajuisen osaajamarkkinapaikan huippua. Se on myös ainoa testattu arvioijajoukko. Tutkimuksessa todetaan, ettei tiimi kartoittanut arvioijien asiantuntemusta tai tutkinut, miten arvioijan tausta muuttaa hänen palautteensa arvoa. Nuoremman tason ehtoa ei ollut.
Niinpä jokainen tutkimuksen luku kuvaa ihmisen tekemän valvonnan parasta mahdollista tilannetta, kun taas sen vaikutusta, että tehtävään olisi palkattu kuka tahansa käytettävissä ollut henkilö, ei ole mitattu lainkaan.
Tämä on minun väitteeni, ei vertailututkimuksen, ja sillä on kaksi seurausta, joita useimmissa työvoimasuunnitelmissa ei ole hinnoiteltu.
Ensimmäinen on se, että tarkistaminen on tuotantokapasiteettia, ei yleiskustannus. Harkintaa edellyttävässä neljänneksessä asiantuntija ei ole automatisoituun prosessiin liitetty tarkistuspiste. Asiantuntija on panos, joka muuttaa luonnoksen toimituskelpoiseksi, ja ehtojen välinen nelinkertainen aikaero kertoo, mitä tämä panos maksaa.
Jos luokittelet sen valvonnaksi, vähättelet työnkulkua ja liioittelet säästöjä. Investoinnin perustellut laskelmat eivät enää kuvaa rakentamaasi prosessia.
Toinen seuraus on hitaampi ja huonompi. Jokainen suunnitelma, jossa keskitason rooleja vähennetään tekoälymenoihin rahoittamiseksi, karsii samalla joukkoa, josta muodostuisi kolmen vuoden kuluessa riittävän kokeneita henkilöitä ohittamaan mallin päätöksen.
Asiantuntijan harkinta ei ole pätevyystodistus, vaan työn jälki. Se kertyy työn tekemisestä, aluksi huonosti, kunnes kokeneempi henkilö korjaa virheitäsi. Kun automatisoit urapolun ensimmäiset askelmat, säilytät tämän päivän arvioijat mutta poistat mekanismin, joka tuottaisi huomisen arvioijat.
Kyse on ensin johtamisen ongelmasta ja vasta sen jälkeen henkilöstöongelmasta, ja se kuuluu sille, joka hyväksyy automaation liiketoimintaperustelun.
Jos agenteista tulee ostajia, harkinta on tuote
Rabinovichin näkemys markkinoiden seuraavasta suunnasta on, että agenteista tulee kysynnän lähde pelkän tarjonnan lähteen sijaan. Kun tehtävää suorittava malli ei pysty todentamaan vastaustaan – kyseessä voi olla lääketieteellinen kysymys, ravintolasuositus tai mikä tahansa makuasioihin perustuva asia – se palkkaa ihmisen reaaliajassa tarkistamaan vastauksen. Ihminen ei toimita projektia, vaan yksinkertaisesti vahvistaa tuotoksen.
Tämä on alustajohtajan kuvaus oman yrityksensä kasvupotentiaalista, joten siihen on suhtauduttava sen mukaisesti.
Työvoimaa koskeva johtopäätös pätee riippumatta siitä, toteutuuko mekanismi juuri tässä muodossa. Jos varmistaminen on ihmisen pysyvä tehtävä, arvoa tuottavat roolit määrittyvät tuotoksen laadun arvioinnin, eivät tuotantomäärän, perusteella.
Nämä roolit ovat tällä hetkellä hajallaan eri vaativuustasoilla, tehtäväperheissä ja kustannuspaikoissa, joita ei usein ole kartoitettu. Siksi useimmat organisaatiot eivät pysty sanomaan, keitä nämä henkilöt ovat tai mitä heidän korvaamisensa maksaisi.
Neljä toimenpidettä
Mitä voit siis tehdä arvioidaksesi, oletko valmis antamaan tehtäviä agenteille niin, että ne hoitavat ainakin osan työstä?
- Ota kymmenen tuotosta kaikkein pisimmälle automatisoidusta työnkulustasi ja näytä ne henkilölle, joka aiemmin vastasi kyseisestä työstä. Kysy, kuinka monta niistä hän olisi lähettänyt asiakkaalle muuttamatta niitä. Tämä luku on todellinen automaatioasteesi.
- Nimeä jokaiselle automatisoidulle työnkululle henkilö, jolla on valtuudet hylätä tuotos. Tarkista sitten, voiko hän käyttää tätä valtuutta ilman asian eskalointia.
- Luokittele uudelleen harkintaa edellyttävään neljännekseen kuuluvien työnkulkujen tarkistamiseen käytetty aika. Siirrä se valvonnasta tuotantoon ja laske liiketoimintaperustelu uudelleen.
- Lue toimittajasopimuksistasi, mitä loppuun saattaminen tarkoittaa. Jokaista kriteeriä vasten pisteytetty hyväksyntä ja väite "tehtävää yritetty" ovat eri asioita, ja vain toinen niistä vastaa sitä, mitä vertailututkimuksessa mitattiin.
