Skip to main content
Key Takeaways

Förändrad styrning: AI-styrningen måste utvecklas från policy till övervakning i drift när agentisk AI börjar vidta autonoma åtgärder.

Prioritering vid driftsättning: AWS prioriterar snabb driftsättning av AI framför styrning och fokuserar på lärande och skalning i produktion.

Oförminskade risker: Credo AI katalogiserar 1 600 AI-risker, där 15 % saknar riskreducerande åtgärder, vilket väcker frågor om styrningen av agentisk AI.

Ansvarsluckor: Nuvarande styrningsramverk har svårt att fastställa ansvar för agentiska AI-åtgärder som påverkar användare.

Under en livedemonstration på HumanX förra veckan gick Mati Staniszewski, medgrundare av ElevenLabs, igenom en myndighetstjänsteagent som byggts på hans företags plattform.

Agenten guidade en fiktiv användare genom företagsregistreringen. Den autentiserade användarens identitet via WhatsApp. Den hämtade dokument från ett länkat Google-konto, bytte språk mitt i samtalet när användaren nämnde spansktalande medarbetare och svarade på frågor om processen för säljtillstånd i Kalifornien.

Sedan frågade användaren om skatter. Agenten avslutade samtalet.

Continue Reading for Free

Create a free account to finish this article, plus get ongoing access to timely insights and practical resources.

Den markerade inte någon osäkerhet. Den eskalerade inte ärendet. Den avslutade ett samtal som en verklig användare skulle ha antagit höll på att hanteras, eftersom agenten inte visste att det fanns en skattemyndighet att vidarebefordra ärendet till.

Staniszewski åtgärdade problemet på scenen på några minuter genom att koppla företagsagenten till en skatteagent, distribuera ändringen och starta om. Publiken såg en produktionsuppdatering genomföras live i realtid.

Det som är värt att stanna upp vid är inte att agenten misslyckades. Agenter misslyckas. Det är hur misslyckandet såg ut. Ingen varning. Ingen överlämning. Ingen dokumentation av vad användaren behövde. Bristen blev synlig först när en användare gick rakt in i den.

Placera nu det scenariot i Revolut, som har distribuerat ElevenLabs-agenter till fyra miljoner kunder på mer än 30 språk. Eller i Deutsche Telekom, vars nätverk nu omfattar agenter som hanterar kundfrågor i realtid. Flaskhalsen, sade Staniszewski, är inte längre tekniken. Det är driftsättningen.

Det påståendet är både korrekt och, för alla som ansvarar för vad dessa agenter gör, den viktigaste meningen under hela sessionen.

Den modell som styrningen byggdes för

Under större delen av de senaste tre åren har företagens AI-styrning fungerat utifrån en hanterbar uppsättning antaganden. Ett AI-system presenterade en rekommendation. En människa granskade den. Människan bar ansvaret för det som hände därefter. Modellen var inte perfekt, men den var begriplig. Man kunde peka ut var ett beslut fattades och vem som fattade det.

Den arkitekturen håller på att falla samman.

Navrina Singh, grundare och vd för Credo AI, har ägnat sex år åt att bygga det hon beskriver som kategorin AI-styrning, med början i den förutsägande maskininlärningens era och nu djupt inne i den agentbaserade eran.

På HumanX beskrev hon den centrala förändringen. Styrning handlade tidigare om policy, men nu måste den handla om operativa skyddsmekanismer och skyddsmekanismer under drift. Skillnaden är viktigare än den kanske låter. Policy är något man skriver, granskar årligen och uppdaterar när något går fel.

Styrning under drift innebär att kontinuerligt övervaka vad ett AI-system faktiskt gör i produktion, utifrån kriterier som kan behöva förändras i takt med att den underliggande modellen utvecklas.

Kör i realtid

Kör i realtid

“Man kan inte utöva styrning bara en gång. Man måste göra det kontinuerligt,” sade Singh.

Denna förändring från policy till styrning under drift motsvarar direkt skillnaden mellan rådgivande AI och agentbaserad AI. Rådgivande AI ger förslag inom ett definierat område. Agentbaserad AI vidtar åtgärder, kedjar samman dessa åtgärder över flera system, lämnar över till andra agenter och skapar resultat som ingen enskild människa har granskat innan de inträffade.

ElevenLabs-demonstrationen komprimerade detta till några minuter. En första användarinteraktion ledde till autentisering via WhatsApp, dokumenthämtning från Google Workspace, ett språkbyte, en sömlös överföring till en annan agent och ett proaktivt utgående samtal med ett erbjudande om ett bidragsprogram. Fem tydligt avgränsade autonoma åtgärder. Ingen människa godkände varje steg. Det är så agentbaserad AI ser ut på nivån för ett enskilt användningsfall.

I företagsskala blir styrningsluckan betydligt svårare att hantera.

Each week, AI Signal takes one meaningful shift in AI and helps people leaders understand what changed, why it matters, and what to consider next.

Byggarnas kalkyl

Matt Garman, vd för Amazon Web Services, var tydlig med var värdet av AI faktiskt samlas i företagen. De tidiga framgångarna med generativ AI, innehållsskapande och dokumentsammanfattning, ger vika för något mer grundläggande.

Agenter är det sätt på vilket de flesta företag och koncerner kommer att få ut det mesta av värdet från AI.

Matt Garman-97630

Amazons interna utrullning följer det påståendet. Företagets verktyg Quick Suite ger hundratusentals medarbetare tillgång till AI-agenter som är anslutna till företagsdata i Salesforce, Workday, e-post och intern dokumentation.

Mjukvaruutvecklare producerar ungefär 4,5 gånger mer med hjälp av AI än utan. En kodagent vid namn Kiro löste nyligen en kunds buggförfrågan och skickade ut korrigeringen på 25 minuter.

Det här är verkliga vinster, och Garman presenterade dem utan att överdriva. Men inbäddat i argumentet för utrullning finns en prioriteringsordning som styrningen måste förhålla sig till. Staniszewski var tydlig med den.

Flaskhalsen är inte längre tekniken. Det är utrullningen. De företag som levererar, lär sig och skalar snabbt är de företag som kommer att vinna.

Mati-61294
Mati StaniszewskiOpens new window

Medgrundare på ElevenLabs

Leverera. Lär. Skala. Det är ordningen. Styrning ingår inte i den, inte för att den ignoreras, utan för att den konkurrenslogik som gäller just nu belönar snabbhet. "Lär"-fasen i den ordningen sker i produktion, med verkliga användare och verkliga konsekvenser.

Det här är inte cynism. Garman och Staniszewski beskriver hur teknikmarknader fungerar när förmågan förbättras snabbt och kostnaden för att vänta är verklig. Men för den CHRO som ansvarar för beslut om AI i arbetsstyrkan, eller den COO vars verksamhet omstruktureras kring agentiska system, ser kalkylen annorlunda ut. De får inte del av uppsidan med att agera först. De ärver ansvaret när något går fel.

En lucka som ingen har slutit

Credo AI har sammanställt det som Singh beskriver som världens största arkiv över AI-risker, som för närvarande katalogiserar omkring 1 600 olika kategorier. De har begränsningsåtgärder för ungefär 85 procent av dessa.

De återstående 15 procenten, cirka 240 kända riskkategorier, saknar fortfarande etablerade begränsningsåtgärder. Det är läget för styrningen av rådgivande AI. Agentiska system, där flera modeller interagerar, lämnar över uppgifter och producerar resultat som matas in i ytterligare automatiserade beslut, introducerar felmoder som ännu inte har kartlagts fullständigt, än mindre åtgärdats.

Det svårare problemet som Singh identifierade är proveniens. I ett system med flera agenter kräver spårning av ansvar att man inte bara besvarar vilket beslut som fattades, utan också hur. Det vill säga vilken agent som bidrog med vad, vilka datakällor som konsulterades, var i kedjan ett fel uppstod och hur en korrigering skulle spridas vidare.

De flesta ramverk för styrning utformades för att utvärdera en modells resultat. De byggdes inte för att rekonstruera resonemanget i ett sammankopplat system som verkar över plattformar, modeller och organisatoriska gränser.

Saahil Jain, teknikchef på You.com, som skiftade fokus från konsumentsökningar till att bygga sök-API:er för AI-agenter, beskrev det strukturella problemet. Mänskliga användare interagerar med information och gör bedömningar av det de ser. Agenter som konsumerar information har inte samma förmåga till självkorrigering.

De kommer i princip att använda det sammanhang de får och hänvisa till det på något sätt som inte inkluderar människor i loopen", sade han.

Den styrningsarkitektur som företag har byggt förutsätter en mänsklig granskning någonstans i kedjan. Under veckan på HumanX var uttrycket "agenter som styr agenter" något jag hörde om och om igen. Agentisk utrullning verkar systematiskt ta bort det antagandet utan att ersätta det med något strukturellt likvärdigt.

Regelverken sluter inte luckan. Singh har gett råd till regeringar i USA, Europa, Australien och Indien om AI-styrning, och hon var tydlig med att ett enormt eftersläpande finns.

Regler som utformats för tidigare maskininlärningssystem passar inte smidigt ihop med agentiska arkitekturer. Colorados AI-lag driver på konsekvensbedömningar. Europeiska krav på integritet och transparens skärps på nivån för frontlinjemodeller.

Men takten i den agentbaserade utrullningen ligger långt före alla regleringscykler, och Singh förväntar sig att det kommer att fortsätta vara så under överskådlig framtid.

Efterlevnadens grundnivå är inte taket

Efterlevnad av SOC 2 har blivit ett grundkrav vid upphandling av AI-lösningar för större företag. Singh beskrev Fortune 500-kunder som efter ett års omfattande experimenterande med flera leverantörer nu granskar leverantörerna utifrån om deras data är skyddade, om deras ansvarsstandarder är dokumenterade och om införandet av deras AI i företaget innebär en nettoexponering.

Enligt Singh når därför endast omkring 40 % av AI-leverantörerna produktionssättning i stora företag. Urvalstrycket är verkligt.

Men SOC 2-efterlevnad och styrning av agentbaserad AI är två olika saker, och att blanda ihop dem är ett av de mer betydelsefulla misstagen som företagsmarknaden gör just nu.

SOC 2 hanterar säkerhet och tillgänglighet. Det säger något väsentligt om huruvida en leverantörs system är skyddade och tillförlitliga. Det säger ingenting om huruvida en agents beslut kan spåras, om dess resultat är kontextuellt korrekta, om den hanterar gränsfall på lämpligt sätt eller om dess beteende förändras när de underliggande modellerna uppdateras utan förvarning.

Det är styrningsfrågor, och de kräver en annan typ av infrastruktur än vad en efterlevnadscertifiering tillhandahåller.

Singh beskrev hur denna infrastruktur ser ut i praktiken: styrningsteam som omfattar dataforskare, risk- och integritetsspecialister samt beteendeexperter, inte bara säkerhetspersonal. Oberoende verifieringsorganisationer, däribland en framväxande standard kallad AIUC, som testar agentbaserade system mot etablerade kriterier genom externa parter. Kontinuerlig övervakning under drift, inte bara utvärdering före driftsättning.

Credo AI lanserade nyligen en styrnings-MCP, som för närvarande är i betaversion, utformad för att föra in skyddsräcken tidigare i själva utvecklingsprocessen och ge utvecklare möjlighet att bädda in styrningslogik redan vid konstruktionen, i stället för att lägga till den i efterhand.

Riktningen är rätt. Huruvida införandet går tillräckligt snabbt för att göra skillnad är en separat fråga.

Frågan om ansvar

Garman beskriver AI-omställningen på Amazon med en specifik optimism. Säljteam som tillbringar merparten av sin tid med kunder i stället för med pipelineadministration, mjukvaruutvecklare som inte längre blockeras av flera år långa ärendeköer, produkter som lanseras snabbare och med större lyhördhet för vad användarna faktiskt vill ha. Vinsterna är verkliga. Logiken är sund.

Men inbäddad i bilden av den agentbaserade utrullningen finns en fråga som styrningsramverken ännu inte har besvarat på ett tydligt sätt. När en AI-agent vidtar en åtgärd som skadar någon, vem bär då ansvaret?

Röstagenten som avslutar ett samtal vid fel tidpunkt och lämnar en användare som behövde hjälp utan stöd. Den finansiella AI:n som felaktigt flaggar någon och påverkar personens tillgång till kredit. Agenten för HR-urval som nedprioriterar en kandidat utifrån kriterier som kodar in historiska fördomar. Förmånsplattformen som automatiskt avslår ett anspråk utan någon mänsklig granskning innan beslutet når den som gjort anspråket.

I varje fall agerade en agent. I varje fall satte en människa den i rörelse. I varje fall är kedjan mellan beslut och konsekvens längre och mer utspridd än något som befintliga styrningsramverk utformades för att kartlägga.

Singhs iakttagelse om att vänta förtjänar att tas på allvar även bortom den affärslogik hon framförde.

"Många företag säger till oss när vi talar med dem: låt oss vänta tills en incident inträffar, och sedan kan vi investera i AI-styrning om det behövs", sade hon. "Vid det laget kommer de att vara irrelevanta."

Det är ett konkurrensargument. Det finns också ett svårare argument. När agentbaserad AI införs i förmånshantering, prestationsutvärdering, personalplanering, kundfinansiering och klinisk mottagning har de människor som tar emot dessa beslut berättigade intressen av hur besluten fattas och vem som svarar när de blir fel.

Styrningsramverk som kalibrerats för AI som rådgivare är inte tillräckliga för AI som aktör. Utvecklarna vet detta. Ändå fortsätter de att införa systemen. Fönstret för att bygga in ansvar i dessa system innan arbetsflödena omorganiseras kring dem står inte öppet för alltid.