Skip to main content
Key Takeaways

Rumslig intelligens: Dr Fei-Fei Li betonar vikten av rumslig intelligens som nästa gräns inom AI.

Världsmodeller: Världsmodeller förutsäger fysiska miljöers nästa tillstånd, till skillnad från språkmodeller som fokuserar på text.

Datautmaningar: Det är svårt att få tillgång till rumsliga data, och de är sällsynta, vilket utgör ett betydande hinder för utvecklingen av rumslig AI.

Gradvis lansering: Framväxten av rumslig AI kommer sannolikt att ske gradvis och vara domänspecifik, till skillnad från språkbaserad AI.

Brådskande förberedelser: Organisationer behöver börja förbereda sig för den rumsliga AI:ns påverkan tidigare snarare än senare för att undvika fallgropar.

De AI-verktyg som har omformat kunskapsarbete under de senaste tre åren har en gemensam begränsning: de existerar helt och hållet inom språkets område.

De läser, skriver, sammanfattar och genererar. Det de inte kan göra är att förstå den fysiska världen, geometrin på ett lagergolv, den rumsliga logiken i ett kirurgiskt ingrepp eller den tredimensionella dynamiken i en produktionslinje.

Det är där Dr. Fei-Fei Li har byggt sin karriär.

Continue Reading for Free

Create a free account to finish this article, plus get ongoing access to timely insights and practical resources.

När hon talade vid HumanX i går argumenterade Stanford-datavetaren och medgrundaren av World Labs för att rumslig intelligens, det vill säga maskiners förmåga att uppfatta, resonera och agera i tredimensionella miljöer, utgör nästa betydelsefulla gräns inom AI-utvecklingen. Det är inte en ersättning för språkmodeller, var hon noga med att påpeka. Det är en helt annan typ av problem.

Mänsklig intelligens är inte bara språklig. Tänk på allt vi gör i vardagen och i vårt arbete. Allt involverar den tredimensionella världen, involverar rum, involverar rörelser och involverar interaktion.

Fei fei-36967
Fei Fei LiOpens new window

Medgrundare och vd för World Labs

För företagsledare som har ägnat de senaste två åren åt att organisera om arbetsflöden kring stora språkmodeller är Lis argument en användbar omstart. Produktivitetsvinsterna från AI-generering av text är verkliga, men de utgör bara en begränsad del av vad intelligens, mänsklig eller maskinell, faktiskt gör.

Det svårare och mer betydelsefulla arbetet, att navigera fysiskt i miljöer, tolka rumsliga data och verka i världen i stället för att beskriva den, är fortfarande till stor del olöst.

Vad världsmodeller gör

Li gör en tydlig åtskillnad mellan språkmodeller och det hon kallar "världsmodeller".

Där en språkmodell förutsäger nästa token i en sekvens förutsäger en världsmodell nästa tillstånd i en fysisk miljö. En tennisspelare som returnerar en serve i 120 miles i timmen gör något som ligger närmare det senare: hon läser bollens och kroppens aktuella tillstånd och beräknar vad som kommer härnäst på millisekunder.

Förutsägelse eller generering av tillstånd är grundläggande för rumslig intelligens,

Hennes företags modell, som kallas Marble, genererar verkliga tredimensionella världar, inte videor eller platta bilder, utan beständiga 3D-miljöer som kan navigeras i, ändras och användas som träningsmiljöer för efterföljande tillämpningar.

De omedelbara tillämpningar hon nämnde är lärorika för ledare som försöker förstå vart utvecklingen är på väg.

Robotträning är ett exempel: laboratorier använder redan genererade 3D-miljöer som syntetiska data för att träna fysiska robotar, vilket minskar beroendet av dyr och långsam datainsamling i den verkliga världen. Radiologi är ett annat. Att diagnostisera tillstånd utifrån bilddata är i grunden ett rumsligt problem. En lungnodul existerar i tre dimensioner; en AI som bara bearbetar tvådimensionella bilder arbetar med ofullständig information.

Självkörande bilar är det mest synliga exemplet som redan finns på marknaden. Li lyfte fram Tesla och Waymo som företag som redan har byggt fungerande världsmodeller inom ett specialiserat område.

"Ur det perspektivet har vi redan rumslig intelligens inom detta mycket kritiska men specialiserade område", sade hon.

Dataproblemet

Li var tydlig med vad som främst begränsar utvecklingen. Beräkningskraft är dyr, men tillgänglig. Modellarkitekturen utvecklas. Data är den svåra delen.

Språkmodeller drog nytta av i princip obegränsat träningsmaterial: internets samlade text, digitaliserade böcker och transkriberade samtal. Rumsliga data har ingen motsvarande korpus. Tredimensionella representationer av fysiska miljöer är sällsynta, dyra att framställa och svåra att standardisera.

Om du tycker att data om 3D-världar saknas", sade Li, "så saknas robotikdata i ännu högre grad.

Det här är inte ett abstrakt forskningsproblem. För alla organisationer som planerar att integrera fysisk AI, oavsett om det gäller tillverkning, sjukvård, logistik eller fastighetsförvaltning, kommer datainfrastrukturen att vara den begränsande faktorn.

De företag som redan samlar in rumsliga data från sin fysiska verksamhet, genom sensorer, bildsystem eller digitala tvillingar, bygger en tillgång vars värde de kanske ännu inte fullt ut uppskattar.

Inget ChatGPT-ögonblick i sikte

En sak som Li avstod från att lova är ett omvälvande ögonblick jämförbart med lanseringen av ChatGPT, då en enda konsumentprodukt över en natt gjorde en ny klass av AI-funktioner allmänt känd.

"Chatt är ett så utbrett konsumentbeteende", sade hon, "och när det finns ett så utbrett konsumentbeteende har man nått en vändpunkt."

Hon är skeptisk till att rumslig intelligens kommer att få genomslag på samma sätt, eftersom den kanske inte har ett enda, enkelt konsumentbeteende att förankras i. Det finns ingen uppenbar motsvarighet till att skriva en fråga i en chattruta.

Det innebär att införandet av rumslig AI sannolikt kommer att vara domänspecifikt och gradvis snarare än plötsligt och universellt. Robotiklaboratorier, företag inom medicinsk bilddiagnostik, spelutvecklare och VFX-studior kommer att möta den långt innan den blir ett självklart inslag i etablerad företagsprogramvara.

För CHRO:er och COO:er spelar den tidslinjen roll. Pressen att agera kring rumslig AI är inte densamma som pressen att agera kring språkbaserad AI var i början av 2023. Men förberedelsefönstret är också kortare än det verkar.

Det grundläggande arbetet – att förstå var fysisk intelligens skulle kunna förändra verksamheten, kartlägga era rumsliga datatillgångar och bygga upp kompetens i ledningsgruppen – tar längre tid än att införa en ny SaaS-produkt.

Li beskrev det aktuella läget som en konvergens: transformerarkitekturer som utvecklats för språk möter nu framsteg inom datorseende och 3D-databehandling som har byggts upp under flera år.

"För första gången ger det oss möjlighet att verkligen lösa några av de mest grundläggande problemen inom AI", sade hon.

Att betrakta denna konvergens som någon annans problem att bevaka kommer att leda till att många organisationer gör samma misstag som många gjorde när ChatGPT lanserades. De antog att de hade mer tid på sig än de faktiskt hade.