Početna
» New Trends
»
Iznad velikih jezičnih modela: Zašto je utjelovljena umjetna inteligencija sljedeća granica u tehnologiji
Iznad velikih jezičnih modela: Zašto je utjelovljena umjetna inteligencija sljedeća granica u tehnologiji
Veliki jezični modeli promijenili su računarstvo tako što su softveru dramatično poboljšali razumijevanje i generiranje jezika. Ali sljedeća velika granica nije samo veći chatbot. To je utjelovljena umjetna inteligencija : umjetna inteligencija koja može percipirati fizičko okruženje, zaključivati o tome što se događa, odabrati radnju, izvršiti tu radnju putem robota ili drugog stroja i koristiti povratne informacije za prilagodbu onoga što će sljedeće učiniti.
Ta je razlika važna jer fizički svijet ne čeka savršen odgovor. Skladišni robot koji poseže za kutijom mora procijeniti udaljenost, izbjegavati ljude, uzeti u obzir predmet koji mu klizi u hvataljci i odlučiti je li preuzimanje doista uspjelo. LLM može opisati te korake. Utjelovljeni sustav mora zatvoriti petlju između razumijevanja i djelovanja.
Humanoidni robot i istraživač komuniciraju s fizičkim objektom dok laboratorijski zaslon prikazuje petlju od percepcije do planiranja do djelovanja koja razlikuje utjelovljenu umjetnu inteligenciju od sustava koji se temelje samo na jeziku.
Kratak odgovor: utjelovljena umjetna inteligencija povezuje inteligenciju s posljedicama
LLM prvenstveno djeluje u informacijskom prostoru: tekstu, kodu, slikama, zvuku ili drugim digitalnim ulazima i izlazima. Utjelovljena umjetna inteligencija dodaje tijelo, senzore, aktuatore i kontrolnu petlju. To može značiti humanoidnog robota, mobilni manipulator, autonomno vozilo, dron ili neki drugi stroj koji mora sigurno djelovati u stvarnom svijetu.
U praksi, najjači sustavi ne napuštaju jezične modele. Oni oko sebe nadograđuju nove mogućnosti. Model visoke razine može interpretirati cilj poput "očisti ovaj radni stol", dok model vid-jezik-akcija , ili VLA, pretvara vizualna opažanja i jezične upute u robotske akcije. Kontroleri niže razine zatim obrađuju precizno kretanje, ravnotežu, silu i vrijeme.
Trenutni rad Google DeepMind-a na području robotike ilustrira tu podjelu. Njihova obitelj Gemini Robotics kombinira utjelovljeno zaključivanje s modelima koji vizualne i jezične ulaze pretvaraju u motoričku kontrolu. Tvrtkina kartica modela Gemini Robotics ER 2 iz srpnja 2026. opisuje model utjelovljenog zaključivanja dizajniran za prostorno, vremensko i fizičko zaključivanje. NVIDIA primjenjuje komplementarni pristup platforme: Isaac GR00T kombinira temeljne modele, podatkovne cjevovode, simulaciju, middleware i računarstvo na strani robota za opći razvoj humanoida.
Što se mijenja kada umjetna inteligencija dobije tijelo?
Sloj
Glavni posao
Što može poći po zlu
LLM ili zaključivanje na visokoj razini
Interpretirajte ciljeve, jezik, pravila i kontekst
Pogrešno shvaća zahtjev ili donosi nevažeći plan
Percepcija
Procijenite objekte, ljude, geometriju, kretanje i stanje sa senzora
Promašuje prepreku, krivo procjenjuje udaljenost ili gubi trag objekta
VLA ili pravila o robotima
Preslikavanje zapažanja i uputa u akcije
Odabire neučinkovit ili nesiguran pokret
Niskorazinska kontrola
Izvršite pokret, ravnotežu, hvat, silu i tajming
Proklizava, preskače, sudara se ili destabilizira
Povratne informacije i sigurnost
Otkrivanje uspjeha, neuspjeha, neizvjesnosti i opasnosti
Ne uspijeva se zaustaviti, oporaviti ili zatražiti ljudsku pomoć
Zato "samo stavite LLM u robota" nije dovoljna inženjerska strategija. Jezično zaključivanje je korisno, ali korisna fizička autonomija također zahtijeva senzore, kontrolu u stvarnom vremenu, kalibraciju, fiziku, sigurnosna ograničenja i ponašanje oporavka.
Zašto utjelovljena umjetna inteligencija napreduje upravo sada
1. Učenje robota dobiva širi raspon podataka
Tradicionalni industrijski roboti izvrsni su kada je okruženje strogo kontrolirano, a zadatak se jedva mijenja. Roboti opće namjene trebaju širu bazu iskustva. Projekt Open X-Embodiment okupio je više od milijun stvarnih putanja robota u 22 izvedbe robota. Njegov središnji nalaz bio je da obuka na različitim robotima može proizvesti koristan prijenos umjesto da svaki stroj uči samo iz vlastitog izoliranog skupa podataka.
To ne znači da jedan skup podataka čini robota univerzalno sposobnim. To pokazuje zašto su podaci o unakrsnim utjelovljenjima važni: iskustvo prikupljeno na jednoj platformi može pomoći modelima da nauče koncepte i ponašanja koja se generaliziraju na druge.
2. Modeli temelja prelaze s riječi na djela
Jezični model predviđa tokene. Model robotske osnove može se obučiti za predviđanje radnji uvjetovanih vizualnim opažanjima i jezikom. NVIDIA-ino istraživanje GR00T, na primjer, koristi mješavine ljudskog videa, stvarnih putanja robota, simuliranih putanja i sintetičkih podataka. Google DeepMind-ov rad na robotici slično se fokusira na kombiniranje multimodalnog zaključivanja s izvršavanjem radnji.
Praktična posljedica je važna. Umjesto da izrađuju zaseban model od nule za svaki zadatak odabira, postavljanja, sortiranja, dohvata ili predaje, programeri mogu krenuti od šireg modela i prilagoditi ga određenom robotu, okruženju i tijeku rada.
3. Simulacija smanjuje troškove fizičkih pokušaja i pogrešaka
Podaci o robotima iz stvarnog svijeta su skupi jer se hardver sporije kreće u usporedbi sa softverom, lomi se, troši i može stvoriti sigurnosne rizike tijekom obuke. Simulacija stoga djeluje kao multiplikator. NVIDIA-in Isaac Sim podržava simulaciju temeljenu na fizici, generiranje sintetičkih podataka, testiranje softvera u petlji i testiranje hardvera u petlji.
Simulacija nije zamjena za stvarnu validaciju. Jaz između simulacije i stvarnog modela i dalje postoji: trenje, osvjetljenje, fleksibilni materijali, šum senzora, ljudi i mehaničko trošenje mogu se razlikovati od virtualnog modela. Bolja upotreba simulacije je jeftino pokrivanje mnogih scenarija, a zatim validacija kritičnog ponašanja na stvarnom hardveru.
4. Sustav sada može razmišljati o uspjehu, ne samo izdavati naredbe
Utjelovljena inteligencija postaje mnogo korisnija kada robot može utvrditi je li korak uspio. Google DeepMindova najava Gemini Robotics-ER 1.6 iz travnja 2026. naglasila je prostorno rasuđivanje, planiranje, očitavanje instrumenata i otkrivanje uspjeha. Te su sposobnosti važne jer su fizički zadaci puni djelomičnih neuspjeha: ladica se može zaglaviti, boca se može prevrnuti ili dio može biti prisutan, ali nije ispravno postavljen.
Robustan sustav stoga treba više od plana. Potrebno mu je promatranje nakon akcije i politika što učiniti kada stvarnost ne odgovara planu.
Razmotrite upute: „Stavite alate u ladicu i bacite ambalažu.“ LLM može stvoriti razuman popis za provjeru. Utjelovljeni AI sustav mora učiniti puno više:
prepoznati koji su predmeti alati, a koji smeće;
procijeniti gdje se svaki objekt nalazi i je li dostupan;
odaberite siguran hvat bez gnječenja ili ispuštanja predmeta;
krećite se oko prepreka izbjegavajući ljude;
provjeriti je li objekt sletio na predviđeno mjesto;
oporaviti se ako hvatanje ne uspije ili se scena promijeni.
Ovaj primjer također pokazuje gdje utjelovljena umjetna inteligencija može biti loša opcija. Ako svaki objekt stiže u istoj orijentaciji na fiksnu transportnu traku, jednostavnija ćelija industrijske automatizacije može biti jeftinija, brža, lakša za validaciju i lakša za održavanje. Utjelovljena umjetna inteligencija postaje složenija kada se okruženje, objekti, upute ili tijekovi rada dovoljno razlikuju da kruta automatizacija postane krhka.
Kada je utjelovljena umjetna inteligencija dobar izbor
Utjelovljena umjetna inteligencija najatraktivnija je kada zadatak kombinira fizičku interakciju sa smislenom varijacijom. Dobri kandidati uključuju logistiku mješovitih artikala, fleksibilnu proizvodnju, automatizaciju laboratorija, inspekciju, servisnu robotiku i okruženja u kojima ljudi daju upute prirodnim jezikom koje moraju biti utemeljene na okolnoj sceni.
Četiri uvjeta potkrepljuju argument:
Varijacije su neizbježne. Objekti, položaji, rute ili ciljevi se često mijenjaju.
Zadatak ima koristi od percepcije i prosudbe. Fiksni slijed nije dovoljan.
Postoji dovoljno ekonomske vrijednosti za podršku prikupljanju podataka, integraciji i održavanju.
Može se definirati sigurna operativna zona. Ljudski nadzor, ograničenja brzine, zone ograničenja, zaustavljanja u nuždi ili druge zaštitne mjere mogu ograničiti rizik.
Kada je LLM, konvencionalni softver ili klasična automatizacija i dalje bolji
Utjelovljena umjetna inteligencija ne bi se trebala tretirati kao zadano rješenje za svaki problem automatizacije. Ako je posao u potpunosti digitalan, LLM ili konvencionalni softverski agent izbjegava troškove i rizik hardvera. Ako je fizički proces repetitivan i visoko strukturiran, tradicionalna robotska ćelija može nadmašiti utjelovljeni sustav opće namjene u pogledu vremena ciklusa i predvidljivosti.
Postoji i srednji put. Tvrtka može koristiti LLM za planiranje ili pomoć operateru, a istovremeno zadržati deterministički karakter izvršavanja gibanja. To može biti razuman izbor u reguliranim, sigurnosno kritičnim ili visokopropusnim okruženjima gdje se kompromis oko otvorene autonomije još ne isplati.
Teži problemi više nisu samo o inteligenciji modela
Kako se utjelovljena umjetna inteligencija poboljšava, uska grla u implementaciji sve se više sele u sistemsko inženjerstvo. Razvojni programeri moraju sinkronizirati kamere i druge senzore, kalibrirati geometriju robota, upravljati latencijom, prikupljati reprezentativne podatke, pratiti stanje hardvera, utvrđivati stanja kvara i definirati što se događa kada je pouzdanost niska.
Sigurnost se također fundamentalno razlikuje od sigurnosti chatbota. Loša rečenica može zavarati korisnika; loša motorna naredba može oštetiti opremu ili nekoga ozlijediti. Zato evaluacije modela, fizičke zaštitne mjere, praćenje izvođenja i mehanizmi ljudske intervencije moraju surađivati.
DeepMindove kartice modela robotike eksplicitno dokumentiraju namjeravanu upotrebu, ograničenja i sigurnosne aspekte, umjesto da predstavljaju mogućnosti modela kao dovoljan dokaz za neograničenu primjenu. To je koristan obrazac za industriju: demonstracije mogućnosti trebaju biti odvojene od dokaza da je sustav siguran i pouzdan na određenom radnom mjestu.
Što sljedeće gledati
Najvažniji signal nije postaju li roboti više ljudski. Radi se o tome postaje li skup inteligencije prenosiviji, učinkovitiji u obradi podataka, lakši za validaciju i sigurniji u promjenjivim okruženjima.
Već je vidljivo nekoliko smjerova. Učenje kroz različite izvedbe ima za cilj ponovno upotrijebiti iskustvo na različitim tijelima robota. Modeli cijelog tijela šire se izvan manipulacije na stolu. Zaključivanje na uređaju može smanjiti ovisnost o latenciji mreže za vremenski osjetljivo upravljanje. Simulacija i sintetički podaci koriste se za istraživanje slučajeva čija bi ponovna reprodukcija u stvarnom svijetu bila skupa ili opasna. Koordinacija više robota također se pomiče od istraživačke ideje prema integriranim mogućnostima sustava.
Niti jedan od ovih razvoja ne dokazuje da su roboti opće namjene spremni za svaki dom ili posao. Jači zaključak je uži i korisniji: granica umjetne inteligencije širi se od generiranja informacija do djelovanja pod fizičkim ograničenjima . Taj pomak uvodi nove mogućnosti, ali i nove zahtjeve za kontrolu, validaciju, sigurnost i ekonomiju.
Zaključak
Veliki jezični modeli ostaju važan dio stoga jer je jezik moćno sučelje za ciljeve, znanje i planiranje. Utjelovljena umjetna inteligencija proširuje tu inteligenciju u okruženja u kojima uspjeh ovisi o osjećanju što se zapravo događa, poduzimanju akcije i reagiranju na rezultat.
Za problem koji se odnosi isključivo na softver, LLM i dalje može biti pravi alat. Za fiksni fizički proces, konvencionalna automatizacija i dalje može pobijediti. Ali kada strojevi moraju raditi u neurednim, promjenjivim okruženjima i pretvarati ljudsku namjeru u pouzdano fizičko ponašanje, utjelovljena umjetna inteligencija postaje relevantnija granica.