Automobili

CrossBFM: i robot iniziano a condividere ciò che imparano

Robot diversi collegati da una rete neurale comune che condividono comportamenti e apprendimento
CrossBFM affronta uno dei problemi più costosi della robotica moderna: ogni robot tende ancora a imparare soprattutto dentro il proprio corpo. Un umanoide, un quadrupede, un braccio industriale e un robot domestico possono condividere parte della stessa logica di percezione, ma movimenti, proporzioni, sensori e possibilità fisiche restano differenti. Questo costringe spesso a raccogliere dati e addestrare policy specifiche per ogni piattaforma. CrossBFM prova a spostare il confine: costruire una rappresentazione del comportamento abbastanza generale da poter essere trasferita fra embodiment diversi.Il valore del lavoro non sta nell’idea semplicistica che “un robot insegna automaticamente a tutti gli altri”. La parte interessante è la ricerca di uno strato comune fra intenzione, osservazione e azione. Se un sistema riesce a separare ciò che un comportamento significa dal modo specifico in cui un corpo lo esegue, l’esperienza raccolta da una piattaforma può diventare utile anche a un’altra. Il robot che apre un cassetto, sposta un oggetto o prepara una superficie non trasferisce necessariamente gli stessi movimenti articolari, ma può trasferire una struttura più astratta del compito.FuturVibe collega CrossBFM ai behavior foundation model, ai world model e all’apprendimento da video. Queste linee di ricerca puntano tutte a una stessa destinazione: ridurre il bisogno di programmare ogni comportamento da zero. Il vero salto della physical AI arriverà quando una nuova macchina potrà sfruttare milioni di esperienze già raccolte da corpi diversi, adattandole alla propria morfologia attraverso simulazione, fine-tuning e feedback del mondo reale.Nei prossimi 2–3 anni lo scenario più plausibile è la comparsa di librerie di skill portabili fra famiglie di robot compatibili. Non sarà ancora un comportamento universale, ma potremmo vedere produttori e laboratori riutilizzare rappresentazioni condivise per accelerare addestramento, teleoperazione e adattamento a nuovi compiti. Questo ridurrebbe enormemente il costo dei dati fisici, oggi uno dei principali colli di bottiglia della robotica.A dieci anni, se foundation model, simulazione e hardware convergeranno, l’esperienza robotica potrebbe diventare una risorsa di rete. Flotte industriali, robot domestici e macchine mobili potrebbero contribuire a un patrimonio comune di competenze, filtrato e adattato alle capacità di ciascun corpo.CrossBFM non dimostra ancora che qualunque robot possa imparare immediatamente da qualunque altro. Mostra però la direzione: il comportamento sta iniziando a separarsi dall’hardware. Quando questo accade, la robotica smette di crescere una macchina alla volta e comincia a costruire una memoria fisica condivisa.La conseguenza economica sarebbe enorme. Oggi raccogliere dati robotici è lento e costoso perché richiede hardware reale, operatori, ambienti sicuri e molte ripetizioni. Se una quota crescente dell’esperienza potesse essere riutilizzata fra corpi diversi, ogni ora di attività di una flotta potrebbe contribuire ad addestrarne altre. Questo creerebbe un effetto cumulativo simile a quello osservato nei modelli linguistici, ma ancorato alla fisica. Il limite resterà la realtà: attrito, equilibrio, deformazioni e contatti non si lasciano comprimere perfettamente in una rappresentazione astratta.

La prossima rivoluzione dei robot umanoidi potrebbe non arrivare da un robot migliore. Potrebbe arrivare dal momento in cui robot diversi smettono di imparare ciascuno da zero. CrossBFM, un lavoro apparso su arXiv il 29 settembre 2026, propone proprio questo: distillare uno spazio latente di comportamento condiviso fra corpi umanoidi differenti, trasformando l’esperienza motoria da proprietà di una singola macchina a risorsa trasferibile.

È un’idea che sembra tecnica, ma tocca uno dei colli di bottiglia più duri della physical AI. Oggi cambiare corpo significa spesso cambiare politica di controllo, dati, addestramento e calibrazione. Se invece il “significato” di un comportamento può essere separato dal corpo che lo esegue, la robotica può iniziare a costruire qualcosa di simile ai foundation model del linguaggio: una base comune che viene adattata a molti hardware.

Il paper CrossBFM descrive un approccio in cui lo spazio latente diventa l’asset trasferibile. Gli autori partono dal problema dei Behavior Foundation Models: possono rappresentare movimenti, obiettivi e ricompense in uno spazio comune, ma l’addestramento tradizionale richiede molte ore GPU per ciascun robot e produce spazi latenti non allineati fra piattaforme. CrossBFM cerca di rompere questa barriera.

Il problema nascosto dei robot: ogni corpo parla un dialetto diverso

Un umanoide alto 1,80 metri con gambe lunghe non ha la stessa dinamica di una piattaforma più compatta. Cambiano masse, inerzie, limiti dei giunti, coppie, sensori e frequenze di controllo. Lo stesso comando “cammina rapidamente e gira a sinistra” deve essere tradotto in sequenze motorie differenti.

Finora molta robotica ha trattato questa differenza come un fatto inevitabile: si addestra una politica per un corpo specifico. Ma questo frammenta l’esperienza. Un robot può accumulare milioni di transizioni utili senza che un altro robot sappia sfruttarle direttamente.

È l’opposto di ciò che ha reso potenti i foundation model. Un modello linguistico non viene riaddestrato da zero per ogni documento. Accumula rappresentazioni condivise e le riutilizza. CrossBFM prova a portare lo stesso principio nel controllo corporeo.

Dal movimento al concetto di movimento

La distinzione fondamentale è fra esecuzione e intenzione. “Accovacciarsi”, “raggiungere un punto”, “mantenere equilibrio mentre si ruota” sono concetti che possono essere condivisi, anche se le traiettorie esatte dei motori cambiano.

Car assembly line with robotic arms and car body
Foto: Lilian Do Khac su Unsplash

Se un modello riesce a rappresentare questi concetti in uno spazio latente comune, ogni nuovo corpo deve imparare soprattutto la traduzione fra quella rappresentazione e la propria fisica. Non deve reinventare da zero l’intera struttura del comportamento.

È una direzione complementare a GR00T N1 di NVIDIA, che punta a foundation model per robot umanoidi, e a Helix di Figure, che porta un modello vision-language-action dentro il controllo generalista. CrossBFM attacca un livello ancora più corporeo: la trasferibilità del comportamento fra embodiment.

Perché il dato robotico è molto più costoso del testo

Internet ha fornito ai modelli linguistici una quantità immensa di dati già esistenti. La robotica non ha avuto lo stesso regalo. I dati fisici vanno raccolti: teleoperazione, motion capture, simulazione, prove reali, errori, cadute.

Ogni ora di esperienza su un robot reale costa energia, hardware, supervisione e usura. Se quell’esperienza resta confinata a una singola piattaforma, la scala è lenta.

Da qui l’importanza di lavori come CrossBFM e X-WBC, un altro recente framework cross-embodiment che addestra rappresentazioni condivise su più robot. La convergenza di approcci indipendenti suggerisce che il settore sta iniziando a considerare l’embodiment non come un muro, ma come una variabile da modellare.

È lo stesso problema che FuturVibe ha affrontato raccontando i videogiochi come carburante per i world model: la physical AI ha bisogno di quantità e varietà di esperienza molto superiori a quelle che possiamo raccogliere manualmente.

Interpretazione FuturVibe: nasce il mercato del comportamento

Interpretazione FuturVibe. Se le rappresentazioni motorie diventano realmente trasferibili, il valore economico può spostarsi. Oggi un produttore vende hardware e software integrati. Domani potrebbero esistere librerie di comportamento indipendenti dal corpo.

robot, cyborg, futuristic, android, cybernetics, intelligence, gray robot, robot, robot, robot, robot, robot
Foto: Pixabay

Immaginiamo una skill di manipolazione addestrata su cinque piattaforme e adattabile a una sesta. Oppure una politica di equilibrio migliorata grazie a milioni di episodi provenienti da una flotta eterogenea. L’esperienza di un robot diventerebbe un aggiornamento potenziale per altri robot.

Questo trasformerebbe le flotte in macchine di raccolta dati distribuite. Più robot lavorano, più cresce il patrimonio comportamentale comune. È un effetto rete.

Il parallelo con

gli agenti AI digitali è forte: anche lì il valore aumenta quando procedure, strumenti e memoria possono essere riusati invece di essere ricostruiti a ogni task.

Non significa che un robot possa copiare qualsiasi altro robot

Qui serve cautela. Un latent space condiviso non annulla la fisica. Un robot senza mani non può acquisire magicamente la destrezza di una mano a cinque dita. Un attuatore debole non può replicare una dinamica che richiede coppie superiori ai suoi limiti.

Il trasferimento funziona quando esiste una struttura comune sufficiente. La rappresentazione può dire “cosa” fare, ma il corpo deve ancora sapere “come” farlo entro i propri vincoli.

Per questo i risultati in simulazione e sui robot reali vanno letti come prova di direzione, non come soluzione universale. La generalizzazione fuori distribuzione, il contatto con oggetti sconosciuti e la robustezza a guasti restano problemi aperti.

La convergenza con i world model

Il salto più interessante arriva quando un behavior foundation model incontra un world model. Il primo rappresenta ciò che il corpo può fare; il secondo cerca di prevedere come il mondo reagirà.

Un robot davvero generalista ha bisogno di entrambi. Deve immaginare conseguenze e possedere un repertorio motorio abbastanza ricco da trasformare il piano in azione.

Close-up of a futuristic white robot showcasing innovation and design.
Foto: Pexels

È qui che la linea fra world model, VLA e controllo motorio inizia a dissolversi. Il sistema futuro potrebbe avere un modello gerarchico: obiettivi in alto, simulazione delle conseguenze al centro, skill corporee in basso.

Il vantaggio di uno spazio comportamentale condiviso è che il livello alto può restare relativamente stabile mentre cambiano i corpi.

La convergenza con il video

Anche il video può diventare una sorgente di comportamento. Skild S1 ha mostrato la direzione del learning da video: osservare un’azione umana o robotica e trasformarla in una politica eseguibile.

Ma il video non contiene direttamente coppie motore, attriti o forze. Serve una rappresentazione intermedia capace di estrarre l’intenzione del movimento. Uno spazio latente cross-embodiment può diventare proprio quel ponte.

Questo è importante perché il mondo contiene ordini di grandezza più video che dati robotici. Se una parte di quel patrimonio diventa convertibile in esperienza motoria, il collo di bottiglia dei dati cambia radicalmente.

La convergenza con la simulazione

La simulazione permette di produrre miliardi di episodi senza rompere hardware. Il problema è il sim-to-real: una politica perfetta nel simulatore può fallire nel mondo fisico per dettagli non modellati.

Le rappresentazioni condivise possono aiutare perché costringono il modello a separare strutture generali da dettagli specifici. Non eliminano il gap, ma possono rendere più efficiente l’adattamento.

Questa traiettoria si collega all’AI come infrastruttura: flotte reali, simulatori, dataset video e modelli diventano parti di un unico ciclo di apprendimento.

A white robot is standing in front of a black background
Foto: Gabriele Malaspina su Unsplash

Un solo cervello, molti corpi?

La metafora è potente ma va usata con precisione. Non stiamo ancora parlando di un cervello universale che controlla qualsiasi macchina. Stiamo vedendo i primi tentativi di costruire rappresentazioni che non siano prigioniere di un singolo embodiment.

Se funzionano, la robotica potrebbe evolvere verso un’architettura modulare. Una parte del sistema comprende il compito, una parte prevede il mondo, una parte rappresenta il comportamento e un adattatore traduce tutto nella fisica del robot specifico.

Questo riduce il costo marginale di introdurre un nuovo corpo. Ed è esattamente ciò che serve a un mercato in cui convivranno decine di produttori e centinaia di forme robotiche.

La Cina e la scala delle flotte

La conseguenza geopolitica è evidente. Il paese o l’ecosistema che distribuisce più robot può raccogliere più esperienza fisica. Se l’esperienza è trasferibile, la scala della flotta diventa un vantaggio cumulativo.

Non conta soltanto chi costruisce il robot migliore oggi. Conta chi crea il ciclo più rapido fra distribuzione, dati, addestramento e aggiornamento.

È un meccanismo simile a quello visto nel software, ma con una differenza: il mondo fisico produce dati difficili da simulare perfettamente. Il vantaggio di una flotta reale può quindi essere molto forte.

Scenario 2028–2029: skill portabili fra famiglie di robot

Scenario FuturVibe, 2–3 anni. È plausibile che vedremo skill trasferibili almeno all’interno di famiglie compatibili di umanoidi. Non “scarica qualsiasi abilità su qualsiasi robot”, ma un modello base condiviso con adattatori specifici per embodiment.

drone, technique, technology, innovation, propeller, camera, remote, control, robot, helicopter, rotor, video, flying, surveillance, photographing, photography, spy, fly, aircraft, copter, field, drone, drone, drone, drone, drone
Foto: Pixabay

Perché accada servono dataset multi-robot più grandi, protocolli comuni e benchmark che misurino

il trasferimento reale. Serve inoltre che l’adattamento richieda ore o giorni, non mesi.

Il segnale contrario sarebbe che le differenze fisiche continuino a dominare al punto da rendere ogni adattamento quasi equivalente a un nuovo addestramento. I lavori recenti, però, stanno cercando esattamente di misurare quanto di quel costo può essere eliminato.

In fabbrica, questa evoluzione si collegherebbe alla physical AI industriale: un processo insegnato su una linea potrebbe essere trasferito più rapidamente a un’altra configurazione hardware.

Scenario 2036: l’esperienza fisica come cloud

Scenario FuturVibe, circa 10 anni. Immaginiamo milioni di robot di produttori diversi collegati a ecosistemi di apprendimento. Ogni macchina conserva limiti locali, ma una parte dell’esperienza viene distillata in rappresentazioni condivise.

Un robot in un magazzino scopre una strategia migliore per afferrare scatole deformabili. La skill viene validata, astratta e resa disponibile a piattaforme compatibili. Un umanoide domestico impara una nuova sequenza di manipolazione e la conoscenza entra in una libreria globale.

Il comportamento diventerebbe una forma di software. Non identico al software classico, perché probabilistico e legato alla fisica, ma distribuibile, versionabile e valutabile.

È qui che la robotica può iniziare ad avere la stessa dinamica esplosiva che i modelli linguistici hanno avuto dopo la nascita degli ecosistemi di API e modelli pre-addestrati.

Il collo di bottiglia si sposterà sulla sicurezza fisica

Una skill trasferibile può anche trasferire errori. Se milioni di robot condividono rappresentazioni, un difetto sistemico può propagarsi. Serviranno quindi test automatici, simulazioni avversariali, limiti di forza e rollback.

White robot toy casting a shadow in a dark studio setting, highlighting artificial intelligence.
Foto: Pexels

Nel digitale un bug può corrompere dati. Nel fisico può rompere oggetti o ferire persone. La verifica deve essere più severa.

Questo rende interessante la convergenza con l’AI che comprime il tempo della scienza: gli stessi agenti che generano nuove policy potrebbero costruire test, simulare edge case e cercare attivamente condizioni di fallimento.

Il punto che conta

CrossBFM non dimostra che il problema della robotica generalista sia risolto. Mostra qualcosa di più importante: il settore sta iniziando a trattare l’esperienza motoria come una rappresentazione trasferibile invece che come un patrimonio chiuso dentro un singolo corpo.

È un cambio di astrazione. E nella storia dell’informatica, i grandi salti spesso arrivano proprio quando troviamo l’astrazione giusta.

Il linguaggio ha avuto i token. Le immagini hanno avuto gli embedding. Il software sta avendo gli agenti. La robotica sta cercando il proprio livello universale.

Se lo spazio latente del comportamento diventerà quel livello, il futuro dei robot non sarà una folla di macchine che imparano da sole. Sarà una popolazione di corpi diversi che, per la prima volta, possono iniziare a condividere ciò che hanno imparato.

Cosa posso fare ora per te?

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Robin: l’AI scientist che genera ipotesi, legge gli esperimenti e ricomincia da sola

Laboratorio scientifico

RamanOmics: l’AI trova le cellule zombie dell’invecchiamento senza distruggerle

Microscopio per l’analisi non distruttiva delle cellule senescenti con RamanOmics

TranscriptFormer: l’AI impara 112 milioni di cellule e 1,5 miliardi di anni di evoluzione

Cellule al microscopio

LongevityBench: l’AI entra davvero nella biologia dell’invecchiamento

DNA e dati biologici per la ricerca sull’invecchiamento con intelligenza artificiale

Trasforma l’AI nel tuo lavoro.
Non leggere il futuro. Costruiscilo.

Ogni giorno migliaia di persone iniziano a usare l’intelligenza artificiale per:

✔ creare progetti online
✔ generare entrate reali
✔ automatizzare attività
✔ costruire libertà digitale

Non serve essere tecnici.
Non serve essere esperti.

Serve solo partire adesso.

Con il sistema SITO AI FuturVibe hai:

🔥 sito professionale già ottimizzato
🔥 AI personalizzata per lavorare al tuo posto
🔥 strategia concreta passo passo
🔥 aggiornamenti continui
🔥 supporto reale

Non stai comprando un sito.
Stai attivando una nuova possibilità di vita digitale.