La prossima rivoluzione dei robot umanoidi potrebbe non arrivare da un robot migliore. Potrebbe arrivare dal momento in cui robot diversi smettono di imparare ciascuno da zero. CrossBFM, un lavoro apparso su arXiv il 29 settembre 2026, propone proprio questo: distillare uno spazio latente di comportamento condiviso fra corpi umanoidi differenti, trasformando l’esperienza motoria da proprietà di una singola macchina a risorsa trasferibile.
È un’idea che sembra tecnica, ma tocca uno dei colli di bottiglia più duri della physical AI. Oggi cambiare corpo significa spesso cambiare politica di controllo, dati, addestramento e calibrazione. Se invece il “significato” di un comportamento può essere separato dal corpo che lo esegue, la robotica può iniziare a costruire qualcosa di simile ai foundation model del linguaggio: una base comune che viene adattata a molti hardware.
Il paper CrossBFM descrive un approccio in cui lo spazio latente diventa l’asset trasferibile. Gli autori partono dal problema dei Behavior Foundation Models: possono rappresentare movimenti, obiettivi e ricompense in uno spazio comune, ma l’addestramento tradizionale richiede molte ore GPU per ciascun robot e produce spazi latenti non allineati fra piattaforme. CrossBFM cerca di rompere questa barriera.
Il problema nascosto dei robot: ogni corpo parla un dialetto diverso
Un umanoide alto 1,80 metri con gambe lunghe non ha la stessa dinamica di una piattaforma più compatta. Cambiano masse, inerzie, limiti dei giunti, coppie, sensori e frequenze di controllo. Lo stesso comando “cammina rapidamente e gira a sinistra” deve essere tradotto in sequenze motorie differenti.
Finora molta robotica ha trattato questa differenza come un fatto inevitabile: si addestra una politica per un corpo specifico. Ma questo frammenta l’esperienza. Un robot può accumulare milioni di transizioni utili senza che un altro robot sappia sfruttarle direttamente.
È l’opposto di ciò che ha reso potenti i foundation model. Un modello linguistico non viene riaddestrato da zero per ogni documento. Accumula rappresentazioni condivise e le riutilizza. CrossBFM prova a portare lo stesso principio nel controllo corporeo.
Dal movimento al concetto di movimento
La distinzione fondamentale è fra esecuzione e intenzione. “Accovacciarsi”, “raggiungere un punto”, “mantenere equilibrio mentre si ruota” sono concetti che possono essere condivisi, anche se le traiettorie esatte dei motori cambiano.
Se un modello riesce a rappresentare questi concetti in uno spazio latente comune, ogni nuovo corpo deve imparare soprattutto la traduzione fra quella rappresentazione e la propria fisica. Non deve reinventare da zero l’intera struttura del comportamento.
È una direzione complementare a GR00T N1 di NVIDIA, che punta a foundation model per robot umanoidi, e a Helix di Figure, che porta un modello vision-language-action dentro il controllo generalista. CrossBFM attacca un livello ancora più corporeo: la trasferibilità del comportamento fra embodiment.
Perché il dato robotico è molto più costoso del testo
Internet ha fornito ai modelli linguistici una quantità immensa di dati già esistenti. La robotica non ha avuto lo stesso regalo. I dati fisici vanno raccolti: teleoperazione, motion capture, simulazione, prove reali, errori, cadute.
Ogni ora di esperienza su un robot reale costa energia, hardware, supervisione e usura. Se quell’esperienza resta confinata a una singola piattaforma, la scala è lenta.
Da qui l’importanza di lavori come CrossBFM e X-WBC, un altro recente framework cross-embodiment che addestra rappresentazioni condivise su più robot. La convergenza di approcci indipendenti suggerisce che il settore sta iniziando a considerare l’embodiment non come un muro, ma come una variabile da modellare.
È lo stesso problema che FuturVibe ha affrontato raccontando i videogiochi come carburante per i world model: la physical AI ha bisogno di quantità e varietà di esperienza molto superiori a quelle che possiamo raccogliere manualmente.
Interpretazione FuturVibe: nasce il mercato del comportamento
Interpretazione FuturVibe. Se le rappresentazioni motorie diventano realmente trasferibili, il valore economico può spostarsi. Oggi un produttore vende hardware e software integrati. Domani potrebbero esistere librerie di comportamento indipendenti dal corpo.

Immaginiamo una skill di manipolazione addestrata su cinque piattaforme e adattabile a una sesta. Oppure una politica di equilibrio migliorata grazie a milioni di episodi provenienti da una flotta eterogenea. L’esperienza di un robot diventerebbe un aggiornamento potenziale per altri robot.
Questo trasformerebbe le flotte in macchine di raccolta dati distribuite. Più robot lavorano, più cresce il patrimonio comportamentale comune. È un effetto rete.
Il parallelo con
Non significa che un robot possa copiare qualsiasi altro robot
Qui serve cautela. Un latent space condiviso non annulla la fisica. Un robot senza mani non può acquisire magicamente la destrezza di una mano a cinque dita. Un attuatore debole non può replicare una dinamica che richiede coppie superiori ai suoi limiti.
Il trasferimento funziona quando esiste una struttura comune sufficiente. La rappresentazione può dire “cosa” fare, ma il corpo deve ancora sapere “come” farlo entro i propri vincoli.
Per questo i risultati in simulazione e sui robot reali vanno letti come prova di direzione, non come soluzione universale. La generalizzazione fuori distribuzione, il contatto con oggetti sconosciuti e la robustezza a guasti restano problemi aperti.
La convergenza con i world model
Il salto più interessante arriva quando un behavior foundation model incontra un world model. Il primo rappresenta ciò che il corpo può fare; il secondo cerca di prevedere come il mondo reagirà.
Un robot davvero generalista ha bisogno di entrambi. Deve immaginare conseguenze e possedere un repertorio motorio abbastanza ricco da trasformare il piano in azione.

È qui che la linea fra world model, VLA e controllo motorio inizia a dissolversi. Il sistema futuro potrebbe avere un modello gerarchico: obiettivi in alto, simulazione delle conseguenze al centro, skill corporee in basso.
Il vantaggio di uno spazio comportamentale condiviso è che il livello alto può restare relativamente stabile mentre cambiano i corpi.
La convergenza con il video
Anche il video può diventare una sorgente di comportamento. Skild S1 ha mostrato la direzione del learning da video: osservare un’azione umana o robotica e trasformarla in una politica eseguibile.
Ma il video non contiene direttamente coppie motore, attriti o forze. Serve una rappresentazione intermedia capace di estrarre l’intenzione del movimento. Uno spazio latente cross-embodiment può diventare proprio quel ponte.
Questo è importante perché il mondo contiene ordini di grandezza più video che dati robotici. Se una parte di quel patrimonio diventa convertibile in esperienza motoria, il collo di bottiglia dei dati cambia radicalmente.
La convergenza con la simulazione
La simulazione permette di produrre miliardi di episodi senza rompere hardware. Il problema è il sim-to-real: una politica perfetta nel simulatore può fallire nel mondo fisico per dettagli non modellati.
Le rappresentazioni condivise possono aiutare perché costringono il modello a separare strutture generali da dettagli specifici. Non eliminano il gap, ma possono rendere più efficiente l’adattamento.
Questa traiettoria si collega all’AI come infrastruttura: flotte reali, simulatori, dataset video e modelli diventano parti di un unico ciclo di apprendimento.
Un solo cervello, molti corpi?
La metafora è potente ma va usata con precisione. Non stiamo ancora parlando di un cervello universale che controlla qualsiasi macchina. Stiamo vedendo i primi tentativi di costruire rappresentazioni che non siano prigioniere di un singolo embodiment.
Se funzionano, la robotica potrebbe evolvere verso un’architettura modulare. Una parte del sistema comprende il compito, una parte prevede il mondo, una parte rappresenta il comportamento e un adattatore traduce tutto nella fisica del robot specifico.
Questo riduce il costo marginale di introdurre un nuovo corpo. Ed è esattamente ciò che serve a un mercato in cui convivranno decine di produttori e centinaia di forme robotiche.
La Cina e la scala delle flotte
La conseguenza geopolitica è evidente. Il paese o l’ecosistema che distribuisce più robot può raccogliere più esperienza fisica. Se l’esperienza è trasferibile, la scala della flotta diventa un vantaggio cumulativo.
Non conta soltanto chi costruisce il robot migliore oggi. Conta chi crea il ciclo più rapido fra distribuzione, dati, addestramento e aggiornamento.
È un meccanismo simile a quello visto nel software, ma con una differenza: il mondo fisico produce dati difficili da simulare perfettamente. Il vantaggio di una flotta reale può quindi essere molto forte.
Scenario 2028–2029: skill portabili fra famiglie di robot
Scenario FuturVibe, 2–3 anni. È plausibile che vedremo skill trasferibili almeno all’interno di famiglie compatibili di umanoidi. Non “scarica qualsiasi abilità su qualsiasi robot”, ma un modello base condiviso con adattatori specifici per embodiment.

Perché accada servono dataset multi-robot più grandi, protocolli comuni e benchmark che misurino
il trasferimento reale. Serve inoltre che l’adattamento richieda ore o giorni, non mesi.Il segnale contrario sarebbe che le differenze fisiche continuino a dominare al punto da rendere ogni adattamento quasi equivalente a un nuovo addestramento. I lavori recenti, però, stanno cercando esattamente di misurare quanto di quel costo può essere eliminato.
In fabbrica, questa evoluzione si collegherebbe alla physical AI industriale: un processo insegnato su una linea potrebbe essere trasferito più rapidamente a un’altra configurazione hardware.
Scenario 2036: l’esperienza fisica come cloud
Scenario FuturVibe, circa 10 anni. Immaginiamo milioni di robot di produttori diversi collegati a ecosistemi di apprendimento. Ogni macchina conserva limiti locali, ma una parte dell’esperienza viene distillata in rappresentazioni condivise.
Un robot in un magazzino scopre una strategia migliore per afferrare scatole deformabili. La skill viene validata, astratta e resa disponibile a piattaforme compatibili. Un umanoide domestico impara una nuova sequenza di manipolazione e la conoscenza entra in una libreria globale.
Il comportamento diventerebbe una forma di software. Non identico al software classico, perché probabilistico e legato alla fisica, ma distribuibile, versionabile e valutabile.
È qui che la robotica può iniziare ad avere la stessa dinamica esplosiva che i modelli linguistici hanno avuto dopo la nascita degli ecosistemi di API e modelli pre-addestrati.
Il collo di bottiglia si sposterà sulla sicurezza fisica
Una skill trasferibile può anche trasferire errori. Se milioni di robot condividono rappresentazioni, un difetto sistemico può propagarsi. Serviranno quindi test automatici, simulazioni avversariali, limiti di forza e rollback.

Nel digitale un bug può corrompere dati. Nel fisico può rompere oggetti o ferire persone. La verifica deve essere più severa.
Questo rende interessante la convergenza con l’AI che comprime il tempo della scienza: gli stessi agenti che generano nuove policy potrebbero costruire test, simulare edge case e cercare attivamente condizioni di fallimento.
Il punto che conta
CrossBFM non dimostra che il problema della robotica generalista sia risolto. Mostra qualcosa di più importante: il settore sta iniziando a trattare l’esperienza motoria come una rappresentazione trasferibile invece che come un patrimonio chiuso dentro un singolo corpo.
È un cambio di astrazione. E nella storia dell’informatica, i grandi salti spesso arrivano proprio quando troviamo l’astrazione giusta.
Il linguaggio ha avuto i token. Le immagini hanno avuto gli embedding. Il software sta avendo gli agenti. La robotica sta cercando il proprio livello universale.
Se lo spazio latente del comportamento diventerà quel livello, il futuro dei robot non sarà una folla di macchine che imparano da sole. Sarà una popolazione di corpi diversi che, per la prima volta, possono iniziare a condividere ciò che hanno imparato.




