Guardare un video sembra passivo. Per una macchina è un problema di calcolo. Google ha appena trasformato questo problema in una forma di decisione.
Con la nuova agentic video understanding, Gemini può decidere quali segmenti di un video analizzare più a fondo. Google dichiara riduzioni fino all’88% del consumo di token, fino al 66% dei costi e miglioramenti fino al 7% della qualità in alcuni benchmark.
Dalla percezione continua alla ricerca visiva
Gli esseri umani non osservano ogni dettaglio con la stessa intensità. Se cerchiamo una persona in una stazione, concentriamo l’attenzione su zone plausibili. Gemini applica una strategia analoga al video.
È un passaggio importante per i modelli del mondo: un sistema intelligente non deve soltanto rappresentare il mondo, ma decidere quali osservazioni servono per raggiungere l’obiettivo.
Il video è il nuovo oceano di dati
Telecamere industriali, smartphone, droni, robot e auto producono una quantità enorme di video. Processare tutto continuamente con la massima profondità è troppo costoso.
L’AI video avrà quindi bisogno di selezione. La dinamica è simile agli agenti sempre attivi: lì il sistema decide quando intervenire; qui decide dove guardare.
Il risparmio di token è un problema industriale
Ridurre drasticamente i token può cambiare quali applicazioni diventano economicamente sostenibili. Una fabbrica potrebbe interrogare migliaia di ore di telecamere. Un laboratorio potrebbe cercare eventi rari in archivi scientifici. Un robot potrebbe aumentare il dettaglio percettivo soltanto quando ne ha bisogno.
È la stessa pressione che sta trasformando l’AI in infrastruttura: non basta essere capaci, bisogna essere efficienti.
Il modello diventa investigatore
Una domanda complessa può richiedere più passaggi: identificare un evento, cercarne la causa, seguire un oggetto e confrontare due momenti. Questa è una forma di reasoning applicato alla percezione.
Il rischio: vedere meno può significare perdere l’eccezione
Se il sistema decide che una parte del video non è importante e si sbaglia, può perdere proprio l’informazione decisiva. Questo è critico in medicina, sicurezza e industria.
La qualità non si misura soltanto da quanto poco guarda. Si misura da quanto bene capisce quando non può permettersi di ignorare.
Entro 2–3 anni
Fra il 2028 e il 2029 molti archivi video potrebbero essere trattati come database interrogabili. Non cercheremo più un timestamp: chiederemo “mostrami tutte le volte in cui questa macchina ha vibrato prima di fermarsi”.
Fra dieci anni
Verso il 2036 agenti e robot potrebbero gestire una memoria percettiva distribuita e decidere autonomamente quali sensori interrogare. È una forma concreta di world model incarnato.
L’intelligenza non consiste soltanto nell’avere più informazioni. Consiste nel sapere quali informazioni vale la pena raccogliere. Quando una macchina inizia a scegliere dove posare i propri occhi, la percezione smette di essere un input e diventa una decisione.




