Il sistema StableRep del MIT utilizza immagini sintetiche per l’apprendimento automatico
Un team di ricercatori del MIT CSAIL sta rivoluzionando l’addestramento dell’intelligenza artificiale attraverso l’uso di immagini sintetiche, superando i metodi tradizionali basati su immagini reali. Questo nuovo approccio, che utilizza un sistema chiamato StableRep, offre una comprensione più profonda dei concetti e un addestramento più economico, ma presenta anche sfide come potenziali pregiudizi e la necessità di un addestramento iniziale basato su dati reali.
StableRep: un nuovo approccio
Al centro di questo approccio c’è StableRep, un sistema che non si limita a utilizzare qualsiasi immagine sintetica, ma le genera attraverso modelli di testo-immagine molto popolari come Stable Diffusion. Il segreto di StableRep risiede in una strategia chiamata ”apprendimento contrastivo multi-positivo”.
“Stiamo insegnando al modello a comprendere meglio i concetti di alto livello attraverso il contesto e la varianza, non solo alimentandolo con dati”, spiega Lijie Fan, studente di dottorato al MIT in ingegneria elettrica e ricercatore principale del progetto. “Quando diverse immagini, tutte generate dallo stesso testo, vengono considerate come rappresentazioni della stessa cosa, il modello approfondisce i concetti dietro le immagini, non solo i loro pixel”.
Progressi nell’addestramento dell’IA
StableRep non solo aiuta a mitigare le sfide dell’acquisizione di dati nell’apprendimento automatico, ma segna anche un passo avanti verso una nuova era di tecniche di addestramento dell’IA. La capacità di produrre immagini sintetiche di alta qualità e diversificate su comando potrebbe aiutare a ridurre le spese e le risorse necessarie.
La raccolta di dati non è mai stata un processo semplice. Negli anni ’90, i ricercatori dovevano catturare manualmente le fotografie per creare set di dati per oggetti e volti. Negli anni 2000, le persone cercavano dati su internet. Tuttavia, questi dati grezzi e non curati spesso contenevano discrepanze rispetto alle situazioni reali e riflettevano pregiudizi sociali, presentando una visione distorta della realtà. Il compito di pulire i set di dati attraverso l’intervento umano non solo è costoso, ma anche estremamente impegnativo.
Le principali innovazioni di StableRep
Un aspetto fondamentale del successo di StableRep è l’adattamento della “scala di guida” nel modello generativo, che garantisce un delicato equilibrio tra la diversità e la fedeltà delle immagini sintetiche. Quando ben calibrato, si è scoperto che le immagini sintetiche utilizzate nell’addestramento di questi modelli auto-supervisionati erano altrettanto efficaci, se non di più, delle immagini reali.
Sfide e direzioni future
Tuttavia, il cammino da percorrere non è privo di ostacoli. I ricercatori affrontano apertamente diverse limitazioni, tra cui la lenta generazione di immagini, le incongruenze semantiche tra i prompt di testo e le immagini risultanti, la potenziale amplificazione dei pregiudizi e le complessità nell’attribuzione delle immagini, tutti aspetti fondamentali da affrontare per i futuri progressi. Un altro problema è che StableRep richiede prima l’addestramento del modello generativo su dati reali su larga scala.
Preoccupazioni e prospettive
Sebbene StableRep offra una buona soluzione riducendo la dipendenza da vaste collezioni di immagini reali, solleva preoccupazioni riguardo ai pregiudizi nascosti nei dati non curati utilizzati per questi modelli di testo-immagine. La scelta dei prompt di testo, fondamentale per il processo di sintesi delle immagini, non è del tutto esente da pregiudizi.
“Utilizzando i più recenti modelli di testo-immagine, abbiamo ottenuto un controllo senza precedenti sulla generazione di immagini, consentendo una gamma diversificata di visualizzazioni da un singolo input di testo. Questo supera la raccolta di immagini nel mondo reale in termini di efficienza e versatilità. Si rivela particolarmente utile in compiti specializzati, come l’equilibrio della varietà di immagini nella riconoscimento a coda lunga, presentando un supplemento pratico all’uso di immagini reali per l’addestramento”, afferma Fan.
Opinione degli esperti
“Un sogno dell’apprendimento del modello generativo è da tempo quello di poter generare dati utili per l’addestramento del modello discriminativo”, afferma David Fleet, ricercatore di Google DeepMind e professore di informatica all’Università di Toronto, che non è stato coinvolto nel lavoro. “Questo lavoro fornisce prove convincenti, per la prima volta a mia conoscenza, che il sogno sta diventando realtà. Mostrano che l’apprendimento contrastivo da enormi quantità di dati di immagini sintetiche può produrre rappresentazioni che superano quelle apprese da dati reali su larga scala, con il potenziale di migliorare una miriade di compiti di visione a valle”.
Il team di ricerca, composto da Lijie Fan e Yonglong Tian, presenterà StableRep alla Conferenza 2023 sui Sistemi di Elaborazione delle Informazioni Neurali (NeurIPS) a New Orleans.
Il sistema StableRep del MIT utilizza immagini sintetiche per l’apprendimento automatico