
Magistrale
Sperimentale
6–7 mesi
Memoria compatta per modelli video-linguaggio su video lunghi in prima persona
In breve
Far ricordare a un modello di IA ore di video in prima persona usando poca memoria, per rispondere a domande sul passato.
I modelli che capiscono video e linguaggio sanno rispondere a domande come “cosa ho mangiato a pranzo?”. Per farlo su ore di video, però, accumulano una memoria interna molto grande, difficile da gestire su dispositivi reali.
L’obiettivo della tesi è rendere compatta questa memoria: capire cosa tenere, cosa riassumere e cosa dimenticare, senza perdere la capacità di rispondere. Lavorerai sul cuore dei moderni modelli linguistici, con hardware NVIDIA, e misurerai quanto si può risparmiare in memoria e tempo.
Per iniziare
- Xiao et al., Efficient Streaming Language Models with Attention Sinks, ICLR 2024.
- Forte et al., EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision, NeurIPS 2026.
Ti interessa questa tesi? Scrivimi indicando il tuo corso di laurea e gli esami sostenuti.