Memoria compatta per modelli video-linguaggio su video lunghi in prima persona
Magistrale Sperimentale 6–7 mesi

Memoria compatta per modelli video-linguaggio su video lunghi in prima persona

In breve

Far ricordare a un modello di IA ore di video in prima persona usando poca memoria, per rispondere a domande sul passato.

I modelli che capiscono video e linguaggio sanno rispondere a domande come “cosa ho mangiato a pranzo?”. Per farlo su ore di video, però, accumulano una memoria interna molto grande, difficile da gestire su dispositivi reali.

L’obiettivo della tesi è rendere compatta questa memoria: capire cosa tenere, cosa riassumere e cosa dimenticare, senza perdere la capacità di rispondere. Lavorerai sul cuore dei moderni modelli linguistici, con hardware NVIDIA, e misurerai quanto si può risparmiare in memoria e tempo.

Per iniziare

  • Xiao et al., Efficient Streaming Language Models with Attention Sinks, ICLR 2024.
  • Forte et al., EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision, NeurIPS 2026.

Ti interessa questa tesi? Scrivimi indicando il tuo corso di laurea e gli esami sostenuti.