
Riconoscimento online dei passi di attività nuove a partire da pochi esempi
In breve
Riconoscere in tempo reale, dal video degli occhiali, a che passo di un'attività si trova l'utente, anche per attività viste con pochissimi esempi.
Gli occhiali smart possono guidarci mentre prepariamo un caffè o ripariamo una stampante. Per farlo devono capire istante per istante a che punto siamo della procedura, guardando solo ciò che è già successo, senza poter aspettare la fine del video. I sistemi attuali ci riescono bene solo per le attività su cui sono stati addestrati con molti esempi annotati. Per ogni attività nuova bisogna raccogliere e annotare altri dati, un lavoro lungo e costoso.
L’obiettivo della tesi è costruire un sistema che riconosce in tempo reale i passi di un’attività dal video in prima persona e che impara attività nuove a partire da pochissimi esempi. Si parte da un metodo di riconoscimento online esistente, su dataset pubblici di video in prima persona. Lo si estende perché si adatti a nuove attività con pochi esempi e si misura quanto resta accurato e reattivo.
Per iniziare
- An et al., MiniROAD: Minimal RNN Framework for Online Action Detection, ICCV 2023.
- Song et al., Ego4D Goal-Step: Toward Hierarchical Understanding of Procedural Activities, NeurIPS 2023.
Ti interessa questa tesi? Scrivimi indicando il tuo corso di laurea e gli esami sostenuti.