Lo studio è stato svolto dall’UCL Computer Science
Secondo uno studio dell’Università di Londra pubblicato su PLOS ONE, gli esseri umani non sono capaci a rilevare più di un quarto di campioni di parlato deepfake speech ovvero delle riproduzioni vocali create dall’intelligenza artificiale.
Questa ricerca è la prima ad esaminare l’abilità umana di individuare il parlato generato in maniera artificiale in una lingua differente dall’inglese.
Cosa sono i deepfakes?
I deepfakes sono dei mezzi di comunicazione sintetici che somigliano alla voce o all’aspetto di una persona reale. Fanno parte della categoria dell’intelligenza artificiale generativa, che è una tipologia di apprendimento automatico che prepara un algoritmo ad apprendere gli schemi e le caratteristiche di una serie di dati: ad esempio l’audio o il video di una persona reale, così da riprodurne il suono o le immagini originali.
I primissimi algoritmi di deepfake avevano bisogno in molti casi di migliaia di campioni della voce di una persona al fine di poter procedere alla ricreazione di un audio simile a quello originale. I più recenti invece possono riprodurre la voce di una persona usando soltanto una clip di tre secondi in cui questa parla.
Gli algoritmi open source sono disponibili gratuitamente ed è possibile addestrarli in poco tempo. Apple ha di recente annunciato un software per iPhone e iPad che permette all’utente di creare una copia della propria voce usando 15 minuti di registrazioni.
L’esperimento
I ricercatori dell’Università di Londra hanno usato un algoritmo text to speech che è addestrato su due serie di dati disponibili pubblicamente, uno in inglese e uno in mandarino, per procedere alla generazione di 50 campioni di voce finta in ogni lingua. Questi erano differenti da quelli utilizzati per l’addestramento dell’algoritmo per fare in modo che evitasse di riprodurre l’input originale.
I campioni artificiali e quelli autentici sono stati fatti ascoltare a 529 partecipanti per comprendere la capacità di riconoscere il discorso vero da quello falso. Soltanto nel 73% dei casi i soggetti hanno riconosciuto il discorso falso.
«I nostri risultati confermano che gli esseri umani non sono in grado di rilevare in modo affidabile il deepfake speech, indipendentemente dal fatto che abbiano ricevuto o meno una formazione che li aiuti a individuare i contenuti artificiali», ha dichiarato Kimberly Mai, dell’UCL Computer Science.
di: Alice GEMMA
FOTO: SHUTTERSTOCK