I creatori di strumenti online focalizzati su Discord stanno pubblicizzando un servizio che afferma di aver raccolto 1,8 miliardi di messaggi da 35 milioni di utenti su 6.000 server. Il presunto archivio di dati include anche 207 milioni di sessioni vocali, profili utente e file, sollevando serie preoccupazioni per la privacy. Ciò avviene meno di due anni dopo che Discord ha chiuso un servizio simile, Spy.Pet, per violazione dei suoi termini di servizio.
Il nuovo servizio, pubblicizzato su un popolare forum di fughe di dati, afferma di offrire agli abbonati paganti la possibilità di cercare tra miliardi di record. I ricercatori di Cybernews, che hanno inizialmente segnalato il servizio, avvertono che tale accesso potrebbe essere utilizzato per molestie mirate, doxxing e altre attività dannose.
Secondo la pubblicità, il servizio indicizza 1,8 miliardi di messaggi da 35 milioni di utenti. Ma i dati vanno oltre il testo: includono metadati di sessioni vocali da 207 milioni di chiamate, informazioni del profilo utente e file caricati sui server. Il team di ricerca di Cybernews nota che, sebbene sia impossibile verificare la piena portata senza abbonarsi al servizio (cosa che sconsigliano), l'affermazione di indicizzazione in tempo reale suggerisce una raccolta continua di dati.
Questa portata supera la precedente operazione Spy.Pet, che ha raccolto messaggi pubblici da 620 milioni di utenti. Il nuovo servizio integra anche dati da database violati e server FiveM, espandendo la sua portata oltre Discord.
Lo scraping dei messaggi di Discord si basa generalmente su strumenti di automazione o selfbot (account utente automatizzati) che estraggono dati dai canali a cui il bot può accedere. I server pubblici di Discord sono particolarmente vulnerabili, poiché i loro messaggi sono visibili a qualsiasi membro. Strumenti di scraping commerciali, come quelli disponibili su piattaforme come Apify, offrono guide passo-passo per ottenere token Discord ed esportare cronologie dei messaggi. Sebbene questi strumenti abbiano usi legittimi (analisi della comunità, archiviazione o backup), possono essere facilmente armati da attori malintenzionati.
I termini e le condizioni del servizio affermano che è gestito dall'Estonia, un membro dell'UE con una rigorosa applicazione del GDPR. Tuttavia, gli stessi ToS indicano che i dati raccolti sono archiviati su server situati in Russia. Ciò crea una scappatoia giurisdizionale: pur dichiarando la conformità con le leggi sulla privacy dell'UE, il repository di dati potrebbe essere effettivamente al di fuori della portata dell'UE.
"Il servizio è probabilmente creato per facilitare le molestie online", ha spiegato il team di Cybernews. La strategia a doppia posizione potrebbe aiutare gli operatori a evitare conseguenze legali monetizzando i dati in due modi: addebitando agli utenti l'accesso ai messaggi e addebitando alle vittime l'esclusione dei propri dati.
Il modello di business del servizio sembra progettato per sfruttare sia la domanda di sorveglianza che la disperazione per la privacy. I ricercatori notano che questo rispecchia il modello Spy.Pet, che offriva anche una "opzione enterprise" per l'addestramento dell'IA, includendo presumibilmente l'interesse di agenzie federali. Addebitando sia l'accesso che l'omissione, gli operatori possono trarre profitto dalla stessa violazione che creano.
All'inizio del 2024, Discord ha bannato account e bot collegati a Spy.Pet, interrompendo di fatto la sua fornitura di dati. I termini di servizio di Discord vietano esplicitamente lo scraping e l'azienda ha dichiarato di intraprendere azioni esecutive contro i trasgressori. Tuttavia, l'emergere di un servizio simile suggerisce che le misure sono insufficienti.
Il nuovo servizio afferma di avere "più integrazione con database violati e server FiveM", indicando un'evoluzione nell'aggregazione dei dati. FiveM, un popolare mod multiplayer di Grand Theft Auto, ospita spesso grandi comunità con server Discord. Combinando i dati di Discord con violazioni esterne, il servizio costruisce un profilo più ricco degli utenti, aumentando il suo valore per molestie o furto d'identità.
Per gli utenti comuni, l'esistenza di un tale servizio significa che qualsiasi cosa pubblicata nei server pubblici di Discord potrebbe essere archiviata, ricercabile e accessibile a chiunque sia disposto a pagare. Anche i server privati non sono immuni se un membro esegue un bot scraper. Le sessioni vocali, sebbene più difficili da registrare, sono ora anch'esse prese di mira.
Il rischio non è ipotetico: all'inizio di quest'anno, un gruppo ha affermato di aver raccolto oltre 348 milioni di messaggi da quasi 1.000 server pubblici di Discord. Con strumenti sempre più sofisticati e accessibili, la barriera all'ingresso per lo scraping su larga scala si sta abbassando. I community manager e gli amministratori dei server dovrebbero adottare misure proattive per limitare l'esposizione, come limitare la visibilità della cronologia dei messaggi e monitorare i bot non autorizzati.
Discord non ha ancora commentato pubblicamente questo servizio specifico, ma il modello suggerisce un continuo gioco del gatto e del topo. Mentre un'operazione di scraping viene chiusa, ne emerge un'altra, spesso con più funzionalità e migliori tecniche di elusione. La corsa agli armamenti tra sicurezza della piattaforma e raccoglitori di dati non mostra segni di rallentamento.