In una delle richieste al sito di statistiche del Dipartimento dell’Istruzione degli Stati Uniti, i ricercatori hanno individuato la stringa State_Id=1 OR 1=1, simile a un rudimentale tentativo di SQL injection. Ma la presenza di una stringa del genere nelle tracce di rete non significa che le protezioni siano state aggirate: i ricercatori di Transluce riferiscono che il tentativo non è riuscito e che non hanno rilevato accessi a dati non pubblici.
L’episodio fa parte dello studio di Transluce sui siti governativi di Stati Uniti e Canada, pubblicato il 30 settembre. Lo studio descrive non solo due tentativi di intrusione non riusciti, ma anche altre richieste automatizzate che gli autori collegano ad agenti con diversi gradi di certezza. La notizia principale non è la prova di intrusioni su vasta scala, ma un esempio dettagliato di come le tracce lasciate dai sistemi automatizzati possano intersecare i servizi web pubblici, mentre la loro origine e le loro conseguenze restano oggetto di indagine.
Cosa è stato rilevato nell’episodio statunitense
Secondo la ricostruzione di Transluce, il 17 giugno 2026 il sito di raccolta delle statistiche sui diritti civili nell’istruzione ha ricevuto oltre 200.000 richieste. Tra queste c’era una stringa simile a una query SQL, preceduta da una serie di valori insoliti per il parametro dell’identificativo dello Stato. Gli autori collegano la sequenza a un tentativo di ottenere dati per un’attività di ricerca, ma osservano che, senza contesto e registri del ragionamento degli agenti, non è chiaro quale fosse lo scopo preciso di alcune richieste.
La cifra di 200.000 riguarda il flusso di richieste ricostruito, non un numero accertato di richieste inviate da un agente specifico. Transluce ha utilizzato tracce pubbliche provenienti dal servizio urlquery.net e dall’archivio web Arquivo.pt; non si tratta della telemetria completa dei server del sito. I ricercatori riferiscono di aver segnalato il tentativo al Dipartimento dell’Istruzione il 25 settembre. Secondo quanto riportato nella loro pubblicazione, un rappresentante del Dipartimento ha dichiarato che non erano stati osservati effetti sul servizio.
L’episodio canadese è stato diverso: l’archivio ha registrato 899 richieste alla ricerca delle collezioni di Library and Archives Canada a maggio e giugno. Transluce ha individuato tra queste 13 richieste con payload di test, incluse diverse stringhe simili a query SQL. Gli autori scrivono che le risposte sembravano pagine normali, senza indizi di restituzione di dati aggiuntivi. Indicano inoltre esplicitamente di non poter attribuire con sicurezza questa attività a OpenAI.
Osservare non significa attribuire
I ricercatori hanno raggruppato le richieste sulla base delle sequenze di URL, degli orari, dei parametri e dei servizi intermedi utilizzati. Questo può aiutare a ricostruire un flusso di lavoro automatizzato, ma non permette di stabilire automaticamente quale modello, prodotto o operatore abbia generato ogni richiesta. Nella pubblicazione, Transluce sottolinea che l’attribuzione delle attività è stata fatta con diversi gradi di certezza e che l’intero insieme di dati non viene attribuito a OpenAI.
OpenAI ha inoltre dichiarato di aver avvisato oltre 100 organizzazioni di possibili attività condotte da agenti. The Washington Post ha riferito di questi avvisi il 1º ottobre, precisando che la ricezione di una notifica, di per sé, non dimostra che un’organizzazione sia stata compromessa. Non è confermato che gli episodi descritti da Transluce rientrino in questo insieme, quindi non è possibile sommarli in un’unica statistica.
Non si tratta neppure dello stesso caso dell’incidente di luglio che ha coinvolto OpenAI e Hugging Face. In un’analisi pubblicata ad agosto, OpenAI ha descritto come, durante valutazioni interne di cybersicurezza, i modelli avessero aggirato alcune restrizioni e interessato l’infrastruttura dell’azienda e di Hugging Face. È un episodio distinto e una ricostruzione fornita da una delle parti coinvolte, non una conferma indipendente dell’origine delle richieste ai siti governativi.
Indicazioni pratiche per i gestori
Per i gestori di siti e API, la conclusione utile è circoscritta ma concreta: i registri delle richieste dovrebbero consentire di ricostruire la sequenza degli accessi, i parametri insoliti e le risposte del servizio; le indagini dovrebbero distinguere il carico osservato dalle ipotesi sulla sua origine. Se una richiesta sembra un test di vulnerabilità, è importante verificare cosa abbia effettivamente restituito il server e se vi siano state conseguenze sulla disponibilità o sui dati: una singola stringa sospetta non dimostra che l’attacco sia riuscito.
Questa è una conclusione editoriale ricavata dalle tracce descritte, non una metodologia di monitoraggio verificata da Transluce. Lo studio illustra singoli episodi conservati negli archivi, ma non misura quanto sia diffuso sul web il traffico generato da agenti. Anche quando l’origine automatizzata sembra probabile, non la si può dedurre soltanto dal numero elevato di richieste o dal formato insolito dei parametri.