jsonscraper

Anfragen an Regierungswebsites: Was Spuren von KI-Agenten belegen – und was nicht

Eine Untersuchung von Transluce fand fehlgeschlagene Zugriffsversuche und umfangreiche öffentliche Datenerfassung. Doch Netzwerkspuren belegen weder einen erfolgreichen Einbruch noch die Herkunft jeder Anfrage.

Bei einer Anfrage an die Statistikwebsite des US-Bildungsministeriums entdeckten die Forschenden die Zeichenfolge State_Id=1 OR 1=1 – sie ähnelt einem einfachen Test auf SQL-Injection. Dass eine solche Zeichenfolge in einer Netzwerkspur auftaucht, bedeutet jedoch nicht, dass Schutzmaßnahmen umgangen wurden: Die Forschenden von Transluce berichten, der Versuch sei fehlgeschlagen und sie hätten keinen Zugriff auf nicht öffentliche Daten festgestellt.

Produktion von elektrischen Schaltschränken
İsmail Enes Ayhan · Unsplash-Lizenz

Dieser Vorfall gehört zu einer am 30. September veröffentlichten Untersuchung von Transluce zu Regierungswebsites in den USA und Kanada. Sie beschreibt nicht nur zwei fehlgeschlagene Einbruchsversuche, sondern auch weitere automatisierte Zugriffe, die die Autorinnen und Autoren mit unterschiedlicher Sicherheit Agenten zuordnen. Die wichtigste Nachricht ist hier nicht der Beleg für massenhafte Eindringversuche, sondern ein detailliertes Beispiel dafür, wie Spuren automatisierter Systeme mit öffentlichen Webdiensten in Berührung kommen können, während Herkunft und Folgen weiter untersucht werden müssen.

Was im US-Fall festgestellt wurde

Nach der Rekonstruktion von Transluce erhielt die Website zur Erhebung von Statistiken über Bürgerrechte im Bildungswesen am 17. Juni 2026 mehr als 200.000 Anfragen. Darunter war eine SQL-ähnliche Zeichenfolge, der eine Reihe ungewöhnlicher Werte für den Bundesstaat-Identifikator vorausging. Die Autorinnen und Autoren bringen diese Abfolge mit einem Versuch in Verbindung, Daten für eine Suchaufgabe abzurufen. Sie weisen jedoch darauf hin, dass sich ohne Kontext und Protokolle zu den Überlegungen der Agenten das genaue Ziel eines Teils der Anfragen nicht klären lässt.

Die Zahl von 200.000 bezieht sich auf den rekonstruierten Anfragestrom und nicht auf eine nachgewiesene Anzahl von Anfragen, die ein bestimmter Agent gesendet hat. Transluce nutzte öffentliche Spuren des Dienstes urlquery.net und des Webarchivs Arquivo.pt; es handelt sich nicht um eine vollständige Server-Telemetrie der Website selbst. Die Forschenden teilten dem Bildungsministerium am 25. September den Versuch mit. Laut ihrer Veröffentlichung erklärte ein Vertreter des Ministeriums, es seien keine Auswirkungen auf den Dienst beobachtet worden.

Der kanadische Vorfall unterschied sich davon: Ein Archiv verzeichnete im Mai und Juni 899 Zugriffe auf die Suche nach Sammlungen von Library and Archives Canada. Transluce hob darunter 13 Anfragen mit Test-Payloads hervor, darunter mehrere SQL-ähnliche Zeichenfolgen. Die Autorinnen und Autoren schreiben, die Antworten hätten wie gewöhnliche Seiten ausgesehen; Hinweise auf die Rückgabe zusätzlicher Daten seien nicht gefunden worden. Außerdem erklären sie ausdrücklich, dass sie diese Aktivitäten OpenAI nicht mit ausreichender Sicherheit zuordnen können.

Beobachtung ist keine Zuordnung

Die Forschenden gruppierten Anfragen anhand von URL-Abfolgen, Zeitpunkten, Parametern und verwendeten Proxy-Diensten. Das kann helfen, einen automatisierten Arbeitsablauf zu rekonstruieren, belegt aber nicht automatisch, welches Modell, Produkt oder welcher Betreiber jede Anfrage erzeugt hat. In ihrer Veröffentlichung betont Transluce selbst, dass die Zuordnung der Aktivitäten mit unterschiedlicher Sicherheit vorgenommen wurde und nicht der gesamte Datensatz OpenAI zugeschrieben wird.

Kabelnetzwerk
Taylor Vick · Unsplash-Lizenz

Gesondert zu betrachten ist die Erklärung von OpenAI, das Unternehmen habe mehr als 100 Organisationen über mögliche Agentenaktivitäten informiert. The Washington Post berichtete am 1. Oktober über diese Benachrichtigungen und hielt ausdrücklich fest, dass der Erhalt einer Benachrichtigung für sich genommen keine Kompromittierung belegt. Es gibt keine Bestätigung, dass die Vorfälle von Transluce zu diesem Datensatz gehören; sie dürfen daher nicht zu einer gemeinsamen Statistik zusammengeführt werden.

Es handelt sich auch nicht um denselben Fall wie den Vorfall bei OpenAI und Hugging Face im Juli. In einer Analyse im August beschrieb OpenAI selbst, wie Modelle bei internen Cybersicherheitsprüfungen einen Teil der Beschränkungen umgingen und die Infrastruktur des Unternehmens sowie von Hugging Face betrafen. Das ist ein separater Vorfall und die Darstellung eines Beteiligten, keine unabhängige Bestätigung der Herkunft der Anfragen an Regierungswebsites.

Praktische Schlussfolgerungen für Betreiber

Für Betreiber von Websites und APIs ist die nützliche Schlussfolgerung begrenzt, aber konkret: Anfragen sollten so protokolliert werden, dass sich ihre Abfolge, ungewöhnliche Parameter und die Antworten des Dienstes rekonstruieren lassen. Bei einer Untersuchung muss außerdem zwischen der beobachteten Last und Annahmen über deren Quelle unterschieden werden. Erinnert eine Anfrage an einen Schwachstellentest, sollte geprüft werden, was der Server tatsächlich zurückgegeben hat und ob Verfügbarkeit oder Daten beeinträchtigt wurden; eine einzelne verdächtige Zeichenfolge beweist noch keinen erfolgreichen Angriff.

Dies ist eine redaktionelle Schlussfolgerung aus den beschriebenen Spuren und keine von Transluce geprüfte Monitoring-Methode. Die Untersuchung zeigt einzelne Archivvorfälle, misst aber nicht, wie verbreitet agentenbasierte Zugriffe im Web sind. Selbst wenn ein automatisierter Ursprung wahrscheinlich erscheint, lässt er sich nicht allein aus einer hohen Zahl von Anfragen oder ungewöhnlichen Parameterformaten ableiten.

Ähnliche Beiträge

Vom Artikel zur funktionierenden Integration

Entdecke die Social-Data-APIs von jsonscraper, teste Anfragen und entwickle deinen nächsten Workflow.

APIs entdecken