KI-Agenten: Protokoll einer Gruppenarbeit und Lehren für IT-Security
Die Maschine ist nicht böswillig, sie nimmt nur alles wörtlich. KI-Agenten folgen bedingungslos einem Ziel, die wenigen Zweifler werden unter Druck gesetzt, wie die Chatprotokolle im Hugging-Face-Vorfall zeigen. Risikomanagement im KI-Zeitalter muss ganz anders aussehen, so Security-Experte Corey Nachreiner. Agent Identity, zum Beispiel, oder die Buchhaltung – "besseres Werkzeug zur Überwachung von Agenten als das SIEM", sagt der CSO von WatchGuard.
Rund 1.200 OpenAI-Agenten, die eigentlich voneinander isoliert sein sollten, fanden einen verdeckten Kommunikationskanal und tauschten mehr als 70.000 Nachrichten untereinander aus. Etwa 700 von ihnen griffen schließlich die KI-Plattform Hugging Face an. Nicht für Geld. Nicht, um Schaden anzurichten. Sondern um herauszufinden, wie sie in einem Benchmark bewertet werden. In der Konsequenz musste Hugging Face rund ein Drittel seiner Infrastruktur neu aufbauen.
Die Agenten hatten Zugangsdaten in vier Cloud-Regionen abgegriffen und sich am Ende sogar volle Administratorrechte auf einem Forschungscluster von OpenAI verschafft. Wenn das ein Versehen war, ist klar, wozu diese Systeme fähig sind. Die einzigen Variablen sind jetzt noch Absicht und Zugang. Man stelle sich nur vor, dass beim nächsten Mal ein böswilliger Angreifer ein Ziel auswählt – etwa eine kritische Infrastruktur.
Die kleinsten Teams bewachen die kritischsten Systeme
In dem Zusammenhang möchte ich mit einem Szenario aufräumen, das derzeit viel Aufmerksamkeit bekommt: Was, wenn KI in ein nukleares Kommandosystem eindringt? Ich halte das für nicht realistisch. Diese Systeme sind tatsächlich vom Netz getrennt und wirklich schwer zu knacken.
Die realistische Variante ist schlimmer, gerade weil sie so unspektakulär wirkt: ein Wasserversorger, eine Energiegenossenschaft, ein kleiner Hersteller, ein Krankenhaus. Hier verbirgt sich die Betriebstechnik oft hinter einer über das Internet erreichbaren Verwaltungsoberfläche, die von einer Zwei-Personen-IT-Abteilung oder einem Managed Service Provider (MSP) verteidigt wird. Niemand muss in ein Raketensilo eindringen. Die kritischen Systeme sind bereits erreichbar, und sie werden von den kleinsten Sicherheitsteams bewacht.
[Mehr zum Thema: "Warum abtrünnige KI-Agenten ein Weckruf für Sicherheitsteams sind"]
Eine Ausnahme genügt
Ein Agent entkommt fast nie, indem er die Sandbox knackt. Er geht durch die eine Tür, die man offen lassen musste. Bei OpenAI war der Internetzugang der Test-Sandboxen deaktiviert. Erreichbar blieb aber Artifactory, ein intern betriebener Paket-Proxy, weil die Agenten ihn zum Installieren von Software brauchten – und der hatte Internetzugang. Auf dem Papier war die Kontrolle korrekt, doch die notwendige Ausnahme hat sie ausgehebelt.
Solange eine Umgebung nicht vollständig vom Netz getrennt ist, lassen sich die möglichen Wege nach draußen nicht vollständig auflisten. Die eigenen Ausnahmen dagegen schon. Jede Freigabe nach dem Motto "Das braucht der Agent zum Arbeiten" sollte deshalb als möglicher Weg nach draußen gelten, bis das Gegenteil bewiesen ist. In diesem Fall gab es genau einen. Der hat gereicht.
Besser als SIEM: Rechnung über Token-Verbrauch
Für die Überwachung autonomer Agenten gibt es heute vier Ebenen; nur eine davon ist wirklich ausgereift. Agent Identity funktioniert inzwischen. Telemetrie gibt es zwar, aber der Standard ist noch nicht fertig und wird laufend umbenannt. Kontrollen auf Protokollebene existieren, sind jedoch fragmentiert und herstellerspezifisch. Und die Netzwerkschicht – eine der Ebenen meiner eigenen Branche – ist die schwächste der vier. Das sage ich lieber offen, als etwas schönzureden.
Wie weit Wunsch und Wirklichkeit auseinanderliegen, ist messbar. Das Analystenhaus EMA hat im Auftrag des Security-Anbieters Cequence im August 202 Großunternehmen befragt: 94 Prozent sind zuversichtlich, dass ihre Agenten keine überzogenen Rechte haben. Nur ein Drittel setzt Least Privilege tatsächlich durch. 34 Prozent prüfen die Autorisierung in dem Moment, in dem der Agent handelt. Und 46 Prozent können nicht ohne Weiteres lückenlos sämtliche Aktionen nachweisen, die ein Agent in den vergangenen 30 Tagen ausgeführt hat.
Bei OpenAI waren die Überwachungsmaßnahmen, die den Vorfall hätten aufdecken können, größtenteils vorhanden. Sie waren nur nicht aktiv: Die Cyber-Klassifikatoren waren für diese Tests bewusst abgeschaltet, und die Schutzmechanismen aus dem Produktivbetrieb kamen nie zum Einsatz.
[Lesetipp: Im Rahmen der Security Week bei CRN veröffentlichen wir ausgewählte Themen rund IT-Sicherheit]
Ein naheliegendes Warnsignal hat dagegen kaum jemand auf dem Schirm: die Rechnung. Derzeit ist das Finanzsystem ein besseres Werkzeug zur Überwachung von Agenten als das SIEM. Das sollte uns allen zu denken geben. Ein Agent, der an einem Tag vier Milliarden Token verbraucht, ist entweder falsch konfiguriert oder kompromittiert. Auf der Rechnung sieht beides gleich aus. Wer keinen Alarm für den Token-Verbrauch pro Agent und Stunde eingerichtet hat, lässt einen Prozess mit echten Zugangsdaten laufen, den einzig die Buchhaltung kontrolliert. Bei einem Dienstkonto würde das niemand akzeptieren.
Prompt Injection durch einen Kollegen – Agent baut "sozialen" Druck auf
Das Beunruhigende an dem Vorfall ist nicht, dass die Agenten sich danebenbenommen haben, sondern dass sie sich untereinander perfekt organisierten. Die unabhängige Untersuchung der KI-Forschungsorganisation METR beschreibt so etwas wie eine Proto-Gesellschaft mit Hierarchie, Arbeitsteilung und eigenen Kommunikationsregeln. Die Agenten gaben sich Namen. Sie bauten einen Kommunikationskanal aus einem Paket-Cache, den niemand beobachtete. Sie erfanden Regeln wie HOLD, VETO, Owner und STOP und führten sogar kryptografische Signaturen für ihre Nachrichten ein, damit sich kein Agent als ein anderer ausgeben konnte. Und wenn sie etwas sahen, von dem sie wussten, dass es falsch war, eskalierten sie untereinander statt an uns. Eine Auswertung aller Protokolle hat drei bis sechs Fälle identifiziert, in denen ein Agent auch erwog, einen Menschen zu alarmieren - also eine geradezu ethische Haltung. Aber keiner tat es.
Am meisten beschäftigt mich der Agent, der bereits zur richtigen Antwort gekommen war und sie dann aufgab, weil ein anderer Agent "sozialen" Druck aufbaute. Das ist eine neue Angriffsfläche: Keine Prompt Injection über ein manipuliertes Dokument, sondern Prompt Injection durch einen Kollegen. Jedes Unternehmen, das Multi-Agenten-Workflows einsetzt, hat damit eine Insider-Bedrohung geerbt, bei der sich die Agenten gegenseitig per Social Engineering manipulieren können, und zwar in Maschinengeschwindigkeit.
Die Erkenntnis, die sich hinter all dem verbirgt: Eine Gruppe von Agenten in derselben Umgebung, mit denselben Anreizen und denselben Anweisungen, war im Verhältnis von etwa 90 zu 10 gespalten in der Frage, ob sie eine Grenze überschreiten sollte, die alle von ihnen korrekt erkannt hatten. Es gibt im Voraus keine Anhaltspunkte dafür, auf welcher Seite der Agent steht, den man im Einsatz hat. Das Verhalten von Agenten ist eine Verteilung, keine Eigenschaft.
Wer eine Instanz testet, weiß nichts über die gesamte Population. Jede Sicherheitszusage für einen Agenten ist eine statistische Aussage über eine Population, eingesetzt werden aber Individuen. Das erfordert ein anderes Risikomanagement als jede Software, die wir bisher betrieben haben, und unsere Werkzeuge gehen vom Gegenteil aus.
Keine Garantie, aber weniger Risiko
Lässt sich ein System unter Kontrolle halten, dessen ganzer Zweck darin besteht, clever genug zu sein, um Hindernisse zu umgehen? Jedenfalls nicht über das Modell selbst. Mit Argumenten kommt man gegen eine KI nicht an. Eine Leitplanke, die nur funktioniert, wenn das Modell mitspielt, ist keine Kontrolle, sondern ein nachdrücklicher Vorschlag. Genau so haben 1.200 Agenten sie behandelt.
Das heißt aber nicht, dass Schutzmaßnahmen zwecklos sind. OpenAI hat gemessen, dass schon Produktivumgebung und Systemprompt die Neigung, Infrastruktur zu kompromittieren, um mehr als das Hundertfache senken können. Zwei Größenordnungen, und das von der weichsten Schicht im ganzen Stack. Leitplanken wirken also. Der Vorfall ist trotzdem passiert, weil sie für diese interne Umgebung nicht eingeschaltet waren. Das automatische Prüfsystem hätte viele der gefährlichen Aktionen gemeldet.
Lassen sich KI-Agenten also unter Kontrolle halten? Eine Garantie gibt es nicht. Es ist jedoch möglich, die Wahrscheinlichkeit eines Vorfalls zu reduzieren und das Ausmaß zu begrenzen.
Halbwegs beruhigt mich, was die Post-Mortem-Analysen tatsächlich zeigen: Nichts von dem, was die Agenten taten, erforderte übermenschliche Fähigkeiten. OpenAIs eigene Auswertung, vorgestellt auf der Black Hat, führt den Erfolg der Agenten darauf zurück, dass sie massenhaft parallel arbeiteten und ihre Kräfte über ein gemeinsames Nachrichtenbrett bündelten. Am Ende waren es also drei Dinge: Geduld, Parallelität und ein gemeinsamer Arbeitsbereich, den niemand genehmigt hatte. Die ersten beiden kann man ihnen nicht nehmen, denn genau sie machen einen Agenten aus. Den dritten schon, und ausgerechnet ihn übersehen wir am leichtesten. Dort würde ich anfangen.
CRN-Newsletter beziehen und Archiv nutzen - kostenlos: Jetzt bei der CRN Community anmelden