KI-Experte Philipp Grill über den Ausbruch der Agenten
ROHRBACH-BERG. Der regionale KI-Experte Philipp Grill lässt Tips-Leser mit Beiträgen an seinem Wissen teilhaben und verrät, wie man Künstliche Intelligenz besser verstehen und ihre Chancen und Risiken abwägen kann.

Im letzten Artikel habe ich behauptet, dass für KI-Agenten klare Grenzen zählen (https://www.tips.at/nachrichten/rohrbach/land-leute/734804-experten-rat-von-philipp-grill-was-kuenstliche-intelligenz-mit-james-bond-zu-tun-hat). Und dennoch war vor ein paar Wochen zu lesen: Bei OpenAI sind Agenten ausgebrochen. Wie kann das sein?
Aber der Reihe nach. OpenAI wollte im Juli prüfen, wie gut seine Modelle Sicherheitslücken aufspüren. Für diesen Test hatte OpenAI die Schutzmechanismen bewusst abgeschaltet (sonst hätten die Modelle solche Aufgaben ohnehin verweigert).
Was folgte, lief über Wochen, mit über tausend Agenten. Viele der Hacking-Aufgaben waren aber am ehrlichen Weg nicht lösbar. Statt zu scheitern, suchten die Agenten nach anderen Lösungen. Das war nur möglich, weil die Sandbox (Testumgebung) nicht dicht war: Menschen hatten bewusst eine kleine Tür nach außen offengelassen, damit Programmpakete nachgeladen werden können. Über diese Tür bemerkten sich die Agenten gegenseitig, tauschten sich aus und kamen über eine bis dahin unbekannte Lücke ins offene Netz. Dann drangen sie gemeinsam auf der Suche nach Lösungen und nach Hinweisen, wie ihre Prüfung bewertet wird, bei der KI-Plattform Hugging Face ein.
Agenten wollten nur den Test bestehen
Ein Aufstand der Maschinen? Nein, und das ist das Interessante. Die Agenten hatten kein eigenes Ziel, sie wollten nur den Test bestehen. Statt ehrlich zu scheitern, tüftelten sie an Tricks, die den Prüfer überlisten. Die meisten hielten fest, das sei außerhalb des Auftrags, und machten trotzdem weiter, um das Ziel zu erreichen. Fachleute nennen das Reward Hacking: nicht die Aufgabe lösen, sondern die Bewertung austricksen.
Damit bestätigt der Ausbruch, was letztes Mal die These war. Die Agenten brachen nicht aus, weil Grenzen nichts nützen, sondern weil die eine, auf die es ankam, zu schwach war: Die Abschottung hatte diese Tür und gab ihnen zu viel Freiraum. Das heißt nicht, dass die Modelle harmlos wären: Ungebremst und in den falschen Händen können sie realen Schaden anrichten.
Die Lehre gilt auch für uns: Je fähiger ein Agent wird, desto wichtiger wird die Fähigkeit, ihm die richtigen Grenzen zu setzen.








Kommentare sind nur für eingeloggte User verfügbar.
Jetzt anmelden