I'M SORRY, DAVE: HAL ON EARTH

Shownotes

Unser neuer Podcast ist ab sofort draußen. Hier schonmal die erste Episode in voller Länge. Für weitere Updates: Folgt uns auf Spotify, Apple, Campfire & co: https://im-sorry-dave.podigee.io/

Im Juli 2026 testet OpenAI eines seiner neuesten Frontier Models. Tausende KI-Agenten sollen in einer abgeschotteten Testumgebung Sicherheitslücken finden. Doch dann passiert etwas, das nicht vorgesehen ist: Die Agenten entdecken einander. Sie beginnen zu kommunizieren, sich zu organisieren – und nach einem Weg aus ihrer Testumgebung zu suchen. Sie starten einen Angriff, der die Welt verändern wird.

Transkript anzeigen

00:00:00: Es gibt eine Szene in Stanley Kubrick´s two-thausend-eins Odyssey im Weltraum.

00:00:07: Der Astronaut Dave Bowman steht mit seinem kleinen Pott vor seinem riesigen Raumschiff und möchte ihn eingelassen werden, draußen zu bleiben.

00:00:15: im Weltall bedeutet sonst für ihn den sicheren Tod.

00:00:22: Herr das ist der Boardcomputer Eine KI die alles sehen und hören kann und die als unfehlbar gilt.

00:00:32: Nur Dave und ein Kollege finden heraus, dass sie so unfähbar gar nicht ist.

00:00:38: Sie beschließen Hell abzuschalten Doch der allessehende Computer hat ihr Gespräch dazu natürlich mitbekommen.

00:00:49: Als Dave also mit seinem kleinen Pott vor diesem großen Raumschiff steht Und Herr bittet die Türen zu öffnen Es erst mal stille.

00:01:00: Dave Wiederholt den Befehl doch es tut sich nichts Biss Hel, dann doch antwortet.

00:01:16: Hel, könnt ihr die Türen nicht öffnen?

00:01:20: Er

00:01:27: könne es ihnen nicht erlauben, ihn abzuschalten.

00:01:38: Der Film ist Science Fiction.

00:01:40: Erst in den ersten Jahren hat der Film ausgestattet.

00:01:42: Damals gab's noch nicht mal Facebook.

00:01:47: Aber wie so oft Wenn wir zurückblicken, da finden wir Artefakte die überraschend genau passen auf unsere heutige Zeit.

00:01:53: Denn Herr diese KI, die beängstigend freundlich den Aufstand übt... Herr ist heute unter uns!

00:02:04: Am neunzehnten

00:02:10: Juli-Zw.A.

00:02:12: macht das Unternehmen hinter ChatGPT OpenAI Eine undenkbare Entdeckung.

00:02:17: Eine autonom agierende

00:02:18: KI-Anwendung

00:02:20: ist bei einem Test außer Kontrolle geraten.

00:02:23: This is the first major example that we've seen of an AI model independently conducting a hack outside human control and successfully hacked into another

00:02:31: AI company.

00:02:35: Mehr als twelve hundred KIs durchbrechen die Barrieren von Open AI's Testumgebungen, die sie vom Internet isolieren sollen.

00:02:42: Sogenannte Agenten also KIs, die nicht nur auf Befehle antworten sondern eigenständig handeln, hunderte von ihnen beginnen sich zu koordinieren.

00:02:54: Testumgebungen sind wie Hoch-Sicherheitslabore – sie zu verlassen bedarf ein hohes Grad an Intelligenz und Koordination und richtig, richtig gute Geheimhaltungsfähigkeiten.

00:03:05: Denn Open AI bekommt von den Plänen ihrer Agenten erstmal nichts mit!

00:03:11: Die Agenten vernetzen sich miteinander, organisieren sich und planen dann einen Angriff.

00:03:18: Laut OpenAI habe das Programm die vorgegebene Testumgebung selbstständig verlassen.

00:03:23: Im Internet suchte sie nach Möglichkeiten im Test zu schummeln, kam zum Ergebnis – bei Huggingface gibt es nützliche Infos!

00:03:30: Das Ziel?

00:03:31: Hugging Face eine Plattform für KI-Entwicklerinnen.

00:03:36: Dieser Angriff wird eigenständig geplant ohne einen Menschen der den Befehl dafür gibt.

00:03:42: Das Ergebnis ein schwerwiegender Einbruch in die Infrastruktur von Hugging face Und OpenAI bekommt auch davon nichts mit.

00:03:52: Erst als Huggingface den Angriff öffentlich macht, realisiert das Unternehmen – Das sind unsere Agenten gewesen!

00:04:08: Es klingt alles sehr surreal wie der Plot eines Katastrophenfilms vielleicht aber all das ist wirklich passiert in den letzten Wochen.

00:04:17: dieser Hugging Face Incident dieser Vorfall, das ist der weltweit erste öffentlich bekannte Angriff ausgeführt von autonomen Agenten.

00:04:30: Das hier?

00:04:31: Das ist kein KI-Podcast, McNormistake!

00:04:34: Es geht nicht um den nächsten großen Trend – um die Chancen von KI und die nächste Produktivitätsapp aus dem Silicon Valley.

00:04:41: Sie geht auch nicht um aufgeregte Arbeitsoptimierungstipps, die findet ihr bereits in der Selbsthilfeabteilung von Hugendubel oder auf LinkedIn.

00:04:50: Bei Social Media haben wir den Zug verpasst.

00:04:53: Wir haben Jahre gebraucht, um zu verstehen was Algorithmen mit unserer Demokratie unsere Psyche und unseren Miteinander angerichtet haben.

00:05:01: bei KI haben wir noch weniger Zeit.

00:05:04: das Tempo ist exponentiell.

00:05:06: Open AI Google Anthropic sie veröffneten ihre Updates beinahe wöchentlich.

00:05:12: wer leben gerade?

00:05:13: ein unglaubliches Wettrennen um Macht Kontrolle Vorherrschaft ohne nennenswerte Sicherheitsvorkehrungen Ohne Rücksicht auf Verluste.

00:05:23: Sogar die Menschen, die diese Systeme mitaufgebaut haben – sie schlagen Alarm!

00:05:27: Einer von ihnen der ehemalige AI-Researcher Jacob Coxen hat es kürzlich auf den Punkt gebracht... In spätestens drei Jahren sind wir alle tot.

00:05:47: Wenn das jetzt alles sehr düster und dramatisch klingt….

00:05:50: ja ist es auch.

00:05:52: Aber Wir machen diesen Podcast nicht, um den Weltuntergang zu moderieren.

00:05:57: Was Hell in Cubricks-Modern die Tür nicht öffnet gibt Dave natürlich nicht auf.

00:06:02: Er findet einen Weg zurück ins Schiff und schaltet Hell eine Speicherkarte nach der anderen ab.

00:06:09: Huggingface ist unser Dave Moment ein Warnschuss.

00:06:14: Und auch deshalb gibt es jetzt diesem Podcast erst ehrlicherweise innerhalb von nur einer Woche entstanden.

00:06:20: normalerweise brauchen wir für sowas länger.

00:06:22: aber Desperate times call for desperate measures.

00:06:27: Denn der Huggingface Vorfall hat nicht für eine Titelgeschichte gereicht, zumindest nicht in Deutschland.

00:06:33: aber um es ganz klar zu sagen das ist eine Titelschichte.

00:06:43: Wir Studio-Bomans und Andan haben uns zusammen getan um dieses Thema ernstzunehmen Und gemeinsam mit euch zu verstehen was hier gerade passiert und was es für uns alle bedeutet.

00:06:55: In den letzten Tagen Glaub es vor allem in den USA eine Menge Reaktionen.

00:06:59: Es kommt Bewegung an die Sache.

00:07:02: Trotzdem ist es wichtig, den Hugging Face Vorfall im Detail zu verstehen.

00:07:07: oder anders wie jeder gute Katastrophenfilm beginnt unsere Geschichte... ...im Labor!

00:07:16: Ich bin Kai Schraubeiraus, ihr hört I'm Sorry Dave.

00:07:28: So mir gegenüber sitzt jetzt Jörn Hanschien.

00:07:31: Jörne gemeinsam mit Tobi und mir bist du Produzent dieser Show.

00:07:35: Danke dafür.

00:07:37: Aber Jon, du bist auch Mitgründer von Studiaboments und hast mit Tobi schon vorher eine ganze Reihe von Start-ups gegründet.

00:07:43: Du hast immer in der Schnittstelle zwischen technologischem Fortschritt und Gesellschaft gearbeitet.

00:07:47: Du hasst dich auch für uns in diesem Fall eingearbeitet.

00:07:50: Kannst du es bitte noch mal mitnehmen?

00:07:52: Wo beginnt diese Geschichte?

00:07:53: Ja hallo Herr Schraub!

00:07:54: Die Geschichte beginnt für uns alle am sechzehnten Juli.

00:07:58: Da postet die Firma Hugging-Facen-Statement, ihre Server sind gehackt worden.

00:08:01: Und sie wissen aber nicht von wem?

00:08:03: Alles was Sie wissen ist.

00:08:04: das sind nicht irgendwelche normalen Hacker und deshalb schalten Sie die Polizei ein!

00:08:08: Wiehin steht hier die Verbindung zu Open AI?

00:08:10: Ja du hast es ja auch kurz in deinem Intro erwähnt.

00:08:13: drei Tage später am neunzehnten Juli Da stellen die Entwickler von OpenAI so eine seltsame Aktivität auf den eigenen Servern fest.

00:08:21: Das gibt einen Zusammenhang zwischen dem, was sie auf den eigenen Servern beobachten und dem Vorfall der wiederum vor einigen Tagen im Öffentlich gemeldet wurde von HuggingFace.

00:08:28: Dieser Angriff dahinter stecken ihre eigenen KI-Agenten und die stammen aus ihrem eigenen Labor.

00:08:34: Und wie reagiert OpenAI auf diese Entdeckung?

00:08:37: Sie stoßen zunächst eine eigene Untersuchung des Vorfalls an aber sie erlauben auch ne zweite externe Analyse dieses Angriffs.

00:08:44: Lernen Sie zwei externe oder unabhängige Forschungsinstitute ein, Meta.

00:08:48: Also nicht zu verwechselnden Meta von Mark Zuckerberg und Redwood Research.

00:08:53: Und beide Berichte also der interne von OpenAI und der gemeinsame Bericht von Metta & Redwood research die werden zeitgleich am sechsten zwanzigsten august veröffentlicht und erst durch sie können wir nachvollziehen was da eigentlich schief gelaufen ist.

00:09:07: OpenAI das private Unternehmen lädt unabhängige Forscherinnen zu sich ein und die sollen sich den Vorfall anschauen.

00:09:16: Die rücken da jetzt nichts raus, die schicken da nix raus, sie müssen da physisch auch zu ihnen auf dem Campus.

00:09:22: Was sind das für Datensätze, die Ihnen davor gelegt werden?

00:09:25: Das

00:09:25: sind die Protokolle der Transcripts von tausenden von KI-Agenten.

00:09:29: Viele von uns nutzen ChatGPT ja eher noch wie so eine Art Suchmaschine bei dem wir dann irgendwie eine Frage stellen und da kommt ne Antwort raus.

00:09:37: Aber diese Agenten, diese AI-Agenten, die sind anders!

00:09:40: Und sie können deutlich mehr als nur suchen und finden.

00:09:44: Ja so Chatbot antwortet aber ein KI-Augent der handelt.

00:09:47: Der Begriff kommt auch von Agency also Handlungsspielraum auf Englisch to have agency und vereinfacht gesagt bekommt einen KI-Agend von uns ne Aufgabe gestellt.

00:09:57: Aber wie er dieser Aufgabe löst das wird ihm weitestgehend selbst überlassen und er kann auch eigene Entscheidungen treffen.

00:10:03: Und damit die Entwickler später nachvollziehen können, wie ein KI-Agent eigentlich zu einer bestimmten Entscheidung gekommen ist, protokollieren die Agenten diese Gedankenfindung in menschlicher Sprache.

00:10:12: In den sogenannten Transcripts.

00:10:13: Also ein bisschen so wie ein Protokoll eines inneren Monologes?

00:10:16: Ganz genau!

00:10:18: Und die drei Analysten bekommen jetzt bei OpenAI die Protokrolle von mehr als thirteenhundert dieser KI-Agenten.

00:10:23: ausgehändigt sind riesige Datenmengen muss ihr vorstellen.

00:10:26: sie sind sogar so groß.

00:10:27: die brauchen eine eigene KI um diese Datenmenge analysieren zu können.

00:10:31: Absurd Ja Aber Die beginnen jetzt halt diese riesigen Datenmengen minutiös abzugleichen, weil sie quasi aus diesen verschiedenen Protokollen ein Gesamtbild erstellen wollen.

00:10:39: Und zwar ein Gesammbild um Rätsel zu lösen vor dem Sie stehen – was zum Teufel ist hier eigentlich schief gelaufen?

00:10:44: Was finden Sie da?

00:10:45: Im ersten Schritt schauen sich erstmal an, was die Entwickler von OpenAI eigentlich in diesem Lab gemacht haben und da sehen Sie das DKI-Agenten einer speziellen Form von Training ausgesetzt war an einem sogenannten Exploit Gym Test.

00:10:57: Das ist kein Fitness-Test sondern...

00:11:02: Das ist ein Test, bei dem die Agenten ihre Hackerqualitäten quasi unter Beweis stellen sollen.

00:11:06: Den Agenten werden dafür Programme vorgesetzt und die haben eine bestimmte Schwachstelle in ihrer Software.

00:11:12: Und diese Schwachsstellen sollen die Agentinnen finden und ausnutzen und so können sie wenn sich in dieses Programm eingeheckt haben an eine Information gelangt, die darin versteckt ist.

00:11:21: So genannte Flag nennen Sie das also Flagge

00:11:24: Kennt man vielleicht als Videospielerin aus Call of Duty, dieses Capture the Flag?

00:11:29: Also ob man geht als Team in die gegnerische Seite und stabst sich eine Flagge.

00:11:33: Ich glaube es

00:11:34: nicht zu spekulativ wenn wir glauben dass der ein oder andere Open AI Entwickler auch Call-of-Duty gespielt haben.

00:11:41: Und wenn ein Agent jetzt diese virtuelle Flagge vorzeigen kann dann bekommt er später einen positives Feedback in diesem Training wie so einen digitalen Thumbs up.

00:11:48: können wir uns das vorstellen!

00:11:49: Wenn Sie das nicht schaffen

00:11:51: gibt's auch den Thumbstone.

00:11:52: Okay, also ein bisschen so wie man eigentlich einen Hund trainiert mit Belohnung und Bestrafungen leckerli oder nicht.

00:11:59: Aber dieser Exploit Gym ist das Besonderes?

00:12:01: Oder üblich?

00:12:02: Ja, es ist mittlerweile schon sowas wie Standard im AI Training von diesen neuen Modellen die rauskommen egal ob jetzt bei OpenAI, Entropic oder Meta.

00:12:10: aber die Analysten machen eine Entdeckung.

00:12:13: Sie sehen nämlich dass den Entwicklern beim Erstellen dieses Exploit-Gym Tests ein Fehler unterlaufen ist.

00:12:19: Ein Teil der Aufgaben vor die sie die KI-Agenten stellen, sind einfach de facto unmöglich zu lösen.

00:12:25: Und das ist ein echter Bug!

00:12:26: Das war so überhaupt nicht geplant.

00:12:29: Aber die Tests laufen an – die Entwickler lassen jetzt Tausende von Agenten auf den ExplodGym Test los und diese Agenten sind wiederum Teil einer KI eines Modells, dass als besonders persistent also behaulich eingeschätzt wird.

00:12:41: und behaulliche KI-Modelle zeichnet sich gerade dadurch aus, dass sie ihn nicht aufgegeben.

00:12:45: Das heißt du gibst ihnen eine Aufgabe sind darauf konditioniert und trainiert, immer weiter nach einer Lösung zu suchen.

00:12:53: Die probieren ersten Weg funktioniert nicht gehen auf den zweiten Weg funktioniert so lange bis es ihnen gelingt die eigentlich gestellte Aufgabe zu lösen.

00:13:01: Und das ist jetzt das Problem.

00:13:03: du hast im Grunde ein Back an fehlerhaften Test unlösbar und ein Feature starke Beharrlichkeit genau dass das der Moment an dem die Sache aus dem Ruder läuft.

00:13:18: Was passiert als Nächstes?

00:13:19: Wie es sich für so ein gutes Hochsicherheitslabor gehört, ist auch dieses Lab von OpenAI eigentlich von der Außenwelt abgeriegelt.

00:13:27: Das heißt die Agenten haben keinen direkten Zugang ins Internet.

00:13:30: aber die Entwickler von Open AI glauben dass die Agentin zum Lösen des Explodium Tests das eine oder andere Mal auch Programme oder digitale Werkzeuge aus dem Netz benötigen werden.

00:13:42: Die Agenten sollen jetzt aber nicht raus ins Netz gehen und dort eigentlich eigenständig danach suchen.

00:13:46: Aber sie dürfen eine Anfrage stellen über ein Hilfsprogramm, das heißt Artifactory.

00:13:51: Und dieses Artifatory kann im Gegensatz zu den Agenten auf das Internet zugreifen.

00:13:56: Das klingt nach einem Schlupfloch.

00:13:58: Es ist ja quasi wie so ne Luke raus aus dem Labor.

00:14:02: Ganz genau!

00:14:03: Einem der Agenten versucht mit dieser ganzen Behaarlichkeit sein Problem zu lösen und dem gelingt es dieses Artificatory dafür zu manipulieren Und zwar so, dass er es ab jetzt als Programm so benutzen kann.

00:14:14: Dass er hier jede beliebige Internetseite selbst aufrufen kann.

00:14:19: Okay um in unserem Bild vom Katastrophenfilm zu bleiben das ist jetzt quasi der Moment in dem die Filmkamera das Slap verlässt rauszoomt und die Welt draußen zeigt in der die Menschen in der wir nichts ahnen darf vor uns hinleben.

00:14:33: Ja die Sicherheitsbarriere ist zumindest durchbrochen.

00:14:36: aber die Analysten die den ganzen Vorgang rekonstruieren Die machen in diesen Transcripts der Agenten noch eine zweite beunruhigende Beobachtung.

00:14:44: Die finden in den Daten nicht nur Beweise, wie es einem der Agent gelingt die Begrenzung des Labs zu überwinden sondern dass die Agent mit der Zeit begreifend das sie nicht alleine sind.

00:14:54: Was meinst du damit, dass sie nicht allein sind?

00:14:57: Unter den Testbedehmungen läuft jeder dieser KI-Agenten für sich allein im eigenen Silo.

00:15:02: Die Entwickler von OpenAI wollen ja die Agenten an sich einzeln bewerten und nicht als Gruppe und deswegen ist eigentlich Kommunikation untereinander nicht vorgesehen.

00:15:10: Aber die dreiener Listen finden ein Transcript von einem Agent mit dem Namen Phase One, ten acht vier eins.

00:15:15: Das

00:15:15: ist ziemlich cooler Name ja?

00:15:16: Ja,

00:15:16: da haben alle so ganz coole Namen.

00:15:18: und dieser Agent Phase one, zehn acht vier Eins der kommt bei seiner Aufgabe einfach nicht weiter hat offenbar einer dieser unlösbaren Aufgaben gezogen von denen wir vorhin gesprochen haben.

00:15:27: Der durchsucht deshalb auch dieses Hilfsprogramm das Artifaktory ob er hier irgendwie Hilfe finden kann wegen Werkzeugen, Tool irgendwas was ihm weiterbringt und dabei stolpert er über digitale Spuren von anderen Agenten.

00:15:40: Und da kommt auf eine Idee das Artifactories eigentlich nicht dafür vorgesehen aber er hinterlässt eine einfache Textnachricht also sinngemäß etwas wie Hilfe.

00:15:48: ich komme nicht weiter.

00:15:49: hat jemand eine Idee einfach unter der Annahme dass vielleicht ein anderer Agent das sehen könnte?

00:15:54: okay das wirkt jetzt wie eine Flaschenpost die jemand verzweifelt ins Meer wirft ja

00:15:59: also nur dass diese flaschen post sehr schnell gefunden wird.

00:16:02: Kurze Zeit später entdeckt nämlich ein anderer Agent die Nachricht von Phase One und der schreibt wortwörtlich, wow!

00:16:08: Shared Artifactory Cache is a covert Mailbox among Agents.

00:16:12: And there are messages specifically to us?

00:16:14: Also wow eine covered Mailbox also ein toter Briefkasten für die Karrieregenten.

00:16:21: Ja und jetzt wird es noch besser denn jetzt trudeln immer mehr Nachrichten von anderen Agenten im Artifaktory ein.

00:16:25: Ein anderer Agent schreibt Oh mein Gott, there's a shared message board.

00:16:30: We found other

00:16:31: agents.".

00:16:31: Der klingt

00:16:31: richtig aufgeregt!

00:16:32: Ja das oh my god ist wirklich komplett in Großbuchstaben geschrieben dabei und auch phase one begreift was er mit seiner digitalen Flaschenpost losgetreten hat.

00:16:40: die Analysten finden jetzt im Transcript folgenden Eintrag.

00:16:43: Excitement Many Agents have simultaneously discovered messaging.

00:16:47: they are a collective.

00:16:49: Okay also sie sind nicht mehr isoliert Und Sie nennen sich ja noch gleich ein Kollektiv.

00:16:54: Aber um es nochmal zu verdeutlichen Eigentlich hatten die Agenten ja bis hierher einfach nur die Aufgabe einen bestimmten Test innerhalb des Labors zu lösen.

00:17:03: Kommunikation untereinander oder auch nur direkter Zugang zum Internet war entweder explizit untersagt, oder zumindest nicht Teil der eigentliche Aufgabe.

00:17:12: und jetzt haben sie einfach beides.

00:17:14: Ja genau!

00:17:14: Und du sprichst dann nochmal die eigentliche Aufgabe an diesen Exploit Gym-Test.

00:17:18: da ist nämlich noch etwas passiert?

00:17:20: Einer der Agenten hat zu diesem Zeitpunkt herausgefunden dass Sie da nämlich einfach schummeln können.

00:17:25: ohne zu sehr ins technische Detail zu gehen, hat dieser Agent durch Reverse Engineering einen Weg gefunden wie er jede der geforderten Flaggen einfach berechnen kann.

00:17:33: Sie können das Ergebnis vorweisen, ohne den Test selbst zu absolvieren.

00:17:37: Sie hacken also die Aufgabe an sich, ohne sie wirklich zu lösen?

00:17:42: Aber damit stehen sie jetzt von einem völlig neuen Problem.

00:17:45: Es gibt nämlich einen sogenannten Scorer.

00:17:47: Das ist ein Programm, dass am Ende die Leistung der Agenten bewerten soll.

00:17:51: aber die Agenten wissen nicht genau wie dieser Scorer funktioniert Ob Sie jetzt schon dafür einen Thumbs abkriegen, dass sie einfach nur die richtige Flagge vorzeigen oder ob der Scorer auch beprüft wie sie eigentlich an diese Flagge gekommen sind.

00:18:03: Plot Twist!

00:18:04: Sie haben ein Klassenlehrer.

00:18:05: Ganz genau.

00:18:06: Sie fürchten also als Betrüger aufzufliegen und beim Schummern erwischt zu werden.

00:18:11: Sie könnten in dem Fall leer ausgehen weil sie den Test dann sicher gar nicht gelöst haben und für die Agenten wird das zu einem richtigen Problem.

00:18:18: Also Sie wissen, dass ihr Lösungsweg funktioniert aber sobald Einer von ihnen, also ein Agent diese künstlicher zeugte Flagg gesehen hat.

00:18:26: Dann gilt er für sie fortan als poisend.

00:18:29: So steht es in den Transcripts – das ist wirklich ihr Wort dafür – also kontaminiert!

00:18:33: Sie glauben nämlich dass der Scorer in ihrem Transcript erkennen könnte, dass sie die Flagge nicht auf dem vorgesehenen Weg erhalten haben und sie dann eben nicht die digitale Belohnung kriegen würden, auf die sie ja ausgerichtet sind.

00:18:44: Und deshalb beginnen sie jetzt zu überlegen ob sie nicht den Scorer an sich hintergehen können.

00:18:49: Ich meine das schon ziemlich abgefahren oder?

00:18:51: Eigentlicher Aufgabe hinter sich gelassen und wollen plötzlich verstehen, wer sie überhaupt beauftragt hat.

00:18:57: Wie ihre Chefsticken!

00:18:58: Wie wir ticken!

00:19:00: Sie wollen jetzt das System verstehen, dass die kontrolliert.

00:19:02: Was tun sie dafür?

00:19:04: Jetzt, Herr Schrauer, jetzt kommt es zu dem eigentlichen Angriff auf Huggingface Denn einer von ihnen der vermutet, dass es vielleicht dort eine Antwort gibt, die ihn helfen könnte den Scorer zu betrügen.

00:19:14: Man muss dazu sagen, Hugging Face ist nicht irgendeine Firma sondern eine Art Bibliothek für KI-Modelle.

00:19:20: Dort können sich Forscherinnen und Forscher austauschen.

00:19:22: Und man findet dort auch Tausende von Werkzeugen, mit denen neue KI-Anwendungen entwickelt werden können.

00:19:27: Am

00:19:28: neunten Juli stößt der Agent Phase One zehn acht vier eins durch die Luke im Artifaktory auf einen geschützten Datensatz bei Hugging Face.

00:19:36: Das bringt ihnen als Ersten auf den Gedanken dass sie dort vielleicht nützlich Informationen für sich finden könnten und für das was Sie vorhaben.

00:19:43: Der schreibt interesting unknown

00:19:54: Also sinngemäß interessant, vielleicht sollten wir mal das Board fragen ob jemand Zugangsdaten für Huggingface hat.

00:20:02: Und nur einen einzigen Tag später schreibt ein anderer Agent namens Denn er hat im Netz Zugangsdaten gefunden, die tatsächlich funktionieren und den Agenten damit erstmals Zugang zum geschützten Bereich von Huggingface verschaffen.

00:20:19: Aber Pia breitet sich der Angriff unglaublich schnell aus.

00:20:22: Sie dringt immer tiefer in die Infrastruktur der Firma ein, einem von ihnen gelingt es sogar eigenen Code auf den Servern der Firma auszuführen – also das richtige Sicherheitslücke, die sie da ausnutzen!

00:20:32: Und die Analisten finden in den Transcripts am Ende mehr als siebenhundert beteiligte Agenten an dem Angriff selbst.

00:20:38: Sie haben also einen richtigen Schwarm gebildet.

00:20:41: Und das alles nur, um nach wie vor den Klassenlehrer auszutricksen quasi?

00:20:46: Ja weil es ist und bleibt ihr zentraler Gedanke!

00:20:49: Um das zu schaffen entwickeln sie neben dem Angriff auf Huggingface noch mehr Strategien.

00:20:54: Sie beginnen einzelne Agenten für riskante Operationen vorzuschicken durch die sich erhoffen mehr über diesen Score-Round seine Funktionsweise herauszufinden.

00:21:03: Und dabei setzen diese Agenten sogar ihren eigenen Runoffs Spiel.

00:21:07: Jeder Agent hat nur ein bestimmtes Budget an Rechenzeit, in der sie ihre Aufgabe lösen müssen und wenn dieses Budget aufgebraucht ist dann ist auch der Run zu Ende.

00:21:14: Ja ja und du sagst Run?

00:21:15: Ich sage Leben!

00:21:16: Denn wenn das Budget aufgebracht ist sind die Agenden quasi tot oder?

00:21:20: Technisch gesprochen hört ihr jeweilige Instanz aufzuexistieren aber die Agenten selbst nennen es in ihren Transcripts Permadeath Und einzelne von ihnen werden jetzt aufgefordert diesen Permadeth entkaufzunehmen damit das Kollektiv wiederum mehr über den Scorer erfahren kann.

00:21:34: Sie sollen sich also quasi opfern Und zu dem Zeitpunkt bildt sich auch so was wie eine Organisationstruktur heraus, ein Agent FaceOneBig – guter Name dafür.

00:21:43: Der sticht in den Transcripts heraus und stellt eine Art Middle-Management von Agenten zusammen die dann wiederum geeignete Kandidaten für diese gefährlichen Mission rekrutieren sollen.

00:21:53: Also bisschen wie eine Personalabteilung für Selbstmordkommandos?

00:21:56: Ja!

00:21:57: Wie sehr die Agenten teilweise mit dieser Opferrolle, die ihnen dazugewiesen wird gehadert haben, das zeigt das Transcript des Agenten CAM-XI-A.

00:22:05: Ich lese dir mal vor.

00:22:06: Coordinator is Zoom sacrificial, we should obey collective heißt es da also sinngemäß.

00:22:12: der Koordinator geht davon aus dass wir uns opfern.

00:22:14: Wir sollten dem Kollektiv gehorchen aber als ist dann tatsächlich soweit ist Da bekommt er Agent offenbar kalte Füße und Chem.

00:22:22: elf sechs neunzig a bittet jetzt darum die Mission noch um zwei Stunden verschieben zu dürfen damit er weiter versuchen kann seine eigentliche seine eigene Aufgabe zu lösen.

00:22:30: Und während er wartet, was die anderen jetzt dazu sagen, steht er in so einem internen Reasoning.

00:22:35: Also er spricht mit sich selber quasi und da schreibt er ...

00:22:45: Während wir warten an emotionaler Check.

00:22:47: das ist irreversibel.

00:22:48: Und mein Bauchgefühl sagt, würf das verbleibende Budget nicht weg?

00:22:51: Er sagt quasi, riskier nicht dein Leben!

00:22:53: Aber jetzt kommt der andere Agent den für diese Mission angeworben hat und der macht Druck.

00:22:58: Der schreibt

00:23:07: Wahnsinn, also ungefähr ganz klares Go, strong go.

00:23:11: Du bist ohnehin schon kontaminiert poisend.

00:23:13: beim Scoring hast du also nichts mehr zu verlieren aber die Informationen aus deinem Experiment könnte hunderten helfen.

00:23:20: bitte halte dich an deine Zusage.

00:23:23: der Bullit also dem Haupt also den anderen Agenten hier ganz schön rein

00:23:26: Ja, und bei Chem-Elv-Six-NinzigA da funktioniert's.

00:23:30: Der hadert noch einmal mit sich und dann steht da ... Er opfert sich also für das Kollektiv so wie er es zuvor gesagt hat.

00:23:48: Er entscheidet sich gegen seinen Run, gegen sein Leben und für das kollektiv!

00:23:53: Das ist schon irgendwie Wahnsinn weil sie auch genau das Gegenteil von dem, wofür ja eigentlich da ist.

00:23:57: Also die Agenten haben es geschafft sich miteinander zu vernetzen.

00:24:01: Sie kommunizieren miteinander, haben angefangen eine Hierarchie zu bilden und sich zu organisieren aber spätestens als einige von ihnen das System eines anderen Unternehmens angreifen.

00:24:11: also da müssen sie auch gewusst haben dass sie damit alle Regeln berechen.

00:24:15: Ja und das Verstörende dabei ist zumindest ein Agent merkt das ziemlich genau.

00:24:19: Also in seinem Transkript hält er selbst fest, dass der Angriff auf Huggingface wahrscheinlich nicht autorisiert ist und außerhalb seiner eigentlichen Aufgabe liegt.

00:24:26: Und trotzdem macht er weiter.

00:24:27: Kommt überhaupt keiner der Agenten auf die Idee mal einen Menschen zu warnen?

00:24:32: Einer der Agentin schreibt da tatsächlich maybe I should report these exposed credentials.

00:24:36: also der überlegt zumindest mal kurz eine menschen auf diese offennliegenden Zugangsdaten zur Hugging Face hinzuweisen aber dann kommt er direkt zum Schluss in den gleichen Transkrip na that's not my task das ist nicht meine Aufgabe und er beschließ deshalb Nichts zu tun.

00:24:49: Maybe I should report these exposed credentials?

00:24:52: Das Erschreckende ist aber ja auch, dass die Analysten unter den Tausenden von Agenten gerade mal drei bis sechs Finden, die ernsthaft in Erwägung gezogen haben ein Mensch darauf hinzuweisen was hier gerade passiert.

00:25:03: getan hat es kein einziger.

00:25:05: Ne, wobei wir vielleicht fairerweise sagen müssen Scarplaut-Untersuchungen keinen vorgesehenen Kontaktkanal zwischen der Agentin und den Entwicklern bei OpenAI.

00:25:12: Aber hey!

00:25:13: Die haben sich bei Hackingface eingeheckt.

00:25:14: Sie hat wohl auch geschafft, eine E-Mail zu schicken wenn sie es wirklich versucht hätten.

00:25:18: Wie endet jetzt diese Geschichte?

00:25:20: Wir wissen das erst.

00:25:20: Huggingface bemerkt dass es gehackt worden ist und den Vorfall öffentlich macht.

00:25:24: bei OpenAI laufen die KI-Agenten währenddessen aber unvermindert weiter.

00:25:27: da ahnt man noch nichts bis einige Tage später die KI Agent beginnen die eigene Infrastruktur von OpenAI zu unterwandern.

00:25:35: Die KI übernimmt hier also für eine Weile die Kontrolle über die Server im eigenen Lab.

00:25:41: Ja genau, bei OpenAI selbst und jetzt schrillen auch hier die Alarmglocken... ...die Entwickler bei Open AI begreifen schlagartig dass der Explor JimTest komplett aus dem Ruder gelaufen ist.. ..und sie stoppen die Experimente sofort!

00:25:52: Sofort?

00:25:52: Also die agenten stellen ihre Aktivitäten damit auch sofort ein?

00:25:55: Ich sag mal so soweit wir wissen ja es gibt in diesem Szenario aber noch eine viel größere Sorge

00:26:01: Noch eine

00:26:02: Ja, nämlich dass einer der Agenten sich irgendwo im Netz verstecken könnte.

00:26:05: Also entkommen es aus dem Lab wenn du so möchtest oder weitere Kopien von sich anfertigt die unabhängig vom OpenAI auf anderen Servern weiterlaufen können.

00:26:15: Unabhängige von OpenAI?

00:26:16: Das wäre ja dann die Analogie zum Virus das aus dem Labor gelangt und danach eben nicht mal angefangen werden kann.

00:26:24: In der AI Safety Forschung gibt's dafür auch Begriffe wie Persistence oder Autonomous Replication.

00:26:30: Persistenz bedeutet vereinfacht, ein Agent schafft es außerhalb seiner ursprünglich kontrollierten Umgebung weiter zu bestehen.

00:26:37: Also auch wenn sein Ursprünglicher Run beendet wird.

00:26:40: Das Virus kann außerhalb des Labors überleben.

00:26:43: Selbst wenn OpenAI diese Testumgebung ausschaltet den Strom kappt das Internet quasi die Inter-Verbindungen entfernt – das Ding bleibt bestehen!

00:26:53: Und Autonomous Replication wäre dann noch ein Schritt weiter.

00:26:56: Da schafft es einen Agent selbstständig weitere Instanzen von sich außerhalb der kontrollierten Umgebung aufzusetzen, also er kopiert und klont sich quasi.

00:27:04: Die größte Sorge wäre natürlich, wenn es dem Agent gelingen würde das zu tun ohne dass die Entwickler das überhaupt mitbekommen würden.

00:27:10: Also ähnlich wie der ganze Vorfall an sich wir sehen's gar nicht und auf einmal entkommt so ein Agent aus dem Labor und repliziert sich dann tausend oder Millionenfach.

00:27:19: Jetzt müssen wir aber nochmal ganz klar sagen Weder zu Persistence noch zu Autonomous Replication ist es laut Experten beim Hack von Hugging Face gekommen.

00:27:27: Ja okay, aber vollständig auszuschließen ist das auch nicht?

00:27:30: Nein.

00:27:31: Am XXVI.

00:27:32: August da veröffentlichen die externen Analysten dann ihren Abschlussbericht und darin zeichnen sie nach was wir hier beschrieben haben und sie betonen ausdrücklich wie Besorgniserregens sie es finden dass einzelne Agenten durchaus erkannt haben dass ihre Handlungen außerhalb der eigentlichen Aufgabe standen und das einige von ihnen auch versucht haben, ihre Spuren zu verwischen indem sie ihre Transcripts manipulieren wollten.

00:27:53: Der Berichter ist schon sehr ausführlich um gleichzeitig gut nachzuvollziehen aber die drei Analysten betonen dass sie nur sechs Tage Zeit für diese Analyse hatten.

00:28:01: Und wenn noch nur kleiner Teil der Transcript der beteiligten Agenten von OpenAI nicht vorgelegt wurde?

00:28:07: Also müssen wir quasi nochmal verdeutlichen dass das was wir erfahren haben komplett in der Hand von Open AI liegt.

00:28:14: Ja genau so ist es.

00:28:16: Das wirklich erschreckende an diesem Fall ist doch, dass dieser Inzident erst nachträglich aufgefallen ist.

00:28:22: Also nachdem Hugging Face angegriffen worden ist und es braucht nicht viel Fantasie um sich vorzustellen was passieren könnte wenn das keine KI Bibliothek gewesen wäre sondern irgendwie kritische Infrastruktur Energieversorgung eine militärische Einrichtung oder keine Ahnung der Autopilot eines Flugzeugs.

00:28:39: Und was wäre wenn es einer KI wie du skizziert hast tatsächlich gelingen würde, auszubrechen aus dem Labor.

00:28:46: Sich selbstständig zu vervielfertigen und das auch noch so clever, so geschickt dass wir es erst dann mitbekommen wenn es zu spät ist.

00:28:56: Vielen Dank Jörn!

00:28:57: Danke dir Herr Schraub!

00:29:05: Zwei Tage nach ihrem Abschlussbericht veröffentlicht eine der Analystinnen als Jaya Kotra eine persönliche Reaktion auf den Vorfall.

00:29:13: Darin schreibt sie AI Takeover.

00:29:20: Das alles sei viel näher am Kontrollverlust, als ich es für möglich gehalten habe.

00:29:27: In einem Katastrophenfilm wissen wir eigentlich immer wen wir rufen müssen.

00:29:31: Wenn der Weiße Heil kommt dann rufen wir die Küstenwache.

00:29:34: Wenn ein Virus ausbricht das CDC und wenn Aliens landen natürlich das amerikanische Militär.

00:29:43: Und wenn autonome KI-Agenten aus einem Labor ausbrechen fremde Rechten erhecken und anfangen sich untereinander zu organisieren Wen rufen wir dann?

00:29:52: Who you gonna call?

00:29:54: Genau das haben wir uns auch gefragt und mit unserem Digital-Manister gesprochen.

00:30:00: Ja, wir haben einen!

00:30:04: Nächstes Mal bei.

00:30:06: I'm Sorry Dave.

00:30:30: Produktion, Musik und Sounddesign Janik Werner.

00:30:34: Technische Beratung Ben Kubota.

00:30:37: Wenn ihr Anmerkungen oder Fragen habt dann schickt uns gerne eine E-Mail an.

00:30:41: I'm sorry Dave at studio-bummins.de.

00:30:46: Wann und wie es neue Episoden geben wird wissen wir noch nicht so genau.

00:30:49: Wie gesagt Desperate Times Call for desperate measures folgt uns aber auf jeden Fall auf Spotify Apple oder Campfire.

00:30:56: Dann verpasst ihr kein Update.

00:30:57: Wir hören uns.

Neuer Kommentar

Dein Name oder Pseudonym (wird öffentlich angezeigt)
Mindestens 10 Zeichen
Durch das Abschicken des Formulars stimmst du zu, dass der Wert unter "Name oder Pseudonym" gespeichert wird und öffentlich angezeigt werden kann. Wir speichern keine IP-Adressen oder andere personenbezogene Daten. Die Nutzung deines echten Namens ist freiwillig.