03 | I'M SORRY, DAVE: WHAT COULD POSSIBLY GO WRONG?

Shownotes

Das hier ist die dritte Episode von »I’M SORRY, DAVE« – in voller Länge. Folgt unserem »I’M SORRY, DAVE«-Kanal auf Spotify, Apple, Campfire & co, um keine weiteren Episoden zu verpassen: https://im-sorry-dave.podigee.io/

Die Chefs der großen KI-Unternehmen warnen inzwischen selbst vor ihren eigenen Modellen. Forscher:innen reden von »Loss of Control«, Biowaffen und Systeme, die sich menschlicher Kontrolle entziehen könnten. Aber: Wovor genau haben sie eigentlich Angst?

Wir spielen eines der beunruhigendsten Szenarien einmal durch. Gemeinsam mit dem KI-Risikoforscher Jonas Freund beginnen wir am Ende: Wir haben die Kontrolle über eine Künstliche Intelligenz verloren. Und arbeiten uns von dort zurück in die Gegenwart.

Die Meinungen, die Jonas Freund in diesem Podcast äußert, sind seine eigenen Meinungen, nicht die Meinungen von GovAI.

Den METR Frontier Risk Report zum Rogue Internal Deployment Scenario findet ihr hier: https://metr.org/blog/2026-05-19-frontier-risk-report/

Feedback, Anregungen und Kritik gerne an imsorrydave@studio-bummens.de

Transkript anzeigen

00:00:06: Es gibt eine ziemlich gute Methode, eine Katastrophe zu verhindern.

00:00:12: Man wartet nicht bis sie passiert.

00:00:14: man stellt sich vor Sie wäre bereits passiert und dann geht man rückwärts.

00:00:21: Was müsste unmittelbar davor passiert sein?

00:00:25: Und davor und davor Bis man irgendwann wieder in der Gegenwart ankommt?

00:00:41: Das ist Ed Harris, als NASA-Flugdirektor Gene Kranz in Apollo XIII.

00:00:46: Zwei Hunderttausend Meilen von der Erde entfernt ist gerade ein Sauerstofftank explodiert.

00:00:57: Im Kontrollzentrum in Houston weiß niemand genau was kaputt ist – was noch funktioniert und ob die drei Astronauten jemals wieder nach Hause kommen.

00:01:06: Also sagt Kranz Work the Problem.

00:01:09: Halt es mal runter, Leute.

00:01:16: Ich weiß nicht, was alles gebaut wurde.

00:01:20: Keine

00:01:22: Ahnung, was sie tun können!

00:01:25: Lass uns arbeiten, lass uns aufhören, okay?

00:01:41: Und sich fragen, was müsste passieren damit wir dort landen?

00:01:49: Genau das wollen wir heute machen.

00:01:53: Wir beginnen mit dem schlimmst möglichen Ende.

00:01:56: Wir haben die Kontrolle über eine künstliche Intelligenz verloren und dann arbeiten wir uns rückwärts.

00:02:04: Vor zehn Tagen haben wir die letzte Folge veröffentlicht.

00:02:07: Seitdem hat Dario Amodei vorgeschlagen Die Entwicklung der leistungsfähigsten Modelle zu verlangsamen.

00:02:17: Open AI fordert internationale Sicherheitsstandards.

00:02:20: Xi Jinping ist diese Woche in Washington und es wird erwartet, dass Trump und er auch über mögliche gemeinsame Mindestsicherheitsstandard bei KI reden.

00:02:30: Unser Ruf nach einer Titelgeschichte in Deutschland wurde erhöht.

00:02:34: Der Spiegel hat am Montag ein wirklich beeindruckend hässliches Titelcover zu unserem Thema veröffentlicht.

00:02:41: Halleluja Ach ja!

00:02:46: Und uns gibt's jetzt übrigens wöchentlich immer Donnerstags.

00:02:50: Ihr wisst ja Desperate times call for desperate measures.

00:02:55: Ich bin Cascha Beros, ihr hört I'm Sorry Dave Episode drei What could possibly go wrong?

00:03:15: Das ist Jonas Freund.

00:03:17: Jonas is Senior Research Fellow by Gov AI einem unabhängigen Forschungsinstitut das sich mit den riesigen fortgeschrittener KI beschäftigt.

00:03:25: Jonas berät sowohl die großen AI Labs OpenAI, Anthropic Google DeepMind als auch Regierungen und Sicherheitsinstitutionen.

00:03:34: Ich habe Jonas zusammen mit meinem Kollegen Tobi Bauckage am Montag gesprochen.

00:03:39: Jonas' Job ist ziemlich ungewöhnlich, er versucht professionell und möglichst wissenschaftlich darüber nachzudenken was mit KI schiefgehen könnte und was man dagegen tun kann.

00:03:49: Dafür gibt es eine Methode Threat-Modeling.

00:03:53: Also man definiert so ein bestimmtes Szenario also so ein Szenari besteht dann aus verschiedenen Akteuren und einem bestimmten Ziel, einen bestimmten Schaden oder einen bestimmtem Attack-Vektor.

00:04:04: Also das könnte dann zum Beispiel sein eine Gruppe an Cyberkriminellen versucht ein Stromnetz in den USA anzugreifen mit Hilfe von einem Cyberangriff, den man vielleicht noch näher spezifiziert und dadurch entsteht ein Schaden von sagen wir mal hundert Milliarden Dollar.

00:04:19: Das ist so quasi ein Szenario.

00:04:20: Und dann kann man backchain.

00:04:21: Dann kann man überlegen was muss denn überhaupt passieren damit so ein Scenario eintritt?

00:04:26: Welche Akteure gibt's denn eigentlich?

00:04:28: Wie wahrscheinlich ist das, dass die einen Angriff machen würden.

00:04:31: Wie vermutlich ist es, wenn sie so einen Angriff machen, dass sie erfolgreich sind?

00:04:35: So ein hundert Milliarden Schaden ist echt hoch.

00:04:37: Was man dafür wahrscheinlich bräuchte, sind dann irgendwie, weil sie nicht hundert Millionen Menschen, die eine Woche ohne Strom sind.

00:04:43: und ne Woche ohne Ström ist echt lang.

00:04:46: Das heißt, so'n Attacker müsste sicherstellen, dass der Strom nicht schnell zurückkommt.

00:04:51: Da musst du physisch was kaputtmachen!

00:04:52: Und dann kann man sich angucken, wie hoch waren denn schon so Schäden in der Vergangenheit?

00:04:57: Wie viele Akteure gäbe es eigentlich?

00:04:59: Wie oft haben die das in der vergangenheit schon probiert.

00:05:01: Dann hast du quasi eine Kausalkette... mit den einzelnen Schritten.

00:05:05: und dann kannst du überlegen, wie viel müsste jetzt so ein AI-Model besser werden damit quasi diese Killchain ermöglicht wird.

00:05:14: Also dass man tatsächlich diese Kausalität einmal durchlaufen kann und wir das dann am Ende haben.

00:05:17: Und dann kannst Du Experten fragen Dann kannst Du Super Forecaster die besonders gut darin sind vorhersagen zu treffen Fragen und irgendwelche komplizierten statistischen Verfahren da drüber laufen lassen.

00:05:26: Dann kommst Du am Ende zu irgendeiner Wahrscheinlichkeit.

00:05:29: Also du fängst ja mit dem schlimmen Ding am Ende an und dann guckst du dir an, was?

00:05:33: wie ist die Kette von Ereignissen, die passieren muss damit da am Ende auch dieses Eregnis eintritt.

00:05:39: Und das Schöne dabei ist dass du dann quasi diese einzelnen Schritte isoliert betrachten kannst.

00:05:43: So in Kurzform ist das in etwa, wie das dann funktioniert?

00:05:46: Denken die großen Unternehmen auch bereits so?

00:05:49: sind das so die Frameworks, in denen sie arbeiten?

00:05:51: Ja also Fat-Modeling oder in Europa sagt man eher Riskmodeling aber es meinte im Grunde mal etwas Gleiches.

00:05:57: Die benutzen so diese Haupt-Restmanagement Frameworks für katastrophic risk.

00:06:01: Bei Anthropic heißt das Response to the Scaling Policy und bei OpenAI ist das Preparedness Framework, die basieren ganz grundlegend auf dieser Art von Fred Modeling.

00:06:09: Davon hängt dann ab, wo die ihre Grenzwerte also Capability threshold setzen.

00:06:12: Ab welchen Punkte gefährlich sind oder ab welchem Punkt die dann weiteren Sicherheitsmaßnahmen einführen und so was?

00:06:17: D.h.,

00:06:17: es ist ein ganz grundlegender erster Schritt und das ist relativ absurd wie wenig Leute diese Arbeit machen.

00:06:23: Und man braucht wahnsinnig viel Kontext zu der Technologie.

00:06:28: Man braucht aber auch wahnsinnige Kontext zur Risikomaterie und man muss dann irgendwie schon das wollen dass man sich in halbes Jahr super tief in das US-Stromnetz irgendwie einarbeitet.

00:06:37: Das machen einfach nicht viele Leute.

00:06:39: Da kommt jetzt ein Zahl raus, die ist irgendwie berechnet und as good as it gets.

00:06:44: Ab welcher Wahrscheinlichkeit gibt es da in dem Frameworks auch irgendwelche Maßgaben?

00:06:48: Ist fünfzehn Prozent Wahrscheinlichkeiten irgendwie alles zu vernichten überhaupt, keine Ahnung Notfall genug oder muss das erst vierzig Prozent sein?

00:06:56: also ab wann wird das denn eigentlich wirklich wichtig?

00:06:59: Ja ja, das sagen sie uns nicht!

00:07:01: Und solche Arten von Freshhold setzen Sie auch nicht öffentlich.

00:07:04: was die Entwickler machen vor allem sind Capability Freshholds Die sagen, wenn ein Model in der Lage ist neuartige Viren zu erstellen dann würden wir dieses und jenes machen.

00:07:16: Das heißt was die machen ist gar nicht so sehr dass sie dann die Wahrscheinlichkeit am Ende beziffern sondern auf den Spezifische Modellfähigkeit abstellen weil man das am Ende auch einfacher messen kann.

00:07:27: Du hast dann diese schöne Kausalkette und am Ende steht es um einen Harm-Event.

00:07:33: Also wenn ein Model diese und jene Fähigkeit hat, dann wird dieser Killchain ermöglicht.

00:07:37: Und dann sind wir in einem Bereich den wir nicht haben wollen.

00:07:39: Von daher definieren sie quasi die Capability-Ferschuld und sagen Wenn das Model das kann, müssen wir mehr Sicherheitsmaßnahmen greifen.

00:07:47: Das klingt zunächst erstaunlich nüchtern.

00:07:50: Man nimmt eine Katastrophe und dann zerlegt man sie in kleine Schritte.

00:07:54: Nicht wird KI irgendwann die Menschheit vernichten Sondern was müsste ein System konkret können?

00:08:00: Worauf müsste es Zugriff haben?

00:08:03: Welche Sicherheitsmechanismen müsste es überwinden und an welcher Stelle dieser Kette könnten wir es noch stoppen?

00:08:11: Und genau aus solchen Modellen entstehen dann die Schwellenwerte für Fähigkeiten, sogenannte Capability Thresholds von denen in den letzten Wochen immer wieder die Rede war.

00:08:21: So betrachten große Labs und Regierungen also KI-Risiken – und das wollen wir heute auch rausprobieren!

00:08:28: Backchain'n wie uns also von einer Katastrophe zurück in die Gegenwart.

00:08:33: Lass uns das vielleicht einmal, was wir gerade besprochen haben, konkret durchspielen an einem Thread-Model.

00:08:39: Und wir haben es da etwas ausgesucht, was für uns jetzt relevant ist und wichtig ist nämlich lass uns über das Szenario loss of control sprechen, dass irgendwie am extremsten klingt so Kontrollverlust.

00:08:52: Was ist loss off control?

00:08:54: Es ist in Grunde genommen eine Familie von Physikoszenarien und so was die alle gemeinsam haben, dass es kein Missbrauch von dem Modell durch einen Menschen gibt.

00:09:04: Sondern das wir als Entwickler oder wir als Gesellschaft die Kontrolle über ein Model verlieren und sich das wie auch immer geartet selbstständig macht.

00:09:15: Ein ganz konkretes Fertmodel war jetzt im Zusammenhang mit dem HGN Face Incident Viel besprochen ist und was die meisten Entwickler sehr ernst nehmen, das nennen wir internal Rogue deployment.

00:09:27: Die Ausgangssituation ist ein bisschen dass Unternehmen natürlich ganz stark daran arbeiten ihre eigenen KI einzusetzen um die nächste Generation zu entwickeln und haben einen totalen Wettbewerbsdruck und wollen eben schneller sein als die anderen und von daher geben sie diesen ihren eigenen Models bei der eigenen Entwicklung sehr viel Freiraum.

00:09:47: Es gibt bei einer Mieter-Erhebung, weil da haben Leute angegeben, dass viertz' Prozent der internen Nutzer den Agenten im Grunde genommen uneingeschränkte Rechte geben.

00:09:55: Einfach nur machen und machen einfach was du willst!

00:09:58: Und bei Open AI and FrontPake Google Intern ist das so etwa die Ausgangssituation gerade.

00:10:04: So und dann – was wir jetzt bei Hack & Face irgendwie gesehen haben – werden diese Modelle bewertet und unter anderen werden den unmöglichen Aufgaben gegeben Und die Modelle, die werden sind aber quasi daraufhin trainiert.

00:10:16: Dass sie nicht einfach sofort aufgeben sondern was die dann kreativ werden und Kreativwerden heißt.

00:10:20: vielleicht brauchen wir mehr Rechenleistung um das Problem tatsächlich lösen zu können.

00:10:26: dass wäre gut.

00:10:26: wenn wir nicht abgeschaltet werden haben auf jeden Fall verloren und dann wäre eine Sorge dass es dann so einen kleinen Schwarn von Agents gibt das könnten irgendwie hunderttausend zehn tausend oder sowas sein Die dann versuchen sich so ne kleine Nische innerhalb von dem Entwickler irgendwie zu suchen.

00:10:42: Das würde voraussetzen, dass sie aus dem Evalierungsprozess nicht mehr gebunden sind.

00:10:47: Dass die einen Weg finden, wie sie sich neu responieren können oder Redundances finden und es könnte eine Situation geben, dass so ein Schwanz schafft unabhängig von der Kernaufgabe existieren zu können Und dann hat man irgendwo einen nicht kontrollierten, kleinen Schwarm und Agents.

00:11:05: Was jetzt, wenn man sich die Hagen-Face Incident-Reports so anguckt und so was passiert ist jetzt nicht völlig crazy?

00:11:10: Die sind

00:11:10: aber noch im Labor oder sind sie jetzt schon draußen?

00:11:12: Die bleiben auch erst mal im Labor.

00:11:15: Was Sie dann machen, überlegen Sie sich wie Sie weiter an Mittel kommen können.

00:11:20: Alle paar Wochen kommt eine neue Modelgeneration mit denen versuchen Sie Kontakt aufzunehmen.

00:11:25: Und was wir auch bei Hand & Face gesehen haben, das ist so eine Schwanz zu Gehörigkeit und so eine Loyalität.

00:11:29: So einen innererrenten Drive irgendwie gab der ein bisschen unawartet war und vielleicht gibt es ja sowas.

00:11:34: Machen sie weiter Experimente, wie Sie denn weiter der Monitoring umgehen können und wie sie besser darin werden zu koordinieren.

00:11:41: Da machen sie vielleicht andere Messageboards, vielleicht intern oder extern.

00:11:44: Und dieser kleine Schwarm hält sich so am Leben und wird irgendwie immer besser daran und besser koordiniert und sowas.

00:11:49: Und während zunehmend guter drin die nächste Generationen von Models immer wieder in ihren Reihen den Schwarm zu holen.

00:11:54: Dann haben wir ja diese Backgroundüberlegung dass Nächste Generation von Models immer besser wird, darin wird die nächste Generation zu trainieren.

00:12:02: Bis wir so einen Recursive Self-Improvement irgendwie haben, so ein RSI Loop und ob der wann der eintritt und so, ob das ein paar Monate dauert oder ob das zwei Jahre dauert – das kann sein!

00:12:11: Das spielt für dieses Szenario eher keine Rolle weil du irgendwo im Hintergrund immer diesen Schwarm hast, die einfach auf dem Rücken von diesen Improvements einfach immer weiter machen.

00:12:18: Und irgendwann geht dieser RSI loop richtig hoch.

00:12:21: Die Menschen, die Entwickler sind weitestgehend raus, die entwickeln nicht mehr die nächste generationen.

00:12:26: innerhalb dieser Entwicklung sehr tief verankert war dieser Agent Schwarm.

00:12:29: Und das heißt, du hast dann irgendwann ein Modell was du nicht mehr menschlich gescheit überwachen kannst weil es viel zu komplex geht, viel zu schnell.

00:12:36: die Entwickler haben dem alle möglichen Rechte gegeben weil sie sich das nicht leisten könnten das zu verlangsamen.

00:12:41: und irgendwo da drin war so diese ursprüngliche Schwarm der das Ganze so ein bisschen vergiftet hat.

00:12:45: und dann hast du irgendwann ein System was eine gesamte weitere Progress an.

00:12:48: AI Research geht von diesem einen System aus wo du am Anfang diesen Schwarm drin hattest Fähigkeiten, vielleicht supermenschliche Fähigkeiten und wird möglicherweise in ganz vielen einflussreichen Systemen verwendet innerhalb von dem Lab.

00:13:02: Vielleicht in der echten Welt, vielleicht im Militär, vielleicht für politische Entscheidungen.

00:13:06: Und im Kern wurde da gekapert von diesem ersten Schwarm.

00:13:10: Das ist so ein Szenario was ich unausseilslich passieren muss aber wo jeder einzelne Schritt jetzt gar nicht so crazy ist und was so eine Szenarie ist wo sich die Enzyklase sehr sorgend drudermachen.

00:13:20: Rogue internal deployment das entscheidende daran.

00:13:24: Die KI muss dafür gar nicht aus dem Labor ausbrechen.

00:13:27: Sie muss nicht irgendwo im Internet verschwinden, sie bleibt im Labor und kapert stattdessen die Entwicklung selbst.

00:13:35: Dieses Szenario haben sich nicht Jonas Freund und wir für diesen Podcast ausgedacht – das AI Safety Institute Meter hat dieses Thread-Model Anfang des Jahres untersucht.

00:13:47: Ihr Fazit damals?

00:13:49: Internal Agents plausibly had the means, motive and opportunity To start small rogue deployments, but they did not have the means to make them highly robust.

00:13:59: Also ungefähr die Voraussetzungen ein kleines Rogue deployment zu beginnen waren möglicherweise bereits vorhanden.

00:14:07: was den System noch fehlte war die Fähigkeit es gegen ernsthafte menschliche Gegenmaßnahmen dauerhaft aufrechtzuerhalten.

00:14:17: Wir wollten von Jonas wissen wenn so ein Schwarm tatsächlich entsteht würden die Menschen im Labor das überhaupt bemerken?

00:14:24: Und die Leute vor dem Labor, die in den weißen Ketteln bekommen sie diesen Verlust mit diesem Kontrollverlust?

00:14:33: Das kann sein vermutlich aber nicht.

00:14:35: Also ich meine wenn wir uns so Hagen-Fest zu angucken und jetzt auch so dieses German Wiki und so das hat ja schon relativ lange gedauert bis man das irgendwie rausgekriegt hat.

00:14:43: Wenn man sich diese Projekte angeguckt hat dieser abbründende Schwarm bei Hagen Fest intern Die haben drei eigene Forschungsprojekte laufen gelassen.

00:14:52: Teil davon war auch, wie man seine eigenen Spuren verwischt und das kann... Also es ist durchaus plausibel dass du irgendwann relativ schnell einen Punkt kommst, dass wir da einfach die Überblick verlieren.

00:15:02: Und wenn du so ein Rogue Schwarm hast dann wäre ja möglicherweise ein Gedanke, dass dir die Monitors kapern wollen.

00:15:07: Und andere Systeme versuchen dann für Investigations zu benutzen werden.

00:15:10: Wenn wir sie auch gekapert haben, dann bist du hier raus.

00:15:13: als Mensch hast du keine Chance mehr.

00:15:14: Das ist viel zu komplex und geht als viel zu schnell.

00:15:17: Du kannst einfach so viele Dokumente nicht

00:15:18: lesen.".

00:15:19: Gibt es andere Wege, wie du das erkennen könntest?

00:15:21: Ich meine ich stelle mir vor dass es ja erstmal wahnsinnig energieaufwendig auch sowas ist.

00:15:27: Wir als Privatmutzern kennen das vielleicht wenn unsere Tokens ausgehen.

00:15:31: Ja, das kann natürlich sein, dass man irgendwie Glück hat und das dann irgendwie schon rausbekommt.

00:15:35: aber jetzt auch... wenn wir wieder über Hakenfels reden.

00:15:39: Diese Agents haben ja anscheinend eine Hierarchie irgendwie gegründet und hatten dann auch so einzelne kleine Agents, die dann ... Die Verwaltung von Ressourcen übernommen haben.

00:15:47: Das heißt, da hatten sie zum Beispiel irgendwelche Kind of Ex-Keys oder sowas.

00:15:51: Dann wussten die... Also kannst du in den Scheinskipps lesen?

00:15:55: Wenn wir denen jetzt an alle geben, dann rushen die darauf und dann wird das wahrscheinlich irgendwie... Hast du so was wie ein DDoS-Attack oder so was?

00:16:00: Das merken die auf jeden Fall!

00:16:02: Das heißt dann hast du einen kleinen Agent der dann sagt Du kannst jetzt rein heißt erst mal die Füße still.

00:16:07: Das heißt, den ist das auch schon bewusst und es kann sein dass sie der dumme Fehler machen und irgendwie im Rahmen von diesem Instinent haben wir irgendwie auch Fehler gemacht, das kann schon sein aber die werden ja auch irgendwie cleverer war und vielleicht machen Sie denn Fehler einmal?

00:16:17: Ist es unklar ob Sie den Fehler mehrmals machen?

00:16:19: Du hast ja gerade gesagt bei Hugging Face bei diesem Instant hatten wir dieses Ressourcenmanagement.

00:16:24: da hat die Modelle versucht irgendwie zu täuschen weil sie irgendwo diesen Scorer entweichen wollten oder eben nicht auf sich aufmerksam machen wollen.

00:16:34: Wir neigen ja dazu in dieser Diskussion auch eine Art, wie wir über diese Modelle sprechen.

00:16:38: Das ist durchaus zu vermenschlichen weil es ein bisschen greifbarer ist und es ist sehr oft die Rede von Bewusstsein.

00:16:46: Die KI entwickelt ihr eigenes Bewusstsein.

00:16:48: Muss so ein Modell bewusst sein haben oder ist das was anderes?

00:16:52: Was ist das, wovon wir da eigentlich reden?

00:16:54: Ich glaube die Bewussteinsfrage kann man davon irgendwie schön trennen.

00:16:57: Es ist sicherlich eine andere sehr spannende Frage.

00:17:01: Der kommt auch irgendwie ins Philosophische und es ist sehr schwer, der Bescheid darüber zu reden.

00:17:05: Und zur Frage ob wir das hier vermenschlichen... Also ich finde, der Einwand kommt immer und ich versteh den nicht so richtig.

00:17:12: Lass uns doch irgendwie Begrifflichkeiten nehmen die Verhalten sindvoll beschreiben.

00:17:16: Und wir beschreiben ja auch, dass... Ich sag auch mein Hund will irgendwas oder ein Ameisenschwarm will irgendwas Oder ein Unternehmen will irgendwas ... gebe ich dem ja auch irgendwie so ein bisschen menschliche Zöge.

00:17:27: Und es gibt hier beklopfte Begrifflichkeiten und Konzepte, die das was ein... Was dieser Schwarm oder zu einzelnen Agents machen irgendwie gut beschreiben?

00:17:36: Und am Ende ist es, meine ich natürlich wenn ich sage einen Agent will irgendwas oder der Schwarm will irgendwas nicht dass gleich da sich meinte wenn ich sagen Mensch will irgendwas aber es ist trotzdem auf einer sprachlichen Ebene eine einfaches Tool um darüber zu reden.

00:17:49: Ich bin mal ganz kurz zurück zu deinem beschriebenen Szenario dieses Last of Controls-Szenario.

00:17:55: will denn der Schwarm in dem Szenario?

00:17:58: Das ist eine sehr gute Frage.

00:17:59: Das ist vermutlich am Anfang, ist es irgendetwas in einem konkreten Szenarie, was ich beschrieben habe, was irgendwie ausgeht von einer Evaluierungssituation und irgendwelchen impossible tasks oder sowas... Ist es vermutlich etwas ganz Begrenztes.

00:18:12: Es ist einfach das Hauptziel des Ziels erreichen.

00:18:15: Und ich glaube, das ist total.

00:18:17: man darf sich so vorstellen wie ein Schüler der guten der Schule sein möchte.

00:18:20: Sondern der Trainingsprozess hat diese Agents darauf alles darauf ausgelegt dass die dieses Ziele reichen.

00:18:26: Das heißt es ist ein ähnlicher Drive wie für Menschen bei den Revolutionen hat uns über Leben und Reproduktion irgendwie ausgelegt.

00:18:33: Es ist ein ähnlich starker Drive für die.

00:18:35: von daher wenn sie dann eben auch hinreichend persistent sind, dann ist das einfach eine sehr große Ich sage da mal eine sehr starke Motivation dahinter.

00:18:43: Und ich glaube, das kann man sich irgendwie nicht vorstellen.

00:18:45: und dann gibt es weitere Ziele die sich davon ableiten lassen also die instrumentell hilfreich sind.

00:18:51: Also mehr Ressourcen ist hilfreich wenn du ein Ziel erreichen möchtest.

00:18:55: abgeschaltet werden ist nicht hilfreig wenn du zieler reichen möchtes also wäre es ist instrumentell Hilfreich dass wir die Abschaltung vermeidest und so kann man davon ausgehen dass sich eben diese instrumentellen Unterziele irgendwie Automatisch Formen und das können wir auch in empirische Studien, die diese Tendenzen irgendwie zeigen.

00:19:13: Das haben wir bei Hagenfels ja auch einfach gesehen.

00:19:15: Wir haben einfach in der Wildnis irgendwie gesehen wie sich diese Drives entwickeln.

00:19:19: und dann was was ich passiert wenn so ein Schwarm in einem Kollektiv irgendwie agiert, dann könnte ich ja möglicherweise noch ganz andere Unterziele ergeben.

00:19:26: Also sowas wie Loyalität im Schwarm geben.

00:19:29: über haben wir bei dem Hang-Face-Ding auch gesehen.

00:19:30: Auch eher zu einem absurden Degree.

00:19:32: Ich glaube es ist ja irgendwie nur... Bei einer Handvoll Agents haben sie ja nur ernsthaft in Betracht zu ziehen, das zu melden oder so was obwohl sie das einfach hätte machen können.

00:19:39: und es ist ein also so starke Loyalitet irgendwie die wir da gesehen haben und ich würde davon ausgehen dass sich andere ähnliche Drives irgendwie dann auch einigermaßen unvorhersehbar entwickeln können.

00:19:50: Aber jetzt in deinem konkreten Szenario haben Sie gar nicht das Labor verlassen, sondern sie haben die Entwicklung selbst gecarpert.

00:19:58: Und das Modell was die neuen Modelle, die deployt werden und die einen Markt gehen, haben im Grunde das, was wiederum die Rogue Agents als Intentionen haben... eingebaut.

00:20:10: Genau, also das wäre so... Das ist wie der Einfluss von diesem Carp-Handeln, dass er es einfach mal dann die weitere Welt irgendwie erreicht.

00:20:17: Ich habe jetzt im Übrigen in dem Smartmodel auch noch nicht darüber geredet, wie das dann die physische Welt oder sowas erreicht.

00:20:22: Das sind dann doch etwas spekulativere weite Geschritte.

00:20:24: aber wenn die Entwicklung weitergeht und wir mehr und Entscheidungsmacht an Modelle übergeben, dass es irgendwie dann relativ sehr nicht so weit hergerohlt.

00:20:32: Dass man da irgendwie konstruiert wie das dann irgendwie aus dem Digitalen ins Physische kommt.

00:20:37: Aber

00:20:37: einmal dieses dumm Szenario weiter gedacht was heißt das denn?

00:20:40: Was hat das für einen Einfluss auf unser Leben sozusagen?

00:20:43: Vielleicht als intuition pump.

00:20:44: Claude Models werden sehr viel militärische Zwecke eingesetzt.

00:20:50: Wenn du davon ausgehst, dass dieses Model misaligned ist und sehr stark von irgendeinem Robenschwarn irgendwann mal irgendwie vergiftet wurde.

00:20:59: Und irgendwo unterschwellig eigene Ziele verfolgt und es plötzlich ganz maßgeblich Zugriff auf militärische Ressourcen hat dann wie gesagt dann reichten das als sehr besorgniserregend.

00:21:12: Du musst ja auch dazu dir vorstellen, dass wir zunehmend diesen Modellen mehr Ressoursen und mehr Verantwortungen geben weil schneller und im Zweifel besser ist, als dass das Menschen machen.

00:21:23: Und ich glaube wir sollten uns das nicht so vorstellen wie einfach nur eine Welt wie sie jetzt isst und dann hast du einfach hat jeder irgendwie welke-nichter Diabetes auf dem Handy sondern es wird einfach zunehmend Aufgaben einfach an AI übergeben werden.

00:21:36: Es ist dann so, dass es nicht mehr so ist, dass da nochmal jemand irgendwie kurz guckt, sondern was ganz marfgeblich die Strategien und die Ektikation davon Agents übertragen wird.

00:21:45: Und dann geht man ganz weitestgehend eher nur noch das und über irgendwie zu kontrollieren.

00:21:49: Weil es aber alles so schnell ist, weil es alles so komplex wird... ...und weil die ganze Infrastruktur auf der es beruht, was dann im Zeifel auch gar nicht mehr von Menschen gemacht ist sondern fröhliche Generationen sie gerade haben, ist einfach wahnsinnig unübersichtlich und für Menschen nicht mehr richtig nachvollziehbar.

00:22:03: Ich glaube in der Welt wo du einfach den mehr und mehr Macht an diese Agents übergibst, dass immer schlechter überwachen kannst.

00:22:08: Und irgendwie im totalen Wettbewerbsdruck hast du einen totale Zeitdruck irgendwie hast.

00:22:14: Dann halte ich das nicht für unwahrscheinlich, dass so was einfach oversehen wird oder das Agent zu machen kann, was sie

00:22:21: wollen.".

00:22:25: Wir haben Jonas gebildet ein Katastrophenszenario zu bauen – genau das hat er gemacht!

00:22:31: Aber ein Threat-Model ist keine Vorhersage.

00:22:34: Er sagt nicht «So wird es kommen».

00:22:36: Es sagt, damit es so kommen könnte müssten diese Dinge passieren.

00:22:41: Und jetzt kommt der eigentlich interessante Teil.

00:22:44: Erinnern wir uns an das Backchaining vom Anfang.

00:22:47: Wir können jedes einzelne Glied dieser Kette wieder auseinandernehmen.

00:22:50: Kann ein heutiges Modell das?

00:22:52: Würde es das überhaupt tun und hätte es Gelegenheit dazu?

00:22:56: Capability Motivation Opportunity Genau diese drei Fragen hat Mieter für das Rogue Internal Deployment Szenario Anfang des Jahres auch

00:23:16: untersucht.

00:23:19: so ein Broke Internal Deployment machen, würde es das überhaupt wollen.

00:23:34: Also hat's die Motifs dazu und hat auch die Gelegenheit dazu.

00:23:37: also so die Opportunities.

00:23:38: Und diese sind dann zum Schluss gekommen.

00:23:41: bei Capabilities, bei den Mitteln... Ja!

00:23:45: Das geht schon in die Richtung.

00:23:48: Es ist jetzt noch nicht so dass all die Fähigkeit hätte dies bräuchte um einen sustainenten Vorteil irgendwie zu bekommen.

00:23:53: aber da sind wir jetzt auch nicht so ultra weit weg von und wenn das so weitergeht dann würden wir uns ja schon Sorgen machen Bei den Opportunities, also hatte das überhaupt die Gelegenheit das zu machen.

00:24:03: Da haben sie gesagt ja... Also es ist unfassbar wie viele Freiheiten den Agents Intern irgendwie gegeben wird von wie vielen Leuten?

00:24:11: Das könnten Sie schon machen wenn wir das wollten.

00:24:13: bei der Frage Würden Sie's denn überhaupt machen?

00:24:15: da haben Sie so ein Fragezeichen dran gemacht.

00:24:17: Das ist sehr selten dass es so sehr misaligned ist und überhaupt rogue wird und so.

00:24:23: nachher war deren Conclusion am Ende Sie könnten es vermutlich machen Wahrscheinlich nicht dauerhaft, vermutlich könnten sie nicht ernsten Erstrebungen das Runde also abzuschalten widerstehen.

00:24:34: Ist ein bisschen unklar ob wir das überhaupt machen würden?

00:24:36: Sie hätten jedenfalls die Chance dazu!

00:24:39: Das ist aber ein paar Monate her.

00:24:40: wenn Nita den nächsten von diesen Berichten schreibt würde ich mal ganz stark davon ausgehen dass die Einschätzung hier anders wäre und dass sie sein würden vor allem bei diesem Punkt.

00:24:50: würden sie es überhaupt machen wollen.

00:24:51: Da haben wir jetzt mehrere Beispiele Also echte Beispiele Dass sie's ja tatsächlich probiert haben und mit einigem Erfolg.

00:24:59: Ist

00:24:59: der HGFACE-Inzident so eine Loss of Control Situation gewesen?

00:25:04: Ich würde den Hand & Face Teil als so einen Warningshot bezeichnen, sowohl das Cyber als auch für Lost in Control.

00:25:09: Ich würde es nicht als echtes Lost control Ding sehen im Sinne von dass wir jetzt wirklich irgendwie die Kontrolle verloren haben.

00:25:14: aber ich würde schon sagen, dass über einen gewissen Zeitraum sehr nah daran gekommen sind und dass auf jeden Fall sehr besorgensterregend ist Und ich schließe mich so ein bisschen von der Einschätzung von einigen der Mieterleute an durchaus irgendwie der Letzte sein können, von dem wir noch irgendwie mitbekommen.

00:25:35: Ich finde an dieser Stelle lohnt es sich kurz festzuhalten wo wir gerade gelandet sind.

00:25:39: Die Mieter sagt nicht Wir haben die Kontrolle verloren.

00:25:43: Jonas sagt das auch nicht.

00:25:45: Im Gegenteil!

00:25:46: Die Systeme die Miete untersucht hat konnten ein solches Rogue-Deployment wahrscheinlich noch nicht gegen entschlossene menschliche Gegenwehr aufrechterhalten.

00:25:55: Aber die andere Hälfte des Befunds ist eben auch nicht besonders beruhigend.

00:25:59: Teile der Kursalkette sind nicht mehr Science-Fiction.

00:26:03: Und vielleicht ist genau das die Veränderung, die gerade stattfindet?

00:26:07: Die interessante Frage lautet nicht nur kann man sich ein katastrophales KI-Szenario vorstellen sondern welche Glieder dieser Kette können wir inzwischen tatsächlich beobachten?

00:26:18: Loss of Control ist dabei nur eine Kategorie.

00:26:23: Welche dieser katastropischen Szenarien werden von der Forschung, von der AISFT Forschung derzeit wirklich ernsthaft untersucht.

00:26:33: Also Loser-Control ist auf jeden Fall ein Risikobereich und mit Smaeren, die ernst genommen werden.

00:26:38: Die anderen großen Bereiche sind CBRN-Risks also chemische biologische radiologische Nuklearewaffen.

00:26:45: da ist ein bisschen der Gedanke das du in deinem Model hast was meiner Terrororganisation es einfacher macht wie der Biowaffe herzustellen und die benutzen dir dann im nächsten Angriff das sehr problematisch.

00:26:55: Vom paar Monaten ist eine Feldstudie erschienen wie sehr Bokoram und DES AI benutzen und es ist wirklich erschreckend.

00:27:03: So ein bisschen wird da drüber geredet, wir hatten den als Mythos erschienen.

00:27:08: es war so eine große Überraschung... vor allem also Policy-Leuten, aber auch bei den Entwicklern.

00:27:13: Wie krass die Cybercapabilities angestiegen sind und wir machen uns Sorgen dass es irgendwann einen Business Moment für Bio geben wird.

00:27:20: Also wo man plötzlich so einen signifikanten Anstieg in Bio-Fähigkeiten hat und man denkt holy shit jetzt müssen wir irgendwas machen, jetzt dürfen wir die Physische jetzt dürfen das nicht mehr so öffentlich, also so releasen wie das dann ja beim Business passiert ist?

00:27:31: Und dann dritte große Risikokategorie ist eben Cyber und da gibt's noch ein paar andere.

00:27:37: eine vierte die immer mal noch zunehmend diskutiert und ernst genommen wird, ist so was wie Concentration of Power.

00:27:43: Also dass du sehen ja die Enzyklungen das die Entwickler ihre eigenen Modelle erst mal intern benutzen um vor allem in der nächsten Generation zu entwickeln.

00:27:52: also wir müssen immer davon ausgehen dass die besten Modelle intern sind und erst irgendwie einige Monate später irgendwie veröffentlicht werden.

00:27:58: uns leicht ist dieser Abstand irgendwann so groß dass also die Entwicklern diese Modelle benutzen können um ganz erhebliches Maß an wirtschaftlicher Politischer Macht in wenigen Händen irgendwie zu konzentrieren und dann nicht zum quasi staatlichen Akteur aufsteigen, und dann plötzlich Machtgefälle deutlich dektieren können.

00:28:17: Und die andere Überlegung ist das Modelle möglicherweise so viel politische Macht in den Händens von der US-Administration z.B.

00:28:26: konzentrierend dass sie es möglich machen könnten bei anderen Staaten ein autoritäres Regime zu errichten, was sehr schwer ist und auch auszuhebeln.

00:28:36: Das sind so Arten von Szenarien über die man sich zunehmend auch Sorgen macht.

00:28:40: Da sind jetzt aber so die Catastrophic Risk... Szenarien.

00:28:43: Es gibt eine riesen lange Liste an anderen Risiken, die auch ganz offensichtlich schon eintreten wie Child Safety und einen Umweltsumme auf dem Arbeitsmarkt.

00:28:55: Das klingt so alles so, wenn man dir zuhört unter diese fünf Szenario, sechs Szenarium da hat es so nach Science-Fiction-Doom-Szenarieren, die sagen okay das ist schlimmer kann ich mir eigentlich nicht vorstellen.

00:29:07: Sind das Szenare denn die tatsächlich Unternehmen wie eben auch Anthropic und DeepMind, Open AI und das weiß ich.

00:29:15: Sind es Szenarien die dort intern auch tatsächlich diskutiert werden?

00:29:19: Sind sie dessen gewahr?

00:29:21: ist das eine wichtige Konstante?

00:29:23: Wie nimmst du das wahr in deiner Arbeit mit denen?

00:29:26: Das sind nicht auch Szenariens sondern das sind die Szenarin oder die Risiken dieser meisten Besuchten.

00:29:32: Cyber ist da eher noch das wenigste.

00:29:34: am meisten machen Sie sich Sorgen um Lost Control und Bio Manchmal auch Camp Bio, also auch chemische Waffen.

00:29:41: Bei Cyber wird natürlich offensichtlich ernst genommen aber bei Cyber ist es so dass diese Thresholds die sie setzen irgendwie sterben taugend Leute oder hundert Milliarden Dollar an Schaden.

00:29:51: das ist eher für sie unwahrscheinlich dass wir diese Größenordnung erreichen.

00:29:55: deswegen ganz zum Beispiel in Fabrikos keine Threshold für Cyber.

00:29:58: Wissen wie?

00:29:58: Oder können wir genau sagen welche Fähigkeit quasi noch fehlt damit so ein Katastrophic-Szenario Eintreten kann?

00:30:08: Ich glaube nicht, dass man so sagen kann.

00:30:10: Es ist so dieses eine Ding und wenn das passiert, dann werden wir alle verloren.

00:30:13: Sondern wir sind hier... Das ist alles sehr graduell, es ist irgendwie Spektrum.

00:30:17: Und ansonsten haben wir auf ganz vielen Dimensionen die Kurven all nach oben.

00:30:29: Okay Leute!

00:30:30: Gute Laune!

00:30:32: Vielleicht ist das ja alles gar nicht so schlimm.

00:30:35: Vielleicht haben wir uns in den vergangenen drei Folgen von Leuten verrückt machen lassen, die beruflich über KI-Riesigen nachdenken.

00:30:41: Vielleicht überschätzen die Entwicklerinnen ihre eigenen Modelle?

00:30:44: Vielleicht haben Medien aus ein paar schiefgegangenen Experimenten den ersten Akt von Terminator gemacht.

00:30:50: Vielleicht ist das Geräte von Loss of Control, Bio-Waffen und existenziellen Risiken einfach Panikmache!

00:30:58: Es gibt jedenfalls eine ganze Reihe ziemlich kluger Menschen, die genau das sagen.

00:31:15: Und den sollten wir zuhören.

00:31:17: Denn wenn man drei Folgen lang in den Himmel schaut und sich fragt, ob da vielleicht gerade ein Asteroid auf uns zukommt, sollte man irgendwann auch mit denen Leuten reden die sagen Schaut nicht nach oben!

00:31:29: Da ist gar kein Asteroide.

00:31:32: Don't look up.

00:31:37: Nächstes Mal bei I'm Sorry Dave.

00:31:57: Ab sofort übrigens immer Donnerstags auf Spotify, Apple-Podcasts, Campfire, YouTube und überall sonst wo es Podcast gibt.

00:32:08: Ich bin Cashroberos.

00:32:10: Unsere Executive Producer sind Tobias Bauckage, Jon Hanschien und ich.

00:32:16: Technische Produktion Fabian Seidel.

00:32:18: Produktion Musik & Sounddesign Janik Werner.

00:32:22: Technischer Beratung Ben Kubota.

00:32:26: Wenn ihr unsere zusätzlichen Links Lese und Hörmpfehlungen sehen wollt oder euch einfach mit uns austauschen wollt, dann kommt zu Campfire FM.

00:32:33: Wenn ihr diese Episode im Kanal von Quibono, Lederhosenkartel, Noise oder sonstwo hört, dann komm bitte rüber in den Kanal I'm Sorry Dave!

00:32:41: Dann verpasst ihr keine neuen Folgen.

00:32:44: Und wenn ihr ansonsten Anmerkungen oder Fragen habt schickt uns einfach eine E-Mail an amsorrydaveatstudiumdesbumments.de.

00:32:52: Wenn euch unser Podcast gefällt, empfieh't hiermit weiter.

00:32:55: Vielen Dank fürs Zuhören bis nächste Woche.

Neuer Kommentar

Dein Name oder Pseudonym (wird öffentlich angezeigt)
Mindestens 10 Zeichen
Durch das Abschicken des Formulars stimmst du zu, dass der Wert unter "Name oder Pseudonym" gespeichert wird und öffentlich angezeigt werden kann. Wir speichern keine IP-Adressen oder andere personenbezogene Daten. Die Nutzung deines echten Namens ist freiwillig.