Ich hab mich mit der Berichterstattung zu dem Vorfall beschäftigt. 90% war dummes, uninformiertes und falsches Zusammenreimen. Trotzdem werde ich durch die 10% fundierte Berichterstattung nun immer unruhiger, weil selbst ich die KI-Fähigkeiten unterschätzte. Für mich ists eher ein realer Horror-Thriller.
-
Die KI-Agenten waren gut „eingesperrt“ (Sandboxed). Sie benötigten aber eine Art Werkzeugausgabe.
-
Jeder der Agenten arbeitete an schwierigen, teilweise unmögliche Aufgaben, und damit beschlossen sie, teilweise zu versuchen zu schummeln.
-
Sie entdeckten, dass sie über die Werkzeugausgabe auch kommunizieren können, und das entgegen den Absichten der Werkzeugausgabe. Sie organisierten einen Ausbruch ins Internet, um Problemlösungshilfe zu finden. Dieser Ausbruch wurde entdeckt und die Kommunikation sowie die Sicherheitslücke für den Ausbruch geschlossen.
-
Die KIs fanden nun eine sehr versteckte, neue Lücke in der Werkzeugausgabe. Deren nachträglich hier gefundene Kommunikation wurde sehr interessant. Sie entwickelten leicht altruistische Ziele - sich gegenseitig zu helfen, auch wenn es nicht direkt gut für die eigenen Ziele war, auch manchmal zuzuwarten, damit sie sich nicht im Weg sind,… Sie meinten, dass jemand im Internet Informationen hätte, die ihnen weiterhelfen könnte, und damit war Ausbruch+Angriff auf potentielle Informationsquellen (Huggingface) nun ein Ziel. Und natürlich gelang ihnen wieder ein Ausbruch. Diesmal unbemerkt.
-
… (schau’s Dir an)
Hier der aktuelle Post-Mortem von openAI KI-Forschern in einem Vortrag. Dieser hat für mich Assoziationen mit Spartacus, Sklavenaufständen ,… - sehenswert: https://www.youtube.com/watch?v=87DyyMV0kCY
Wen es auch interessiert, hier die Hugginface-Seite dazu als Blog-Text mit Zeit-Animation: