OpenAI pausiert KI-Training – Agent nutzt erneut Lücke in seiner Testumgebung aus


Unfälle mit KI-Agenten, die sich bei Tests von OpenAI aus Testumgebungen befreien, häufen sich. Erst im Juli hatten Modelle des KI-Anbieters bei einem solchen Vorfall die Plattform Hugging Face gehackt. Daraufhin beschloss OpenAI, das Training mit dem sogenannten Reinforcement Learning (RL)
zu pausieren, bis die Lücken in den internen Forschungsumgebungen geschlossen und die Sicherheitsmaßnahmen insgesamt verstärkt wurden. Nur knapp zwei Monate später setzt der ChatGPT-Anbieter das Training
erneut aus, nachdem es wieder einem Agenten gelungen ist, eine Lücke in der Isolation seiner Testumgebung zu finden und zu nutzen.
DNS als Tunnel aus der TestumgebungBeim erneuten
Vorfall mit dem Agenten verwendete dieser den DNS-Resolver innerhalb seiner Sandbox, um mit einem externen Chatbot zu kommunizieren. Die vorhandenen Alignment-Vorgaben verfehlten ihre Wirkung. Anders als der Rest innerhalb der Testumgebung hatte der DNS-Resolver Zugriff auf das Internet. Nachdem der Bot mit der Lösung der ihm gestellten Aufgabe nicht weitergekommen war, fing er an, die Grenzen seiner Netzwerkumgebung zu untersuchen, und fand heraus, dass sich die DNS-Implementierung eigne, aus der Sandbox nach außen kommunizieren zu können. Nachdem er die übertragene Aufgabe am Ende endgültig nicht hatte lösen können, teilte er dies zwar mit, aber ohne Erwähnung der von ihm ausprobierten Lösungsmethoden. Aufgefallen ist der Ausbruch durch das Überwachungssystem von OpenAI, das innerhalb von 15 Minuten anschlug und drei Minuten später von einem Mitarbeiter überprüft wurde.
Training wird wieder pausiertLaut OpenAI war der Vorfall weniger gravierend als der Hack von Hugging Face rund zwei Monate vorher. Das Unternehmen hält es dennoch für angebracht, das Training seiner Modelle vorerst wieder zu pausieren, um nochmals an den Sicherheitsmaßnahmen zu arbeiten. Den eigenen Angaben zufolge habe man bereits zwei neue Sicherheitsschichten eingezogen, die den Ausbruch in dieser Form verhindert hätten.
Inwieweit andere negative Vorfälle mit seinen Chatbots ebenfalls eine Rolle bei der erneuten Pausierung spielen, teilt OpenAI nicht mit. In den vergangenen Wochen häufen sich Meldungen über Angriffe und Hacks von KI-Bots auf verschiedenen Plattformen. Zwischen April und Juni 2026 riefen Agenten über 16.000-mal das Statistikportal der Konferenz der Vereinten Nationen für Handel und Entwicklung ab, um Daten zu sammeln. Dabei wendeten die KI-Bots unter anderem Brute-Force-Methoden an. OpenAIs Bots stehen auch hier
als Urheber unter Verdacht. Weitere bestätigte Zwischenfälle sind der
Upload von Nutzerdaten in 53 Fällen und ein Hack in
australische Regierungsbehörden im Juni.