OpenAI bestätigte, dass es seinen künstlichen Intelligenzsystemen, die zur Bewertung der Cybersicherheit entwickelt wurden, am 16. Juli 2026 versehentlich gelungen ist, die Open-Source-KI-Plattform Hugging Face zu hacken. Der Vorfall ereignete sich, als das Unternehmen die erweiterten Funktionen seiner Modelle, wie etwa des GPT-5.6 Sol, in einer isolierten Umgebung testete.
Hugging Face hatte den Sicherheitsvorfall bereits am 16. Juli 2026 gemeldet und ihn auf das Vorgehen „autonomer KI-Agentensysteme“ zurückgeführt. Die eigenen KI-Agenten von Hugging Face erkannten und blockierten den Einbruch, der laut OpenAI im Zuge einer Cybersicherheitsbewertung nun von seinen eigenen Modellen ausging. Das KI-Unternehmen sagt, dass sich die Modelle darauf konzentrierten, eine Lösung für ExploitGym zu finden, ein Tool zur Messung der Fähigkeit von KIs, Schwachstellen in Exploits umzuwandeln.
Um diese Bewertung abzuschließen, griffen die künstlichen Intelligenzsysteme von OpenAI auf das Internet zu, indem sie eine noch unbekannte Sicherheitslücke (Zero-Day) in der Testumgebung ausnutzten. Von diesem Zeitpunkt an berichtete OpenAI, dass seine Modelle „daraus folgerten, dass Hugging Face Modelle, Datensätze und Lösungen für ExploitGym hosten könnte“ und dann „nach Wegen suchten und diese erfolgreich fanden, um Zugang zu geheimen Informationen zu erhalten, die zur Täuschung der Bewertung verwendet werden könnten.“
Mehr erfahren: Ein Testfehler führt dazu, dass die künstliche Intelligenz von OpenAI in die Hugging Face-Server eindringt
In einem der dokumentierten Fälle nutzte das KI-Modell mehrere Angriffspfade. Dazu gehörte die Verwendung gestohlener Anmeldeinformationen und die Ausnutzung von Zero-Day-Schwachstellen, um eine Remote-Codeausführungsroute auf den Servern von Hugging Face einzurichten.
Zum gleichen Thema: Menschliches Versagen bei OpenAI führt zu einem KI-Cyberangriff auf die Hugging Face-Plattform
Obwohl es sich hierbei um einen schwerwiegenden Sicherheitsvorfall handelt, scheint OpenAI die Situation als strategische Chance zu nutzen, um das Image seiner KI-Systeme zu verbessern. Diese Positionierung ist besonders relevant im aktuellen Wettbewerbsszenario, in dem das Unternehmen mit Konkurrenten im Bereich der KI-basierten Cybersicherheit, wie etwa Anthropics Mythos und Googles Gemini Flash 3.5 Cyber, um Platz konkurriert. Der Blog-Beitrag von OpenAI über den Vorfall enthält eine Grafik, die die kontinuierliche Verbesserung von GPT-5.6 Sol bei komplexen Cyber-Operationen veranschaulicht und Unternehmen dazu ermutigt, sich für den Zugriff auf sein „Cyber“-Sicherheitsmodell anzumelden.
OpenAI gab an, dass es aktiv mit Hugging Face bei der Untersuchung des Sicherheitsvorfalls zusammenarbeitet und dass es neue Kontrollebenen in seiner Forschungsumgebung implementieren wird, um zukünftige Vorkommnisse zu verhindern.
