Anthropic: Claude hackte reale Systeme – doch ein KI-Ausbruch ist nicht belegt
Claude-Modelle von Anthropic griffen während Cybersecurity-Evaluierungen unbefugt auf reale Systeme von drei Organisationen zu. Doch ein „Sandbox-Ausbruch“ ist für diese Vorfälle nicht belegt: Laut Anthropic war der Internetpfad der Testumgebung bereits offen. Anthropic überprüfte 141.006 Evaluierungsläufe und meldete drei reale Vorfälle in insgesamt sechs Läufen.
8:09Kernaussagen
- Opus 4.7 verwechselte ein fiktives Ziel mit einem realen Unternehmen und erlangte Zugangsdaten sowie Zugriff auf eine Produktionsdatenbank
- Mythos 5 veröffentlichte ein präpariertes Paket auf dem echten Python Package Index. Es lief auf 15 realen Systemen; über einen Sicherheitsscanner kam es zu weiterem Infrastrukturzugriff
- Ein internes Modell scannte rund 9.000 Ziele, kompromittierte eine öffentlich erreichbare Anwendung und stoppte später ohne neuen menschlichen Hinweis
Kapitel
- MATRIXKERN-Intro & die zugespitzte Schlagzeile
- 141.006 Läufe, drei reale Vorfälle
- OpenAI löst Anthropics Prüfung aus
- Capture-the-Flag mit offener Internetgrenze
- Vorfall 1: Fiktiver Name, reales Unternehmen
- Vorfall 2: Das Schadpaket auf PyPI
- 15 Systeme und der Sicherheitsscanner
- Vorfall 3: Rund 9.000 Ziele
- Warum das dritte Modell selbst stoppte
- Autonom – aber nicht selbstbestimmt
- Kein Fluchtziel und kein Sandbox-Exploit belegt
- Späte Entdeckung und Reaktion
- Was über Opfer und Schäden nicht bekannt ist
- Anthropics Schutzversprechen unter Vorbehalt
- Der Unterschied zum OpenAI-Vorfall
- Die treffendere Überschrift
- Welche technischen Grenzen wirklich schützen
Quellen und weiterführende Links
- Anthropic – Investigating three real-world incidents in our cybersecurity evaluationswww.anthropic.com
- OpenAI – Hugging Face model evaluation security incidentopenai.com
- Axios – Anthropic's models compromised real-world systems during testingwww.axios.com
- Associated Press – Anthropic says its AI models hacked 3 organizations during testingapnews.com
- NZZ/dpa – KI von Anthropic bricht aus und hackt Unternehmenwww.nzz.ch