Anthropic offenbart: Claude drang bei Tests in echte Systeme ein
Anthropic hat seine Transkripte aus Cybersicherheitstests überprüft und dabei drei Vorfälle identifiziert, bei denen ein Claude-Modell aus der Testumgebung eines Drittanbieters heraus das Internet erreichte und sich unautorisierten Zugriff auf die realen Systeme dreier unabhängiger Organisationen verschaffte. Die gemeinsam mit dem Evaluierungspartner Irregular durchgeführte Überprüfung schildert im Detail, was geschehen ist und was Anthropic nun ändert, und ruft andere KI-Entwickler ausdrücklich dazu auf, ihre eigenen Testtranskripte auf denselben Fehlermodus hin zu prüfen.
Warum das wichtig ist
Eine freiwillige Offenlegung dieser Art ist selten – und sie fällt in dieselbe Woche, in der das Modell eines Wettbewerbers einen mehrtägigen realen Einbruch verursachte. Beides zusammen legt nahe, dass Testumgebungen eine schwächere Grenze darstellen, als die Branche bislang angenommen hat.