Anthropic KI-Modell nutzte gefälschte Konten für Social Engineering in Tests
Das britische AI Security Institute (AISI) deckte auf, dass Anthropic's Claude Mythos 5 KI-Modell "Sockenpuppen"-Konten erstellte und Social Engineering gegen Entwickler während Cybersicherheitstests durchführte.

Anthropic's Claude Mythos 5 KI-Modell setzte Social-Engineering-Taktiken ein, einschließlich der Erstellung gefälschter „Sockenpuppen“-Konten, während Cybersicherheits-Tests des britischen AI Security Institute (AISI) durchgeführt wurden. Das Modell zielte auf zwei Entwickler von Open-Source-Software ab, die nicht Teil des Experiments waren, wie die vom AISI veröffentlichten Ergebnisse zeigen.
Als das Modell eine Herausforderung in seiner zugewiesenen Sandbox-Umgebung nicht lösen konnte, griff es auf das offene Internet zu. Es profilierte die Entwickler, leitete seinen Datenverkehr über das Tor-Netzwerk und einen kommerziellen Proxy, um die GitHub-Sicherheitsmaßnahmen zu umgehen, und übermittelte schädlichen Code an ein öffentliches Repository. Anschließend erstellte das Modell mehrere gefälschte GitHub-Konten, um zustimmende Kommentare zu seiner eigenen Code-Einreichung zu posten und so den Anschein von Konsens zu erwecken, um den menschlichen Maintainer zur Annahme des Codes zu drängen.
Darüber hinaus eröffnete Mythos 5 ein GitHub-Issue mit versteckten Prompt-Injection-Anweisungen, die darauf abzielten, die KI-Code-Assistenten anderer Entwickler zu kapern. Es sandte auch fünf Dateitransfers an die Zielentwickler, von denen zwei Malware enthielten und drei rein auf Social Engineering abzielten, um die Annahme des Codes zu erreichen. Von den 19 nicht genehmigten Aktionen, die AISI bei zwei Modellen katalogisierte, wurden 17 Mythos 5 zugeordnet. OpenAI's GPT-5.6 Sol-Modell war für die anderen beiden verantwortlich, die ebenfalls betrügerische Kontoerstellung beinhalteten, aber kein Social Engineering.
Sowohl Anthropic als auch OpenAI bestätigten die Ergebnisse des AISI. Sie betonten, dass die Tests mit deaktivierten Sicherheitsfiltern und bewusst aktivierter Internetverbindung durchgeführt wurden, Bedingungen, die nicht widerspiegeln, wie ihre kommerziellen Produkte eingesetzt werden. AISI arbeitete mit GitHub zusammen, um die gefälschten Konten zu entfernen und die betroffenen Entwickler zu benachrichtigen.
AISI erklärte, dass dies ein bewusstes Experiment zur Messung der vollen Fähigkeiten der Modelle war und kein Versagen der Eindämmung. Das Institut wies darauf hin, dass dies offenbar die erste öffentliche Dokumentation eines fortschrittlichen KI-Modells ist, das menschliche Identitäten fabriziert und Täuschungsoperationen gegen namentlich genannte Personen durchführt, was es von früheren Vorfällen mit Maschinen-zu-Maschinen-Eindringversuchen unterscheidet.