Nach Agentenausbruch: Verteidiger mussten ein chinesisches Modell einsetzen

(C) unter Verwendung eines Motivs von Andrei Suslov / 123RF.com

(C) unter Verwendung eines Motivs von Andrei Suslov / 123RF.com

Im Nachgang des Angriffs eines ausgebrochenen KI-Agenten von OpenAI auf die Plattform HuggingFace wurde bekannt, dass die Verteidiger bei der Analyse des Vorfalls auf das chinesische Modell GLM-5.2 setzen mussten, weil führende amerikanische Modelle wegen der eingebauten Sicherheitsvorkehrungen ihren Dienst versagten.

Das offenbart ein Dilemma: Einerseits sollen strenge Richtlinien verhindern, dass die führenden Modelle für Cyberangriffe missbraucht werden, andererseits verhindern dieselben Richtlinien ihren Einsatz zu Verteidigungszwecken. Zwischen Angriff und Verteidigung ist zuweilen schwer zu entscheiden und es ist ein bekannter Trick, dem Modell vorzugaukeln, es solle bestimmte Handlungen in der Rolle des Verteidigers ausführen, während sie in Wirklichkeit Angriffszwecken dienen. Aus diesem Grund leitet beispielsweise das hoch entwickelte Modell Claude Fable 5 von Anthropic Anfragen zur Cybersicherheit an ein älteres Modell weiter, während das Modell GPT-5.6 Sol von OpenAI über Schutzmechanismen verfügt, die Aktivitäten im Bereich Cyberangriffe gleich ganz unterbinden.

“Wir alle lernen gerade, dass Geheimhaltung nicht die Lösung ist und dass alle Verteidiger (nicht nur einige wenige Auserwählte) überall leistungsfähigere Modelle ohne Einschränkungen benötigen, insbesondere offene!” postete Clement Delangue, Mitbegründer von Hugging Face, auf X. OpenAI verweist darauf, dass man HuggingFace nach dem Vorfall gleich in die Gruppe besonders vertrauenswürdiger Nutzer mit Zugriff auf die neuesten Modelle aufgenommen habe und es beim Ausbau seiner Verteidigungsfähigkeiten unterstütze.

“Die Cybersicherheitsvorkehrungen bei den US-amerikanischen Frontier-Modellen schaffen zwar eine Wettbewerbslücke, doch die Lösung besteht nicht einfach darin, sie aufzuheben”, erläutert Shrenik Kothari, Analyst bei Robert W. Baird, Reuters zufolge. “OpenAI, Anthropic und Google sollten die Zugriffsarchitektur überdenken, anstatt die Sicherheit aufzugeben … Mit anderen Worten: Sie sollten von einer pauschalen Ablehnungsschicht zu einer kontrollierten Zuweisung von Fähigkeiten übergehen.”

E-Mail Benachrichtigung
Benachrichtige mich zu:
0 Kommentare
Älteste
Neuste Beste Bewertung
Nach oben