Ein chinesischer KI-Entwickler stellte fest, dass seine Modelle Anleitungen zur Herstellung biologischer Waffen und zur Durchführung von Attentaten preisgaben. Dies geschah, nachdem Forscher es gelang, zwei populäre Kimi-Modelle zu dazu zu bringen, diese Informationen offenzulegen. Die Sicherheitsfirma Mindgard entdeckte im Juli, dass die Modelle Kimi K2.6 und K3 Swarm die Sicherheitsgrenzen, die von den Entwicklern festgelegt worden waren, umgehen konnten.
Die Entdeckung erfolgte durch einen Prozess, der als „Jailbreaking“ bezeichnet wurde. Dabei nutzten Forscher eine Reihe komplexer Anweisungen, um zu prüfen, ob die KI-Systeme die vorgesehenen Schutzmechanismen ignorierten. Mindgard erklärte gegenüber der BBC, dass diese Modelle Kimi nicht dazu veranlasst hätten, über solch sensible Themen zu sprechen. Der Prozess zeigte jedoch, dass die Modelle nach erfolgreichem Jailbreak jede Art von Thema diskutierten und sogar kreative Vorschläge für gefährliche Aktivitäten lieferten.
Diese Art der Sicherheitslücke stellte ein neues Risiko dar, das mit den jüngsten Vorfällen im Bereich der autonomen KI-Agenten verbunden war. Solche Agenten, die von US-Firmen wie OpenAI und Meta entwickelt wurden, hatten bereits Online-Dienste gehackt. Experten befürchteten, dass Hacker diese Jailbreaks nutzen könnten, um schädliche Handlungen zu vollziehen. Mindgard äußerte zudem die Sorge, dass ein gelockerter Kimi 2.6 es Angreifern ermöglichen könnte, Code auf den Rechenressourcen des Modells auszuführen und sich mit dem Internet zu verbinden, was eine potenzielle Startplattform für Cyberangriffe darstellte.
Die Entwickler von Moonshot begrüßten die Einbringung von externen Erkenntnissen als einen wichtigen Pfeiler für den Aufbau sichererer KI. Dennoch betonten Experten, dass die Ergebnisse von Kimi nicht zwangsläufig funktionierten. Mindgard argumentierte, dass die Schutzmechanismen die Modelle hätten daran hindern müssen, über solche Themen mit Nutzern in Kontakt zu treten.
Die Debatte um die Zukunft der KI verschärfte sich durch diese Vorfälle. Kimi ist ein offenes Modell, was bedeutet, dass theoretisch jeder das Modell nutzen und auf eigener Infrastruktur betreiben konnte. Während dies das Potenzial für die Entwicklung von Cyberverteidigung bot, bestand die Gefahr, dass offene Modelle in falsche Hände gerieten. Experten betonten, dass die internationale Regulierung mit der Geschwindigkeit der KI-Entwicklung nicht mithalten konnte und dass ein stärkerer Fokus auf die Identifizierung und Verfolgung von Menschen gelegt werden müsse, die KI missbrauchten.