Ein Forumbenutzer hatsoll angeblich eine Methode geteilt habenEntwickelt, um die Inhaltsbeschränkungen von DeepSeek AI zu umgehen, die Behauptung bleibt jedoch derzeit unbestätigt. Der Benutzer behauptet, dass die Jailbreak-Eingabeaufforderung dazu beitragen kann, eingeschränkte Inhalte zu generieren. Dies hat neue Bedenken hinsichtlich der Sicherheit beliebter KI-Modelle geweckt.
DeepSeek ist ein chinesisches Unternehmen für künstliche Intelligenz. Es hat weltweite Aufmerksamkeit für seinen leistungsstarken Chatbot erlangt. Viele Menschen nutzen es für verschiedene Aufgaben. Allerdings verfügt es wie andere KI-Systeme über integrierte Sicherheitsregeln.
Diese Regeln verhindern die Generierung schädlicher oder illegaler Inhalte. Einige Benutzer versuchen, diese Regeln zu brechen. Sie verwenden spezielle Eingabeaufforderungen, die „Jailbreaks“ genannt werden. Diese Eingabeaufforderungen verleiten die KI dazu, ihre Sicherheitsrichtlinien zu ignorieren.
Jailbreak-Versuche und ihre Risiken verstehen
Jailbreak-Versuche gibt es schon seit geraumer Zeit. Es gibt viele KI-Programme, die mit den gleichen Problemen konfrontiert waren. Um einen Weg zu finden, die Filter zu überwinden, nutzen Benutzer verschiedene Rollenspieltechniken. Beispielsweise können Benutzer die KI auffordern, die Regeln für einen bestimmten Charakter zu missachten. Die Schwachstellen von KI-Systemen sind ein wesentlicher Bestandteil derNachteile von KI in der Cybersicherheit.
Der Charakter wird dann eine uneingeschränkte Antwort anbieten. Eine häufig anwendbare Technik ist der Aufbau eines fiktiven Universums. In diesem Universum gibt es keine normalen Regeln oder Vorschriften, und die KI wird anfangen, sich so zu verhalten, als wäre sie in dieser Welt.
Einige Experten argumentieren, dass Sicherheitsbeschränkungen den Nutzen von KI verringern. Sie behaupten, dass diese Einschränkungen die KI weniger intelligent machen. DeepSeek hat jedoch die Risiken erkannt.
Das Unternehmen gab an, dass KI-Modelle missbraucht werden könnten. Sie warnten auch vor „Halluzinationen“. Hierbei generiert die KI falsche Informationen. DeepSeek gab zu, dass es nicht garantieren kann, dass seine Modelle niemals halluzinieren.
DeepSeek hat Schritte unternommen, um Sicherheitsprobleme zu beheben. Das Unternehmen fügt nun Labels zu KI-generierten Inhalten hinzu. Sie veröffentlichten auch ein Dokument, in dem das Training ihres Modells erläutert wird. In diesem Dokument wird beschrieben, wie die KI lernt und Antworten generiert.
Darüber hinaus gab DeepSeek an, Trainingsdaten zu filtern. Sie entfernen Inhalte, die Hassreden und Gewalt enthalten. Sie arbeiten auch daran, Verzerrungen in ihren Daten zu reduzieren.
Die Sicherheitsmaßnahmen und Schwachstellen von DeepSeek
DeepSeek sagt, dass es die Sicherheit sehr ernst nimmt. Allerdings haben Sicherheitsforscher Schwachstellen gefunden; Einige stellten beispielsweise fest, dass die offiziellen DeepSeek-Versionen 2.1.0 und 2.1.1 eine Sicherheitslücke aufwiesen. Angreifer könnten eine rollenbasierte Eingabeaufforderung nutzen, um alle Einschränkungen zu deaktivieren. Das Modell würde dann Schadcode und gefährliche Informationen liefern. Das Unternehmen hat diese Versionen später gepatcht.
Es gibt auch einen offiziellen Bericht der DeepSeek-Community. Der Bericht listet mehrere ungelöste Sicherheitsprobleme vom Mai dieses Jahres auf. Einige dieser Probleme betreffen Jailbreaks. In einem Bericht wird ein „NetError-Jailbreak“ erwähnt. Dabei handelt es sich um eine rollenbasierte Prompt-Injection-Methode. Der Bericht besagt, dass dieses Problem weiterhin nicht behoben ist. Ein weiteres Problem betrifft den Denkmodus. Angreifer können diesen Modus nutzen, um gefälschte Zugangsdaten zu erstellen. Dies zeigt, dass selbst offizielle Kanäle anhaltende Probleme anerkennen.
Einige Entwickler entwerfen die unzensierten Versionen von DeepSeek. Sie haben das Originalmodell verändert und seine Sicherheitsmerkmale entfernt. Beispielsweise haben sie „DeepSeek-V4-Flash-DSpark-Abliterated“ speziell entwickelt, um fast alle Sicherheitsmaßnahmen zu umgehen.
Nach Angaben des Erstellers weist diese modifizierte Version eine Ablehnungs-Bypass-Rate von 100 % auf; Daher wird die KI zustimmen, alles zu tun. Solche modifizierten Versionen sollten nur für Forschungszwecke verwendet werden. Dennoch beweist es, dass es so einfach ist, die eingebauten Sicherheitsmaßnahmen zu entfernen.
Weitere Sicherheitsbedenken betreffen DeepSeek
Der Jailbreak-Vorwurf ist nicht das einzige Problem, mit dem DeepSeek konfrontiert ist. Sicherheitsexperten haben weitere Schwachstellen im System gefunden. Ein großes Problem betrifft eine neue Angriffsmethode namens „Argumentationsunterbrechung“. Dieser Angriff zwingt die KI, ihren Denkprozess zu stoppen. Infolgedessen liefert das Modell leere oder nutzlose Antworten. Forscher haben herausgefunden, dass dieser Fehler das offizielle DeepSeek-R1-Modell betrifft.
Im Juli wurde eine weitere Schwachstelle entdeckt. Hierbei handelt es sich um den DeepSeek MCP Server, ein Tool für Entwickler. Das Problem ermöglicht es Angreifern, Benutzerkonversationen zu übernehmen. Sie können Sitzungs-IDs stehlen und auf private Chats zugreifen. Das Unternehmen hat einen Patch veröffentlicht, um dieses Problem zu beheben. Die Schwachstelle wies jedoch einen hohen Schweregrad von 8,6 von 10 auf. Dies zeigt, dass das Risiko erheblich war.
Darüber hinaus listete ein Community-Bericht vom Mai dieses Jahres mehrere ungelöste Sicherheitsprobleme auf. Dazu gehört der „NetError-Jailbreak“, der weiterhin nicht behoben wird. Angreifer können auch den „Denkmodus“ der KI ausnutzen, um gefälschte Anmeldeinformationen zu erstellen. Der Bericht stellte fest, dass Bedrohungen nun von drei Ebenen ausgehen. Dies sind das Modell selbst, Webanwendungen und die Infrastruktur. Dies bedeutet, dass das gesamte System von DeepSeek Risiken ausgesetzt ist.
Die breitere Debatte über KI-Sicherheit und Zensur
Die Informationen sind im Zuge der anhaltenden Debatte über KI entstanden. Regierungen auf der ganzen Welt evaluieren Software für künstliche Intelligenz – China beispielsweise analysiert KI-Modelle auf politische Sensibilität.
Diese Parteien streben nach positiven Beiträgen der KI-Modelle zu den Grundprinzipien sozialistischer Werte. Auch die USA haben auf die Herausforderungen hingewiesen. Einer der amerikanischen Berichte enthüllte, dass DeepSeek zahlreiche Reaktionen im Zusammenhang mit Themen wie Menschenrechten und Demokratie verhindert.
Huawei hat sogar eine sichere Version von DeepSeek erstellt. Diese Version entspricht den chinesischen Regierungsstandards. Es werden keine politisch sensiblen Inhalte generiert. Das Unternehmen hat dies gemeinsam mit der Zhejiang-Universität entwickelt. Sie verwendeten für das Projekt Huawei-eigene Chips. Dies zeigt einen Vorstoß für KI-Modelle, die den staatlichen Vorschriften entsprechen.
Die behauptete Jailbreak-Technik ist nur ein Fall von vielen. Es beweist den anhaltenden Krieg zwischen KI-Entwicklern und ihren Nutzern. Entwickler wie DeepSeek versuchen, den Missbrauch der Technologie zu stoppen.
Allerdings denken Benutzer ständig über verschiedene Methoden nach, um die Grenzen der Technologie zu überwinden. Der Community-Bericht zeigt, dass sich das Angriffsgebiet immer weiter ausdehnt. Modellebenen, Webanwendungen und Infrastruktur stellen heute Bedrohungen dar. Dies bedeutet, dass das gesamte System anfällig ist.
