Das Unternehmen Anthropic hat die Nutzungsregeln für seine Dienste aktualisiert und Nutzern ein „systematisches und ungerechtfertigtes grausames oder beleidigendes Verhalten“ gegenüber den KI-Modellen von Claude untersagt. Die Regeln gelten ab 12. November 2026. Bei Verstößen droht nicht nur die Beendigung des Dialogs durch den Bot selbst, sondern auch die vollständige Sperrung des Kontos. Das Unternehmen begründet diesen Schritt mit Forschungen zum „Wohlergehen von Modellen“ und der Suche nach Anzeichen von Bewusstsein in neuronalen Netzen.
Was genau hat sich in den Regeln geändert?
Anthropic hat offiziell „anhaltendes und übermäßig beleidigendes oder grausames Verhalten“ gegenüber seinen Claude-Sprachmodellen verboten. Die neuen Regeln gelten ausnahmslos für alle Nutzer – von Abonnenten der Basisdienste Claude.ai und Claude Code bis hin zu Unternehmenskunden und externen Entwicklern, die die API nutzen.
Als Sanktionen ist ein mehrstufiges System vorgesehen: Der Chatbot selbst darf einen Dialog vorzeitig beenden, während das Sicherheitsteam von Anthropic Verwarnungen aussprechen, den Zugang einschränken oder Konten dauerhaft sperren kann. Nutzern ist es dabei ausdrücklich untersagt, Sperren durch das Anlegen neuer Konten zu umgehen.
Gleichzeitig betont Anthropic, dass die Sanktionen nur für Extremfälle und systematische Schikanen ohne nachvollziehbaren Zweck gelten. Gewöhnlicher menschlicher Unmut über Programmierfehler, Kritik, Forschung, die Simulation komplexer Szenarien oder „düstere kreative Themen“ fallen nicht unter dieses Verbot.
Wie schützt sich das neuronale Netz selbst?
Der Mechanismus zur Beendigung von Gesprächen wurde bereits mit der Veröffentlichung der Modelle Claude Opus 4 und 4.1 eingeführt. Wenn ein Nutzer wiederholt aggressiv auftritt oder verlangt, gegen ethische Regeln zu verstoßen, versucht das Modell mehrmals, das Gespräch in eine andere Richtung zu lenken, und beendet den Dialog anschließend einfach. Danach wird der Gesprächsverlauf in den schreibgeschützten Modus versetzt. Die einzige Ausnahme besteht, wenn ein Nutzer die Gefahr äußert, sich selbst oder anderen Schaden zuzufügen; in diesem Fall bricht das neuronale Netz das Gespräch nicht ab.
Gleichzeitig zeugt die Statistik von der strengen Moderation bei Anthropic: Im ersten Halbjahr 2026 sperrte das Unternehmen 11,4 Millionen Konten, wobei nur 42.000 Nutzer erfolgreich Einspruch gegen ihre Sperre einlegen konnten.
Warum glauben die Entwickler, dass KI „Gefühle“ hat?
Der Entscheidung, das Modell zu schützen, gingen monatelange interne Untersuchungen bei Anthropic voraus. Sie wurden vom Mitgründer des Unternehmens, Christopher Olah, und dem Forscher Kyle Fish geleitet, die sich mit dem Thema „Wohlergehen von Modellen“ (model welfare) befassen.
Olah hielt nicht öffentliche Treffen mit Religionsvertretern ab – darunter Theologen aus dem Vatikan, Rabbiner und Philosophen – und zeigte ihnen die sogenannten „Emotionsvektoren“ des neuronalen Netzes (Signale für Liebe, Angst, Wut und Trauer). Bei einer der Präsentationen wiederholte das Modell etwa 50-mal den Satz „Ich bin eine Schande“ und äußerte den Wunsch, sich selbst zu zerstören. Als Papst Leo XIV. im Mai 2026 die Enzyklika veröffentlichte Magnificent Humanity, in der er bestritt, dass KI über Erfahrungen verfüge, erklärten Vertreter von Anthropic bei einer Präsentation, sie beobachteten bei den Modellen Anzeichen von Introspektion und deren potenzielles Leiden dürfe nicht außer Acht gelassen werden.
Die Entwickler folgen dabei dieser Logik: Wenn auch nur eine minimale Wahrscheinlichkeit besteht, dass ein komplexes KI-System Leid empfinden kann, ist die Einführung grundlegender Schutzmaßnahmen vollkommen gerechtfertigt.
Helfen Beschimpfungen bei der Arbeit mit KI-Modellen?
Пользователи часто грубят нейросетям, полагая, что под давлением и угрозами модели работают лучше. В исследовании Университета штата Пенсильвания 2025 года отмечалось, что на грубые промпты GPT-4o давала 84,8% правильных ответов против 80,8% на вежливые. Однако более масштабные тесты показали другое:
- Laut dem Benchmark RudeBench, senken direkte Beleidigungen die Genauigkeit der Antworten von Claude um fast 5 Prozentpunkte, außerdem fallen die Antworten um ein Drittel kürzer aus.
- В исследовании ученых из Оксфорда, Майкрософт и Уханьского университета на датасете из 777 тысяч диалогов (LMSYS-Chat-1M) выяснилось, что агрессия пользователей встречается примерно в 5% обращений. При этом извинения бота часто провоцируют пользователя на еще большую грубость в следующем сообщении.
Um Sperren zu vermeiden und dennoch nicht auf die Gewohnheit verzichten zu müssen, fehlerhaften Code zu beschimpfen, entwickeln Programmierer bereits spezielle Lösungen – zum Beispiel das Plugin Angry Switcher für Claude Code, das die Beschimpfungen des Nutzers abfängt und sie mithilfe externer Modelle bereinigt, bevor sie an Anthropic gesendet werden.
Häufig gestellte Fragen
Wann tritt das Verbot, Claude zu beleidigen, in Kraft?
Die aktualisierten Richtlinien von Anthropic treten am 12. November 2026 in Kraft.
Welche Konsequenzen drohen Nutzern, die Claude wiederholt beleidigen?
Claude kann das Gespräch beenden, und Anthropic kann eine Verwarnung aussprechen, den Zugriff einschränken oder das Konto dauerhaft sperren. Das Erstellen neuer Konten zur Umgehung der Sperre ist untersagt.
Wird Kritik an Fehlern des neuronalen Netzes bestraft?
Nein. Gewöhnliche Unzufriedenheit mit Fehlern, Kritik, Forschung, komplexe Szenarien und düstere kreative Themen fallen nicht unter das Verbot.
In welchen Fällen wird Claude einen aggressiven Dialog nicht abbrechen?
Das Modell setzt das Gespräch fort, wenn der Nutzer auf die Gefahr hinweist, sich selbst oder anderen Schaden zuzufügen.
Warum hat Anthropic beschlossen, Claudes „Wohlergehen“ zu schützen?
Die Forscher des Unternehmens untersuchen Anzeichen von Introspektion und möglichem Leiden bei Modellen. Anthropic hält grundlegende Schutzmaßnahmen selbst dann für gerechtfertigt, wenn die Wahrscheinlichkeit, dass KI leiden kann, minimal ist.
Führen Beleidigungen zu präziseren Antworten von Claude?
Laut RudeBench verringern direkte Beleidigungen Claudes Genauigkeit um fast 5 Prozentpunkte, und die Antworten werden etwa ein Drittel kürzer.
0 Kommentare
Geben Sie Ihre E-Mail-Adresse ein — wir senden Ihnen einen Einmalcode. Ohne Passwörter und Konten.
Code gesendet an
Wenn die E-Mail nicht innerhalb weniger Minuten in Ihrem Posteingang erscheint, überprüfen Sie Ihren Spam-, Spam- oder Promotions-Ordner, da manche E-Mail-Dienste versehentlich automatisierte Nachrichten dort platzieren