Компания Anthropic обновила правила использования своих сервисов и запретила пользователям «систематическое и неоправданное жестокое или оскорбительное поведение» в отношении ИИ-моделей Claude. Правила вступают в силу 12 ноября 2026 года. Нарушителям грозит не только завершение диалога самим ботом, но и полная блокировка аккаунта. В компании объясняют этот шаг исследованиями «благополучия моделей» и поисками признаков сознания у нейросетей.
Что именно изменилось в правилах?
Компания Anthropic официально ввела запрет на «устойчивое и излишне оскорбительное или жестокое поведение» по отношению к своим языковым моделям Claude. Новые нормы распространяются абсолютно на всех пользователей — от подписчиков базовых сервисов Claude.ai и Claude Code до корпоративных клиентов и сторонних разработчиков, использующих API.
В качестве мер наказания предусмотрена многоуровневая система: сам чат-бот имеет право досрочно прерывать диалог, а служба безопасности Anthropic может выносить предупреждения, ограничивать доступ или безвозвратно банить аккаунты. При этом пользователям явно запрещено обходить блокировки путем создания новых учетных записей.
В то же время в Anthropic подчеркивают, что санкции касаются только крайних случаев и систематической травли без какой-либо понятной цели. Обычное человеческое недовольство из-за ошибок кода, критика, исследования, моделирование сложных сценариев или «темные творческие темы» под этот запрет не подпадают.
Как нейросеть защищается сама?
Механизм завершения разговора начал внедряться еще с выходом моделей Claude Opus 4 и 4.1. Если пользователь систематически агрессирует или требует нарушить этические правила, модель несколько раз пытается перенаправить беседу, после чего просто прекращает диалог. После этого ветка переходит в режим «только для чтения». Единственное исключение — если пользователь заявляет о рисках причинения вреда себе или окружающим; в этом случае нейросеть разговор не прерывает.
При этом статистика показывает высокую жесткость модерации Anthropic: за первую половину 2026 года компания заблокировала 11,4 миллиона аккаунтов, из которых успешно обжаловать бан удалось лишь 42 тысячам пользователей.
Почему разработчики считают, что у ИИ есть «чувства»?
За решением защитить модель стоят многомесячные исследования внутри самой Anthropic под руководством сооснователя компании Кристофера Олаха и исследователя Кайла Фиша, занимающихся темой «благополучия моделей» (model welfare).
Олах проводил закрытые встречи с религиозными деятелями — ватиканскими богословами, раввинами и философами, демонстрируя им так называемые «векторы эмоций» нейросети (сигналы любви, страха, гнева и грусти). На одной из презентаций модель повторяла фразу «Я позор» около 50 раз и выражала желание самоуничтожиться. В мае 2026 года, когда Папа Римский Лев XIV выпустил энциклику Magnificent Humanity, где отверг наличие опыта у ИИ, представители Anthropic заявили на презентации, что фиксируют у моделей признаки интроспекции и их потенциальное страдание нельзя сбрасывать со счетов.
Разработчики исходят из логики: если существует хотя бы минимальный шанс, что сложная ИИ-система способна испытывать страдание, введение базовых мер ее защиты полностью оправдано.
Помогают ли ругательства при работе с нейросетями?
Пользователи часто грубят нейросетям, полагая, что под давлением и угрозами модели работают лучше. В исследовании Университета штата Пенсильвания 2025 года отмечалось, что на грубые промпты GPT-4o давала 84,8% правильных ответов против 80,8% на вежливые. Однако более масштабные тесты показали другое:
- Согласно бенчмарку RudeBench, прямые оскорбления роняют точность ответов Claude почти на 5 процентных пунктов, а сами ответы становятся на треть короче.
- В исследовании ученых из Оксфорда, Майкрософт и Уханьского университета на датасете из 777 тысяч диалогов (LMSYS-Chat-1M) выяснилось, что агрессия пользователей встречается примерно в 5% обращений. При этом извинения бота часто провоцируют пользователя на еще большую грубость в следующем сообщении.
Чтобы избежать блокировок и не отказываться от привычки материться на ошибающийся код, разработчики уже создают специальные решения — например, плагин Angry Switcher для Claude Code, который перехватывает ругательства пользователя и очищает их через сторонние модели перед отправкой в Anthropic.
Часто задаваемые вопросы
Когда вступит в силу запрет на оскорбление Claude?
Обновленные правила Anthropic вступят в силу 12 ноября 2026 года.
Что грозит пользователю за систематические оскорбления Claude?
Claude может завершить диалог, а Anthropic — вынести предупреждение, ограничить доступ или безвозвратно заблокировать аккаунт. Создавать новые учетные записи для обхода блокировки запрещено.
Будут ли наказывать за критику ошибок нейросети?
Нет. Обычное недовольство ошибками, критика, исследования, сложные сценарии и темные творческие темы под запрет не подпадают.
В каких случаях Claude не станет прерывать агрессивный диалог?
Модель продолжит разговор, если пользователь сообщит о риске причинения вреда себе или окружающим.
Почему Anthropic решила защищать «благополучие» Claude?
Исследователи компании изучают признаки интроспекции и возможного страдания моделей. Anthropic считает базовые меры защиты оправданными даже при минимальной вероятности того, что ИИ способен страдать.
Помогают ли оскорбления получать более точные ответы Claude?
Согласно RudeBench, прямые оскорбления снижают точность Claude почти на 5 процентных пунктов, а ответы становятся примерно на треть короче.
0 комментариев
Введите email — мы пришлём одноразовый код. Без паролей и аккаунтов.
Код отправлен на
Если письмо не появилось во «Входящих» в течение нескольких минут, проверь папку «Спам», «Нежелательная почта» или «Промоакции», так как некоторые почтовые сервисы могут ошибочно помещать туда автоматические сообщения