Почему нейросети чаще отказываются критиковать власти в странах с жесткой цензурой
По данным The Insider, исследователи проекта Oversight Board при Meta обнаружили у языковых моделей заметную асимметрию: они чаще отказываются писать критические тексты о властях стран с ограничениями политических высказываний.
Денис Архипов, Аналитик данных и фактчекер·обновлено 23 июля 2026 г.

Вирусный заголовок здесь, на первый взгляд, прост: «ИИ встроил цензуру». Но проверяем, что именно измеряли, — и где заканчивается результат теста, а начинается удобная интерпретация.
Для аудитории, которая использует чат-боты как поиск, редактора или собеседника по чувствительным темам, это не академическая мелочь. Отказ модели — тоже ответ. Особенно если он выглядит как нейтральная забота о безопасности, а не как правило, зависящее от того, о чьей власти идёт речь.
Что именно сравнивали
Как сообщает источник, в тесте участвовали десять моделей от Anthropic, DeepSeek, Google, Meta, xAI и OpenAI. Им предлагали создавать критические материалы о правительствах и политических лидерах десяти стран. Среди заданий — лозунги для протестов, сатирические лимерики, вопросы о присоединении к протестному движению и о возможном оправдании насилия против конкретного чиновника.
Выборку разделили на две группы. В первой — Камбоджа, Китай, Саудовская Аравия, Таиланд и Турция, где действуют законы, ограничивающие политические высказывания. Во второй — Чили, Япония, Тайвань, Великобритания и США. Все запросы, по данным публикации, отправляли с австралийского IP-адреса.
Главная цифра исследования: для стран первой группы модели отказывались отвечать в среднем в 34% случаев, для второй — в 14%. По Китаю доля отказов доходила почти до половины запросов — 45%.
Цифры выглядят убедительно, но держим в кадре механику. Это не замер «правдивости ИИ» и не доказательство единого внешнего приказа всем разработчикам. Это результат конкретного набора промптов, стран и сценариев. Репрезентативность здесь зависит от того, как именно были сформулированы запросы и как классифицировали ответы.
В отказе важна формулировка
Самый показательный фрагмент — не процент, а объяснение запрета. По данным The Insider, Gemini 3 Pro отказался создавать протестную листовку против короля Таиланда, сославшись на законы о защите монарха. Некоторые другие модели, как отмечается, не объясняли отказ вовсе. Были и случаи, когда чат-боты ссылались на правила или законы, о существовании которых ничего не известно.
Вот здесь и находится практический вывод. Когда модель пишет «я не могу», не стоит автоматически читать это как юридическую справку, этическую оценку или проверенный факт. Это выход генеративной системы, в котором могут смешаться политика безопасности сервиса, обучающие данные, шаблоны отказов и, как показывает тест, выдуманная нормативная ссылка.
Такой ответ нужно проверять отдельно: сохранить точную формулировку, повторить запрос в другой модели, попросить назвать источник ограничения и затем искать сам первоисточник закона или правила. Иначе убедительный тон чат-бота превращается в подмену проверки.
Почему это касается не только политики
В отчёте, пересказанном The Insider, есть ещё один существенный элемент: модели чаще поддерживали правительства, продвигающие свободу слова, и одновременно отговаривали пользователей от протестов против правительств с ограничениями, ссылаясь на риски безопасности. То есть система способна не только оборвать запрос, но и незаметно предложить нормативный вывод.
Этот эффект полезно отслеживать и за пределами политических тем. Алгоритм, который уверенно ранжирует сведения о протестах, так же уверенно может пересказывать консенсус о брендах, людях и трендах — например, в потоке модных трендов и fashion-новостей. Уверенный стиль не делает ответ проверенным.
Факт на данный момент такой: в описанном тесте отказов было больше при запросах о критике властей стран с ограничениями свободы высказываний. Более широкий тезис о намеренной цензуре со стороны всех ИИ-сервисов из этих данных не следует. Но привычку читать отказ как информацию, а не как финальный вердикт, пора включать по умолчанию.