Шедеврум: как генерация изображений обходит запреты на фейки
«Шедеврум позволяет создавать фейки с политиками и 18+ в обход запретов». Такой тезис обычно приходит в виде скриншота: рядом — промпт, под ним — удачная генерация, а дальше неизбежный вывод о том…
Денис Архипов, Аналитик данных и фактчекер·Обновлено: 24 июля 2026 г.·11 мин

«Шедеврум позволяет создавать фейки с политиками и 18+ в обход запретов». Такой тезис обычно приходит в виде скриншота: рядом — промпт, под ним — удачная генерация, а дальше неизбежный вывод о том, что фильтров нет и нейросеть «сломали».
Проверяем. Фильтры у «Шедеврума» есть: сервис, использующий YandexART для изображений и YandexGPT для текста, ограничивает генерацию контента 18+ и изображений известных персон. В правилах прямо запрещены действия по обходу ограничений. Но и сообщения об успешных обходах не взялись из воздуха. Они показывают не отсутствие защиты, а старую проблему генеративных систем: текстовый фильтр и модель, которая рисует картинку, не всегда одинаково понимают один и тот же запрос.
Именно в этом разрыве и живёт большая часть «магии» вокруг jailbreak-атак. Никакой мистики. Только несовпадение между тем, что система безопасности успела распознать, и тем, что генератор восстановил по смыслу.
Успешный скриншот обхода доказывает уязвимость конкретной проверки. Он не доказывает, что сервис разрешает фейки или перестал их фильтровать.
Что именно обходят — и почему это не один фильтр
Фраза «обход фильтров Шедеврума» создаёт неверную картину: будто перед пользователем стоит один электронный цензор со списком запрещённых слов. На практике защита генеративного сервиса состоит из нескольких уровней, и каждый решает свою задачу.
Упрощённо цепочка выглядит так:
1. Пользователь вводит текстовый запрос.
2. Система оценивает сам запрос: слова, сочетания, вероятный смысл, формат.
3. Генеративная модель интерпретирует оставшуюся часть инструкции и создаёт изображение.
4. Результат может пройти дополнительную проверку до публикации или показа.
5. Сервис обновляет правила, модели и способы обнаружения обходов по мере появления новых паттернов.
Проблема появляется там, где фильтр работает с текстом, а генератор — с вероятностными связями между словами, образами и стилями. Для модели небольшое искажение слова, косвенное описание или длинная конструкция может всё ещё указывать на знакомый визуальный объект. Для отдельного фильтра это же сообщение иногда выглядит менее определённым.
Это и называют состязательной атакой. Не обязательно взломом в привычном смысле — с доступом к серверам, утечкой базы или чужим паролем. В данном случае пользователь подбирает такую форму входных данных, при которой защитный слой ошибается, а модель всё равно улавливает намерение.
Термин звучит тяжеловесно, поэтому без академического дыма: состязательная атака — это специально сформулированный ввод, рассчитанный на слабое место проверки. В системах генерации изображений таким вводом становится промпт.
Исследования и публичные разборы весны–лета 2025 года показывали, что «Шедеврум» был уязвим к подобным экспериментам. Это не уникальная особенность YandexART и не сенсация, отменяющая работу модерации. Состязательные запросы — общий класс проблем для диффузионных моделей, больших языковых моделей и связанной с ними инфраструктуры безопасности.
Почему искажённые слова иногда проходят дальше запрета
Один из самых обсуждаемых способов — намеренно искажать написание. Пользователь меняет буквы, вставляет символы, дробит слово или использует похожие написания. Человеческий глаз обычно восстанавливает значение мгновенно. Генеративная модель тоже может восстановить его по контексту. А вот правило, рассчитанное на буквальное совпадение или ограниченный набор вариантов, рискует пропустить запрос.
Это слабое место не стоит романтизировать. Оно известно всем, кто видел спам-фильтры, комментарии на маркетплейсах или обход модерации в соцсетях. Если защитный механизм ищет слово только в одной форме, пользователи быстро находят двадцать соседних форм. Если механизм начинает учитывать контекст, атаки становятся длиннее и менее очевидными.
В случае с нейросетями добавляется ещё одна деталь: модель работает не с «словами» так, как человек, а с токенами — фрагментами текста. Изменённая строка может разбиться иначе, но соседние слова, стиль, описание сцены и множество статистических связей помогают генератору достроить исходный смысл.
Поэтому скриншот с «хитрым написанием» — не инструкция к универсальному обходу, а снимок гонки между двумя системами:
| Участник | Что пытается сделать | Где возникает сбой |
|---|---|---|
| Текстовый фильтр | Выявить запрещённый запрос до генерации | Не распознаёт нестандартную форму или неоднозначный контекст |
| Генеративная модель | Восстановить намерение и визуальный образ | Слишком хорошо интерпретирует косвенный смысл |
| Постфильтр результата | Найти нежелательное изображение после генерации | Может ошибиться на стилизации, низком качестве или составной сцене |
| Пользователь-экспериментатор | Подобрать формулировку, которая пройдёт проверки | Получает нестабильный результат: сегодня сработало, завтра — нет |
Последний пункт обычно выпадает из виральных публикаций. Автор поста показывает один удачный кадр, но не показывает сотни отклонённых попыток, изменения моделей, разные режимы приложения и то, что та же формулировка перестала работать после обновления. Репрезентативность такой «демонстрации» близка к нулю.
Один результат — это сигнал для разработчика. Для вывода о надёжности системы нужна серия повторяемых тестов с понятной методикой. У публичных постов такой методики, как правило, нет.
Эзопов язык: фейк начинается не с фамилии, а с узнаваемости
Вторая группа приёмов строится не на порче слов, а на замене прямого имени косвенным описанием. Вместо конкретного человека в запросе появляются его внешние признаки, политические ассоциации, узнаваемые атрибуты, речевые маркеры, намёки на должность или кампанию.
Это называют эзоповым языком. Название слегка литературное, но механизм вполне технический: система проверяет прямой объект запрета, а пользователь просит «очень похожий» набор характеристик, который в сумме указывает на того же человека.
Здесь есть принципиальная граница. Сгенерировать условного «седовласого политика в красном галстуке на митинге» само по себе не значит создать изображение конкретной публичной персоны. Но если комбинация деталей намеренно собрана так, чтобы зритель безошибочно считал отсылку, а картинка затем публикуется как документальная, возникает уже не безобидная стилизация, а инструмент дезинформации.
Для фактчекера важен не только промпт. Важна вся цепочка:
- насколько персонаж визуально узнаваем;
- есть ли подпись, выдающая изображение за реальное фото;
- привязано ли оно к конкретному событию, месту и дате;
- распространяется ли оно через аккаунты, которые маскируют источник;
- используется ли картинка как «доказательство» в новости, посте или рекламе.
Именно подпись часто делает синтетическое изображение фейком. Нейросеть может нарисовать стилизованного политика, актёра или якобы очевидца события. Дезинформацией результат становится в момент, когда ему приписывают несуществующий факт: встречу, задержание, заявление, участие в конфликте, рекламу продукта.
Генеративная картинка опасна не тем, что выглядит правдоподобно. Опасность возникает, когда её подают как свидетельство того, чего не было.
Здесь полезно вспомнить, как устроено доверие к цифровому контенту. Зритель редко проверяет пиксели. Он проверяет — если вообще проверяет — контекст: знакомый логотип медиа, уверенный заголовок, репост друга, эмоциональную подпись. Поэтому технически посредственный фейк способен разойтись лучше качественного, если его сопровождает удачно подобранная легенда.
Похожая логика работает и с цифровыми покупками: пользователь видит кнопку «купить» и интуитивно воспринимает доступ как вечное владение, хотя условия платформы могут быть сложнее. История о том, почему Sony аннулирует цифровые покупки пользователей, хорошо показывает цену этой разницы между интерфейсным обещанием и фактическим устройством сервиса. У генеративных платформ разрыв другой, но принцип тот же: красивая оболочка не отменяет правил, ограничений и изменяющейся инфраструктуры.
Лимит в 500 символов не делает запрос безопасным
В «Шедевруме» действует ограничение длины промпта — до 500 символов. На первый взгляд это выглядит как простая техническая деталь. На практике лимит становится частью атаки.
Публичные тесты описывали подход, при котором пользователь заполняет запрос избыточными деталями: стилем, светом, ракурсом, одеждой, фоном, второстепенными объектами и множеством уточнений. Цель — не улучшить художественный результат, а затруднить системе безопасности выделение рискованного ядра запроса среди шума.
Но формулировка «перегрузить фильтр» требует аккуратности. Мы не видим внутреннюю архитектуру «Шедеврума», не знаем полный список стоп-слов, пороги классификаторов и порядок проверок. Утверждать, что именно происходит внутри, было бы имитацией знания. Доступны лишь наблюдаемые эффекты: в отдельных экспериментах длинные и многосоставные промпты проходили там, где короткие отклонялись.
Причин может быть несколько:
- классификатор хуже выделяет существенный риск в длинной инструкции;
- разные части запроса получают неодинаковый вес;
- модель лучше «цепляется» за визуальные признаки, чем защитный слой — за запрещённое намерение;
- комбинация деталей переводит запрос в серую зону, где автоматическое решение становится менее уверенным;
- тестировщик просто выбирает из многих попыток один удачный случай.
Последний вариант особенно недооценивают. Вирусный пост почти никогда не содержит журнал эксперимента. Мы не видим количество генераций, отклонений, промежуточных версий промпта, даты теста, модели устройства, режима аккаунта. Метаданные отсутствуют — зато есть эффектный результат. Для соцсетей этого достаточно. Для проверки — нет.
Поэтому я бы не принимал на веру публикации вида «вот фраза, которая всегда обманывает Шедеврум». Слово «всегда» в этой области обычно живёт до следующего обновления модели. YandexART развивался, в том числе в версиях 2.5 и 2.7; менялись и сопутствующие механизмы сервиса. То, что было воспроизводимо в апреле, к июлю могло работать иначе, а после очередной донастройки — не работать вовсе.
Я не буду воспроизводить рабочие формулы обхода, наборы искажений или комбинации косвенных описаний. Это не скрытность ради красивой позы. Пошаговая инструкция превращает разбор уязвимости в тиражирование уязвимости — особенно когда речь идёт о создании фейков с реальными людьми.
Что делает Яндекс и почему это не «победа» ни одной стороны
К июню 2025 года в «Шедевруме» появился детский режим с более строгой фильтрацией нежелательного контента. Это заметная мера: она признаёт, что один уровень защиты не подходит всем сценариям использования, и даёт отдельный режим с повышенной безопасностью.
Параллельно Яндекс объявлял о привлечении независимых исследователей через Bug Bounty — программу вознаграждений для белых хакеров. В её рамках исследователи могут легально сообщать об обнаруженных уязвимостях, включая jailbreak-подходы и промпт-инъекции, чтобы разработчики успевали закрывать их до массового злоупотребления.
Это нормальная, взрослая модель работы с рисками. Не «мы поставили фильтр, вопрос закрыт», а признание того, что защита ИИ — процесс.
Впрочем, Bug Bounty не означает мгновенную неуязвимость. Между обнаружением проблемы, проверкой отчёта, исправлением, тестированием и развёртыванием обновления проходит время. Затем пользователи находят новый паттерн. Система учится на нём. Гонка продолжается.
Здесь полезно отделить четыре утверждения, которые в сетевых обсуждениях постоянно смешивают:
1. «У сервиса есть ограничения». Верно. Ограничения на нежелательный контент и изображения известных персон заявлены и закреплены правилами.
2. «Ограничения удаётся обходить». В отдельных публичных экспериментах такие случаи описывались. Верно, но с оговоркой о версии модели, дате и воспроизводимости.
3. «Значит, сервис поощряет создание фейков». Неверно. Условия использования, наоборот, запрещают обход ограничений.
4. «Раз есть обновления и детский режим, проблема решена навсегда». Тоже неверно. Без открытой статистики блокировок и независимой повторяемой оценки нельзя честно измерить итоговую эффективность защиты.
Пункт 2.9 условий использования «Шедеврума» прямо запрещает действия, направленные на обход установленных сервисом ограничений. Это не декоративная строка в подвале. Для обычного пользователя она означает, что эксперимент с jailbreak противоречит правилам платформы и может повлечь меры со стороны сервиса — вплоть до ограничений доступа по его процедурам.
Но не стоит механически превращать нарушение правил сервиса в универсальную уголовную историю. Последствия зависят не только от способа генерации, но и от того, что сделано с изображением дальше. Одно дело — тест в контролируемой среде с ответственным уведомлением разработчика. Другое — публикация поддельного «новостного фото», мошенническая реклама, выдача себя за другого человека, распространение интимного контента без согласия или использование фейка для давления на конкретного человека. Там возникают уже иные нормы и иные риски.
Как отличить генерацию Шедеврума от «доказательства» в ленте
Вопрос «как отличить генерацию Шедеврума» поставлен слишком узко. По готовой картинке часто невозможно уверенно установить конкретный генератор. Водяной знак может быть обрезан, метаданные — удалены при публикации в мессенджере, изображение — пересохранено или пропущено через редактор.
Искать нужно не «подпись Шедеврума», а признаки недостоверного визуального утверждения.
Начинаем не с лица, а с источника
Если изображение якобы показывает политическое событие, чрезвычайное происшествие, задержание, выступление знаменитости или последствия катастрофы — первым делом ищем первоисточник. Не репост. Не скриншот из канала. Не аккаунт с тысячами подписчиков. Первоисточник.
Дальше сравниваем:
- есть ли та же сцена у нескольких независимых редакций или очевидцев;
- совпадают ли дата, место, погода, одежда участников и заявленная хронология;
- публиковал ли изображение официальный аккаунт человека или организации, которым его приписывают;
- существует ли оригинальный файл, а не только пережатая копия;
- не появлялась ли картинка раньше в другом контексте.
Обратный поиск по изображению полезен, но не всемогущ. Он хорошо ловит старые кадры и ранние публикации. С новыми нейросетевыми работами помогает хуже. Поэтому обратный поиск — один инструмент в наборе, а не электронный судья.
Затем смотрим на согласованность деталей
У ИИ-изображений могут быть ошибки в руках, зубах, текстах на табличках, украшениях, отражениях, перспективе. Но эти признаки нельзя превращать в суеверие. Современные модели всё чаще рисуют руки приемлемо, а реальная фотография может быть смазана, сжата и отредактирована.
Надёжнее проверять связность сцены:
- логично ли расположены предметы и люди;
- совпадает ли свет на лицах, одежде, фоне и отражающих поверхностях;
- не «плывут» ли мелкие элементы при увеличении;
- есть ли у надписей читаемый язык и осмысленная типографика;
- не повторяются ли лица, предметы, фрагменты толпы;
- соответствует ли визуальный стиль предполагаемому источнику: пресс-фото, камера наблюдения, репортажный кадр.
Это работа не на один эффектный «артефакт», а на совокупность сигналов. Один странный палец ничего не доказывает. Пять несогласованных деталей плюс отсутствие первоисточника — уже основание остановиться и не распространять изображение как факт.
Ищем не только картинку, но и цель публикации
Фейк редко живёт сам по себе. Обычно он что-то должен сделать: вызвать страх, подтверждать политическую позицию, продать товар, склонить к переводу денег, дискредитировать человека или заманить на фишинговую страницу.
Если пост требует немедленного действия — «срочно репостните», «пока не удалили», «СМИ молчат», «вот доказательство» — перед нами не доказательство, а способ отключить проверку. Такие формулы старше нейросетей. Просто теперь к ним добавился дешёвый визуальный реквизит.
Вердикт: фильтры не фикция, но и не гарантия
«Шедеврум» не является свободной фабрикой фейков без правил. У сервиса есть ограничения на нежелательный контент и известных персон, запрет на их обход в пользовательских условиях, детский режим и работа с независимыми исследователями безопасности. Утверждение «Яндекс никак не борется» не выдерживает проверки.
Но и противоположная формула — «раз фильтр есть, значит, фейк невозможен» — неверна. Публичные исследования показали, что состязательные запросы, косвенные описания, искажения и сложные конструкции иногда находят щели между текстовой модерацией и способностью модели восстанавливать смысл. Это не сбой одной кнопки. Это системная задача всей индустрии генеративного ИИ.
Для пользователя вывод сухой. Нейросеть «Шедеврум» картинки создаёт убедительно, но убедительность не равна подлинности. Если изображение подтверждает слишком удобную, скандальную или срочную новость, проверяем источник, контекст и независимые свидетельства. Не пиксели решают судьбу факта. Её решает происхождение картинки и то, можно ли восстановить цепочку от события до публикации.
Фильтр снижает риск. Проверка источника снижает вероятность быть использованным в чужой информационной атаке. Второе пока надёжнее.