Кандинский: генерация изображений и скрытые признаки подделки
Картинка с идеально гладким лицом, странной вывеской и тенью, которая падает не туда, уже не редкость в новостной ленте. Такой визуал может быть создан Kandinsky за считаные секунды — по текстовому описанию, без камеры, фотографа и реального места съёмки.
Денис Архипов, Аналитик данных и фактчекер·Обновлено: 09 сентября 2026 г.·10 мин

А затем его публикуют как иллюстрацию к событию, скриншот очевидца или доказательство того, что произошло в действительности.
Кандинский — генеративная нейросеть Sber AI для создания изображений и коротких видео. Она понимает запросы на русском языке, работает с текстовыми описаниями и умеет собирать достаточно убедительные сцены. Но убедительность здесь не равна достоверности. Под капотом остаются следы: сломанная кириллица, анатомические ошибки, артефакты мелких деталей, странные отражения и физика света, которую модель рассчитывает приблизительно.
В фактчекинге это не готовый вердикт, а набор сигналов. Мы не объявляем изображение подделкой по одному лишнему пальцу. Сначала разбираем сам файл, затем ищем первоисточник, сравниваем публикации и только после этого формулируем вывод.
Что именно генерирует Kandinsky
Семейство Kandinsky разработано командой Sber AI совместно с исследователями Института искусственного интеллекта AIRI. Технологическая основа — латентная диффузия. Если убрать техническую оболочку, принцип выглядит так: модель начинает с визуального шума и постепенно преобразует его в изображение, которое должно соответствовать текстовому описанию.
Это не поиск фотографии в базе и не коллаж из найденных фрагментов. Нейросеть не извлекает готовую вывеску, лицо или архитектурный объект из конкретного источника. Она строит новый результат по статистическим закономерностям, усвоенным во время обучения. Поэтому изображение может выглядеть правдоподобно целиком, но разваливаться при увеличении отдельных областей.
В июне 2022 года началась разработка Kandinsky. В октябре 2023 года появилась версия Kandinsky 3.0, а в апреле 2024 года Sber AI представила Kandinsky 3.1. В этой версии скорость генерации выросла почти в десять раз по сравнению с первой моделью линейки. Появилась поддержка разрешения до 4K и управление позой и композицией с помощью ControlNet.
Доступ к инструменту предоставляется через Fusion Brain, GigaChat, а также Telegram- и VK-ботов. Базовые изображения создаются в разрешении 1024×1024 пикселя или HD-формате 1280×768. Само по себе разрешение ничего не доказывает: настоящая фотография может быть пережата до небольшого размера, а нейросетевой результат — сохранён в крупном файле. Но при проверке мы учитываем не только пиксели, а согласованность всех деталей.
Kandinsky поддерживает запросы более чем на 100 языках. Для российского информационного поля особенно существенна работа с кириллицей: модель может правильно понять текстовый запрос, но при этом плохо воспроизвести надпись внутри изображения. Это два разных уровня обработки. Понимание промпта не означает способность надёжно рисовать буквы.
Картинка может быть фотореалистичной на расстоянии вытянутой руки и искусственной при увеличении одного фрагмента.
С правами на результат ситуация также отличается от вопроса о достоверности. Согласно пользовательским лицензиям Kandinsky 3 и последующих версий, создатель промпта получает исключительные права на сгенерированное изображение и может использовать его в коммерческих целях. Это разрешает использование результата, но не превращает его в фотографию реального события и не подтверждает изображённый сюжет.
Первый слой проверки: текст, руки и мелкие детали
При проверке изображения Kandinsky я начинаю не с поисков детектора ИИ. Сначала смотрю на зоны, где генеративные модели часто теряют внутреннюю согласованность. Это лицо, кисти рук, украшения, предметы на переднем плане, края объектов и небольшие повторяющиеся элементы.
Анатомия выдаёт не модель, а нарушение логики
Руки долго оставались одним из самых заметных слабых мест генераторов изображений. Модель способна создать убедительную позу целиком, но ошибиться в количестве пальцев, их длине или точках соединения. Встречаются:
- лишние или сливающиеся пальцы;
- суставы, которые изгибаются неестественно;
- ладонь, соединённая с рукавом под неправильным углом;
- асимметрия кистей в одинаковой позе;
- предмет, который будто проходит сквозь пальцы;
- очертания уха или глаза, не совпадающие с перспективой лица.
У лиц набор признаков другой. Один глаз может быть чуть выше второго, линия зубов — не совпадать с формой рта, серьги — различаться без причины, а волосы — превращаться в гладкую массу с повторяющимся узором. На маленьком превью всё это легко пропустить. В исходном размере ошибка часто становится очевидной.
Но здесь требуется дисциплина. Человек тоже может попасть в кадр с закрытой рукой, размазанным лицом или неудачным освещением. Фотография в движении создаёт артефакты. Сжатие в мессенджере уничтожает мелкие детали. Поэтому анатомическая странность — это маркер для дальнейшей проверки, а не финальное доказательство.
Мелкие объекты не обязаны быть случайными
Нейросети часто уверенно рисуют общую сцену и хуже справляются с объектами, которые требуют точной структуры:
- циферблатами и шкалами;
- номерными знаками;
- мелкими логотипами;
- медицинскими приборами;
- застёжками, пуговицами и швами;
- проводами и соединениями;
- предметами на заднем плане;
- повторяющимися рядами окон или сидений.
У реального объекта обычно есть функция. Кнопки расположены там, где ими можно пользоваться. Провод подключён к устройству. Надпись соответствует форме поверхности и перспективе. В генерации эти связи могут быть только имитированы визуально.
Проверяем не наличие странности, а её системность. Если у одного предмета слегка смазана кромка, это может быть следствием компрессии. Если на всей вывеске буквы превращены в похожие символы, а мелкие предметы одновременно теряют форму, вероятность генерации возрастает.
Кириллица как зона повышенного риска
Текст внутри изображения — один из самых удобных участков для проверки. Kandinsky способен создать сцену с магазином, дорожным указателем, газетным стендом или плакатом, но надписи часто превращаются в бессмысленный набор знаков. Буквы могут напоминать кириллицу, сохранять примерную длину слова и даже выглядеть убедительно издалека. Однако при чтении выясняется, что это не текст, а визуальный шум.
Здесь есть несколько типичных сценариев.
1. Надпись выглядит как текст, но не читается
На вывеске видны символы, похожие на буквы, однако они не складываются в слова. Иногда отдельные знаки напоминают настоящие «А», «О» или «С», но общая последовательность не имеет смысла.
2. Слова меняются внутри одной поверхности
Часть вывески выглядит как русское слово, а соседняя часть уже состоит из псевдобукв. Такое бывает, когда модель пытается совместить знакомую композицию и декоративные элементы.
3. Текст не подчиняется перспективе
Надпись на наклонной поверхности должна сжиматься и следовать геометрии объекта. В сгенерированном изображении символы могут сохранять одинаковую высоту, пересекать границу предмета или плавать над поверхностью.
4. Повторяющийся текст не совпадает
Если на витрине несколько одинаковых ценников или на форме повторяется логотип, в реальном дизайне элементы обычно воспроизводятся одинаково. Генератор может создать каждый экземпляр заново, поэтому буквы и знаки будут различаться.
Увеличение изображения помогает, но не решает задачу автоматически. Апскейл может дорисовать детали и сделать бессмысленные символы более аккуратными. Мы сравниваем несколько областей, смотрим на исходный файл и проверяем, существовала ли эта картинка раньше.
Особенно осторожно следует относиться к изображениям, которые распространяются как скриншоты новостей. Скриншот может быть не оригинальным снимком, а уже переработанной карточкой. Проверяем название издания, дату, адрес страницы, шрифт, расположение логотипа и архивную копию публикации. Один узнаваемый логотип в углу ещё не делает изображение настоящей новостью.
Свет, тени и перспектива
Генерация изображений часто ломается не на главном объекте, а в его отношениях с окружающей средой. Человек выглядит правдоподобно, автомобиль похож на автомобиль, здание напоминает здание. Но свет от этих объектов живёт по разным правилам.
У фотографии есть единая физическая сцена. Источник света влияет на все поверхности, тени соединяются с предметами, отражения зависят от угла обзора. В искусственно созданном изображении модель может приблизительно соблюсти эту логику, но не всегда удерживает её до конца.
При осмотре сравниваем:
- направление теней от нескольких объектов;
- резкость тени и резкость самого объекта;
- положение отражения относительно поверхности;
- яркость предметов на освещённой и теневой стороне;
- соответствие бликов форме стекла, металла или воды;
- контакт предмета с землёй или другой опорой.
Тень может быть слишком мягкой рядом с объектом, который должен давать чёткий контур. Отражение в окне может показывать другой угол здания. На мокром асфальте появляются световые пятна, не связанные с фонарями. Автомобиль будто стоит на дороге, но нижняя часть колёс не учитывает поверхность.
Перспектива тоже даёт материал для проверки. Линии окон, бордюров и стен должны сходиться в согласованной системе. В генерации они могут слегка расходиться. Для художественной картинки это не всегда проблема. Для изображения, которое выдают за документальный снимок конкретного места, уже существенная деталь.
Смотрим и на фон. У генераторов часто получается условный городской пейзаж без устойчивой географии: вывески не совпадают с архитектурой, дорожные знаки имеют неправильную форму, окна повторяются с неестественным ритмом. Если публикация утверждает, что кадр сделан в определённом городе, проверяем не только главный объект, но и весь контекст вокруг него.
Сравниваем изображение с первоисточником
Верификация изображений, созданных ИИ, не заканчивается визуальным осмотром. Важнее найти происхождение файла. Для этого я выстраиваю проверку от самой ранней доступной публикации к более поздним копиям.
Что находим в процессе поиска
1. Первую дату появления.
Поздняя публикация может содержать уже изменённую версию изображения. Сравниваем даты и не принимаем самую популярную копию за оригинал.
2. Первый аккаунт или ресурс, где появился файл.
Если картинка возникла сначала в генераторе, дизайнерском сообществе или посте с описанием промпта, её статус меняется. Она уже не может служить независимым свидетельством события.
3. Контекст публикации.
Изображение могло быть иллюстрацией, сатирой, рекламным макетом или экспериментом с нейросетью. При перепосте подпись часто исчезает, а картинка начинает жить как якобы документальная.
4. Совпадения с другими кадрами.
Реальное событие обычно оставляет цифровой след: несколько фотографий, видео с разных точек, сообщения очевидцев, спутниковые или архивные материалы. Одиночная картинка без цепочки происхождения требует повышенной осторожности.
5. Изменения после публикации.
Сравниваем кадрирование, наличие водяных знаков, цветокоррекцию и элементы интерфейса. Иногда именно обрезка скрывает артефакт или удаляет подпись о генерации.
Метаданные: полезный след, но не печать подлинности
EXIF-данные могут содержать сведения о камере, времени съёмки, программном обеспечении и параметрах файла. Но отсутствие метаданных ничего не доказывает: социальные сети и мессенджеры часто удаляют их при загрузке. Наличие метаданных тоже не является гарантией. Их можно изменить при обработке файла.
Поэтому метаданные рассматриваем как часть цепочки, а не как окончательный ответ. Если в файле указан редактор изображений, это повод выяснить, что именно менялось. Если указан генератор — сильный сигнал, но и его нужно сопоставить с контекстом публикации.
Архивная копия страницы обычно полезнее одиночного скриншота. В ней можно увидеть исходную подпись, дату, автора и соседние материалы. Иногда выясняется, что громкий пост прямо называл изображение нейросетевым, а в последующих перепостах осталась только картинка.
Почему детекторы ИИ не закрывают вопрос
Автоматические сервисы распознавания контента Kandinsky могут быть полезны как дополнительный инструмент. Они анализируют особенности изображения и оценивают вероятность генерации. Но эта оценка не равна доказательству и не идентифицирует модель с абсолютной точностью.
Современные детекторы дают результаты, которые зависят от разрешения, степени сжатия, последующей обработки и версии самой модели. Для разных изображений точность может находиться примерно в диапазоне от 80 до 95 процентов. Это означает простую вещь: ошибочный результат возможен в обе стороны.
Сервис может принять настоящую фотографию за созданную ИИ, особенно если она прошла через фильтры, апскейл или агрессивное шумоподавление. Он может не распознать генерацию после кадрирования, цветокоррекции и повторного сохранения. Нельзя автоматически переносить его оценку на исходный файл, которого сервис не видел.
Практический порядок выглядит так:
- сначала сохраняем исходное изображение или максимально раннюю копию;
- затем осматриваем текст, лица, руки, мелкие детали и фон;
- после этого проверяем свет, отражения и перспективу;
- ищем первоисточник и ранние публикации;
- сравниваем подпись, дату и контекст;
- только затем используем детектор как дополнительный сигнал;
- формулируем вывод с указанием основания, а не одним словом «фейк».
Детектор показывает вероятность. Первоисточник показывает происхождение. Это разные задачи, и смешивать их нельзя.
Как формулировать вывод без лишней уверенности
В фактчекинге важно отделять три утверждения.
Первое: изображение могло быть создано нейросетью. Основанием служат визуальные артефакты и результат автоматической проверки.
Второе: изображение не подтверждает описанное событие. Это уже вывод о доказательной ценности картинки. Он может быть верным даже без точного установления модели.
Третье: изображение создано именно Kandinsky. Это наиболее сильное утверждение, и для него нужны дополнительные основания: публикация автора, файл с убедительными метаданными, история генерации или иной надёжный источник. По одним визуальным признакам обычно можно говорить о вероятной генерации, но не о точной принадлежности конкретной модели.
Kandinsky не уникален в своих слабых местах. Похожие ошибки встречаются у разных генераторов. Искажённая кириллица, лишние пальцы и несогласованные тени указывают на искусственное происхождение изображения, но не обязательно на конкретный сервис.
Есть и обратная проблема. Хорошо доработанная генерация может не содержать очевидных артефактов. Пользователь способен исправить надпись, заменить лицо, дорисовать детали и несколько раз пересохранить файл. Поэтому визуальная чистота не доказывает натуральность. В таком случае особенно важны происхождение, независимые подтверждения и согласованность с другими данными.
Итог
Кандинский — рабочий инструмент генерации изображений и коротких видео, а не фабрика очевидных подделок. Он создаёт убедительные сцены, поддерживает русскоязычные запросы, работает с разрешениями до 4K в соответствующих сценариях и может выпускать визуал, который без проверки легко принять за фотографию.
Главные признаки подделки находятся в деталях: бессмысленная кириллица, нестабильная анатомия, артефакты мелких объектов, странные отражения, разъезжающиеся тени и нарушенная перспектива. Но ни один из этих признаков не заменяет поиск первоисточника.
Если изображение распространяется как доказательство новости, проверяем не только то, похоже ли оно на фотографию. Находим, откуда оно взялось, что было написано в первой публикации и есть ли независимые подтверждения события. В этом порядке и состоит нормальная верификация.
Вывод однозначный: распознать контент Kandinsky по визуальным следам часто возможно, но установить достоверность новости можно только через происхождение изображения и проверку контекста. Pixel-perfect не означает real-world.