infonebpress.

Отделяем факты от медийного шума

Колонку ведёт Денис Архипов

Поиск изображения по картинке: почему алгоритмы часто ошибаются

Поиск изображения по картинке может показать похожий диван, ту же улицу или десятки публикаций с одной фотографией. И всё же не найти страницу, где снимок появился впервые.

Денис Архипов, Аналитик данных и фактчекер·Обновлено: 04 октября 2026 г.·9 мин

Поиск изображения по картинке: почему алгоритмы часто ошибаются

Это не обязательно сбой: современные поисковые системы часто решают задачу визуального сходства, а не устанавливают происхождение конкретного файла.

Для фактчекера разница принципиальная. Результат поиска подсказывает, где продолжить проверку, но сам по себе не подтверждает ни подлинность фото, ни его дату, ни обстоятельства съёмки. Чтобы добраться до первоисточника, нужно понимать, что именно сравнивает инструмент, и проверять изображение несколькими способами.

От цифрового отпечатка к визуальному смыслу

Классический обратный поиск изображения опирался на сравнение файлов и их близких копий. Один из способов такого сравнения — перцептивное хеширование. Алгоритм сводит изображение к компактному цифровому отпечатку, описывающему его общую структуру. У распространённых вариантов, таких как pHash, dHash и aHash, хеш обычно занимает от 8 до 100 байт.

Логика удобная: если две картинки имеют похожую структуру, их отпечатки тоже могут оказаться близкими. Так можно обнаруживать копии, даже если файл пересохранён или слегка изменён. Некоторые системы используют контрольные суммы для быстрого отсева очевидно неподходящих совпадений, прежде чем запускать более тяжёлое сравнение.

Но такой отпечаток не хранит историю изображения. Он не сообщает, кто сделал снимок, когда он был опубликован и какая из найденных страниц является первоисточником. Это способ быстро сопоставить визуальные структуры, а не машина для расследования происхождения файла.

К тому же небольшое изменение иногда заметно меняет саму структуру. Перцептивный хеш может хуже работать, если изображение обрезали, отзеркалили, повернули или сильно сжали в JPEG. Кроппинг особенно коварен: после обрезки в кадре остаётся только фрагмент, и система сравнивает уже не ту композицию, для которой рассчитан исходный отпечаток.

Нейросетевой поиск решает задачу иначе. Изображение преобразуется в векторное представление, или эмбеддинг: набор чисел, который кодирует визуальные признаки. Затем поисковая система ищет в своей базе объекты с близким представлением. Это помогает находить содержательно похожие изображения, даже если они не являются копиями одного файла.

Для пользователя такой подход часто выглядит убедительно. Запрос по фотографии кресла возвращает похожие кресла; снимок улицы — визуально близкие улицы. Однако сходство здесь означает близость признаков, а не общность происхождения. Похожая картинка может вести совсем к другому объекту и не иметь никакой связи с исходной фотографией.

Поиск может найти близкий визуальный образ. Происхождение снимка он этим не устанавливает.

Почему привычный снимок перестаёт находиться

Представим, что фотографию из публикации сохранили, обрезали по краям и переслали через мессенджер. При пересылке файл мог быть сжат. Затем изображение отзеркалили и добавили текстовую плашку. Для человека это всё ещё узнаваемый кадр. Для алгоритма это уже набор преобразований, которые могут сбить поиск дубликатов.

Здесь полезно разделять два вида задачи. Один инструмент пытается найти тот же файл или близкую копию. Другой ищет изображения, похожие по содержанию. Первый чувствительнее к изменениям файла и геометрии; второй способен подхватить тему или объект, но его результаты часто шире и менее точны для установления первоисточника.

Что изменили в изображенииПочему это мешает поиску
Обрезали часть кадраМеняется композиция, по которой сравниваются отпечатки
Отзеркалили или повернулиГеометрическое расположение объектов становится другим
Сильно сжали JPEGДетали и границы объектов могут измениться
Добавили подпись или рамкуВ кадре появляются новые элементы, влияющие на сопоставление
Использовали только фрагмент фотоИнструменту приходится находить соответствие по ограниченной части изображения

Таблица описывает типичные сложности, а не гарантированный исход. Один сервис может всё же обнаружить копию, другой — показать только визуально близкие результаты, а третий не дать полезных совпадений. Точные пороги сходства у закрытых поисковых систем неизвестны, поэтому нельзя заранее вывести универсальное правило вроде «обрезка на четверть кадра ломает поиск».

Практический вывод прост: если запрос по исходному файлу ничего не дал, это не аргумент против подлинности снимка и не доказательство, что фотографии раньше нигде не было. Это означает только, что конкретная система не показала подходящее совпадение в доступной ей базе.

Почему Google Lens предлагает товары вместо первоисточника

Переход от традиционного поиска точных копий к нейросетевому распознаванию изменил характер выдачи. Google Lens может распознавать категории объектов, находить товары и извлекать текст с изображения. По данным, представленным Google на I/O в 2023 году, сервис обрабатывал более 12 миллиардов визуальных запросов в месяц. Масштаб заметный, но число запросов ничего не говорит о том, насколько хорошо Lens находит первоисточник конкретной фотографии.

Если загрузить снимок комнаты, в выдаче могут появиться похожие интерьеры и предметы для покупки. Если на фотографии виден фасад, поиск может вернуть здания с похожими визуальными особенностями. Для подбора товара это полезно. Для фактчекинга возникает подмена задачи: система предлагает ответ на вопрос «что здесь похоже?», хотя проверяющий пытается выяснить «где этот файл публиковался раньше?».

Это не повод считать Lens бесполезным. Он помогает обнаружить контекст: названия предметов, похожие изображения, текст на картинке или страницы, которые стоит изучить. Но найденная карточка товара не становится источником фотографии только потому, что алгоритм поместил её выше остальных результатов.

Когда нужен именно поиск дубликатов изображений онлайн, разумно сравнить выдачу нескольких сервисов, например Google Lens, Bing и TinEye. Их базы и способы сопоставления могут различаться. Отсутствие совпадения в одном поисковике не означает, что совпадений нет вообще. Совпадение в нескольких системах тоже не доказывает, что найденная страница была первой: она могла перепечатать фото вслед за более ранней публикацией.

Как проверять фотографию, а не доверять одной выдаче

Я использую обратный поиск как первый этап проверки. Он помогает сформировать список зацепок, но каждый результат дальше требует отдельной проверки. Такой порядок удерживает нас от распространённой ошибки: принять верхнюю ссылку за ответ, не посмотрев на дату, содержание страницы и контекст публикации.

1. Сохраняем исходный файл, если он доступен. Скриншот страницы или пересланная миниатюра уже могут содержать обрезку и сжатие. Если в публикации есть возможность открыть изображение отдельно, для первого запроса лучше использовать его. Сохраняем также ссылку на исходный пост, чтобы не потерять контекст.

2. Пробуем целый кадр и несколько фрагментов. Для общего поиска загружаем фотографию целиком. Затем выбираем характерную деталь: вывеску, необычное здание, предмет на переднем плане. Это особенно полезно, когда основную картинку изменили или поверх неё добавили текст. Фрагмент должен сохранять достаточно заметных особенностей, иначе поиск уйдёт в слишком общие совпадения.

3. Проверяем результат в разных системах. Google Lens может лучше распознать объект или текст; Bing и TinEye способны показать иной набор совпадений. Сравниваем не только картинки, но и страницы, на которых они размещены. Сервис, вернувший визуально похожий товар, выполняет другую задачу, чем сервис, показавший копию фотографии.

4. Открываем страницы и ищем ранние публикации. Дата в сниппете поисковой выдачи — ориентир, не окончательный вердикт. На странице могут быть дата обновления, повторная публикация или неверно указанная дата. Сравниваем подписи, контекст, упоминания автора и ссылки на более ранние версии. Если есть архивная копия страницы, она может помочь понять, что было опубликовано и когда, но и её нужно соотнести с другими следами.

5. Проверяем смысл изображения в исходном контексте. Даже настоящий снимок может сопровождать ложное утверждение. Фотография пожара, толпы или разрушенного здания сама по себе не устанавливает место и дату. Сверяем заметные детали с текстом публикации и ищем независимые подтверждения: совпадают ли географические признаки, описание события и время.

Важная оговорка: если картинка не находится, нельзя автоматически объявлять её уникальной, новой или поддельной. Поисковый индекс неполон. Кроме того, часть материалов может находиться в закрытых социальных сетях и мессенджерах, откуда публичный поиск не получает доступ. Насколько велика эта доля, по имеющимся данным установить нельзя.

Поисковик не распознаёт человека по лицу

Обратный поиск фотографии часто путают с распознаванием лиц. Это разные технологии. Стандартные поисковики изображений, включая Google Lens, Bing и TinEye, не строят биометрические модели лиц для такого поиска. Поэтому два снимка одного человека могут восприниматься поисковой системой как несвязанные изображения, особенно если отличаются ракурс, освещение, фон и качество.

Отсюда следуют две ошибки, которые регулярно появляются в обсуждениях. Первая: человек не найден поиском, значит его фото нигде больше не публиковалось. Вторая: найдено похожее лицо, значит установлена личность. Ни тот, ни другой вывод не подтверждается обычным обратным поиском.

Специализированные биометрические системы решают отдельную задачу и работают с другими методами. Их показатели нельзя переносить на Google Lens или на поиск дубликатов. Утверждение о высокой точности одной технологии не делает каждую поисковую систему инструментом идентификации людей.

Для фактчекинга лица в кадре обычно важнее проверять происхождение самого изображения и контекст публикации. Если снимок приписан конкретному человеку, нужны надёжные независимые подтверждения, а не визуальное сходство в случайной выдаче. Поиск по картинке может помочь найти прежние публикации того же кадра, но не удостоверяет личность изображённого.

Первоисточник может остаться за пределами поиска

Поисковая система показывает то, что смогла проиндексировать и сопоставить. Это уже ограничение. Первой публикацией могла быть запись в закрытом аккаунте, сообщение в мессенджере, удалённая страница или пост, доступный только ограниченному кругу пользователей. Публичная выдача в таких случаях не отражает всю историю распространения файла.

Есть и другая сложность: найденная ранняя копия не обязательно является оригиналом. Страница могла опубликовать фото раньше остальных доступных результатов, но получить его из другого источника. Иногда установить автора и исходную публикацию по открытым следам вообще не удаётся. Тогда корректный вывод должен ограничиваться тем, что подтверждено: например, снимок обнаружен на страницах с такими-то датами, а установить самую первую публикацию не получилось.

Метаданные файла могут дать дополнительные подсказки, если оригинал сохранил их. Но изображение, прошедшее через редактор, социальную сеть или пересылку, может потерять часть данных. Метаданные не превращаются в безусловное доказательство: их нужно сопоставлять с содержанием кадра, страницами публикации и другими доступными сведениями.

Так же осторожно стоит обращаться с архивными копиями. Они помогают увидеть прежний вид страницы, если она попала в архив. Но архив фиксирует страницу в определённый момент, а не удостоверяет автоматически ни подлинность картинки, ни точность подписи к ней. Мы проверяем весь след: изображение, описание, дату и связь публикации с предполагаемым событием.

Отсутствие результата говорит о границах поиска, а не о том, что у фотографии нет истории.

Что считать хорошим результатом проверки

У обратного поиска нет кнопки, которая выдаёт окончательный вердикт «подлинное» или «фейк». Его задача скромнее и полезнее: показать совпадения, подсказать возможные контексты и помочь найти страницы для дальнейшей проверки.

Я считаю проверку убедительной, когда вывод опирается на несколько независимых элементов: найдена ранняя публикация или объяснено, почему её установить не удалось; подпись к фото сопоставлена с содержимым кадра; дата и место не противоречат другим данным; альтернативные результаты поиска рассмотрены, а не отброшены из-за неудобства.

Если поиск показывает только похожие объекты, так и фиксируем: система нашла визуально близкие изображения, но не установила первоисточник. Если совпадений нет, не делаем выводов о происхождении снимка без других данных. Если несколько страниц повторяют одно изображение, сравниваем их хронологию и контекст, не выдавая первую найденную за исходную.

Алгоритм полезен ровно настолько, насколько точно мы понимаем его задачу. Поиск изображения по картинке помогает обнаруживать следы распространения фото. Установить его подлинность, дату и первоисточник можно только проверкой этих следов.

Частые вопросы

Почему поиск по картинке выдает товары вместо оригинала фотографии?
Системы вроде Google Lens используют нейросетевые алгоритмы для распознавания объектов и категорий, поэтому они предлагают визуально похожие товары, а не ищут первоисточник конкретного файла.
Можно ли с помощью обратного поиска установить личность человека на фото?
Нет, стандартные поисковики не используют биометрические модели для распознавания лиц. Они могут найти похожие изображения, но не подтверждают личность человека.
Что делать, если поиск по картинке не дает результатов?
Попробуйте выполнить поиск по отдельным фрагментам изображения, например, по характерным деталям или вывескам, а также воспользуйтесь несколькими разными поисковыми сервисами.
Является ли самая ранняя дата в поисковой выдаче датой создания снимка?
Не обязательно. Дата в сниппете может указывать на время обновления страницы или повторную публикацию, поэтому её необходимо сопоставлять с контекстом и другими данными.
Почему обрезка фотографии мешает поиску?
Алгоритмы сравнивают структуру изображения или его векторное представление, поэтому изменение композиции или удаление части кадра затрудняет сопоставление с исходным файлом.