Поиск стоковых фото по описанию: почему фраза работает лучше ключевых слов
Четыре реальных запроса — завсегдатай кафе с тридцатилетним стажем, одиночество в толпе, чистая метафора и одна фраза на двух языках. Везде описание сцены обыгрывает любой набор ключевых слов.
Вы видите это фото до мельчайших деталей. Тёплый утренний свет. Лицо, тронутое временем. Маленькая чашка, тихая улица —
и то самое чувство, что этот человек проделывал так тысячу раз. Открываете сайт стоковых фото —
и тут же приходится предать картинку из головы, сжав её до ключевых слов, которые
стерпит поисковая строка: пожилой мужчина, кафе, кофе. А в ответ — что-то казённое, безликое и совсем не то.
Вот она, главная боль при поиске изображений, и дело тут вовсе не в том, сколько фотографий есть в природе. Дело в том, в какой форме вам разрешают их просить. Давайте это исправим — и докажем на деле четыре раза подряд.
Почему поиск по ключевым словам вас подводит
Классический стоковый поиск — тот, что работает в большинстве фотобанков и в строке Google Картинок, — устроен как сопоставление тегов. К каждому фото прикреплены слова, которые проставил человек или алгоритм: мужчина, стол, кофе, улица. Вы вводите запрос, движок сверяет ваши слова с этими и ранжирует по числу совпадений. И ломается такая схема тремя предсказуемыми способами:
- Расходятся слова. Вы пишете «кафе» — в теге «кофейня». Вы пишете «пожилой» — в теге «в возрасте». Смысл один, слова разные — и поиск по тегам пролетает мимо.
- Теряется замысел. У запроса есть настроение: рутина, одиночество, тридцать лет привычки. Тег этого не передаёт, поэтому движок отбрасывает идею и цепляется только за существительные.
- Чем длиннее запрос, тем хуже. Чем подробнее вы описываете, тем слабее отрабатывает поиск по ключевым словам: каждое лишнее слово — ещё один повод не найти совпадение в тегах. Вот вас и приучают резать запрос до пары слов.
Что на самом деле такое семантический поиск изображений
Семантический поиск изображений ищет картинки по смыслу, а не по совпадению слов в тегах. Модель ИИ переводит и ваш запрос, и каждое изображение в индексе в числовой отпечаток (вектор), который улавливает, о чём картинка по сути. Дальше движок выдаёт те снимки, чьи отпечатки лежат ближе всего к отпечатку запроса. Сравнение идёт в «пространстве смыслов» — поэтому описание попадает в фото, на котором нет ни одного из ваших слов.
Отсюда два следствия — и в них вся суть:
- Вы ищете обычным человеческим языком — целой фразой, как описали бы сцену приятелю.
- Длинные, насыщенные запросы работают лучше, а не хуже: каждая деталь не сбивает поиск, а заостряет отпечаток.
Тест: одна заведомо невозможная фраза
Чтобы разница стала наглядной, мы взяли запрос, который не вытянула бы ни одна система ключевых слов — слишком длинный, слишком конкретный, рассказывающий историю вместо перечня предметов:
«Пожилой мужчина сидит за столиком кафе, куда он приходит каждое утро вот уже тридцать лет.»
В поле ключевых слов случится одно из двух: оно либо ужмёт фразу до пожилой, мужчина,
кафе и вывалит стену безликого стока, либо поймёт строку буквально, не найдёт ничего
с такими тегами — и вернёт почти пустоту. Тридцать лет, каждое утро,
тихая тяжесть привычки — всё это летит в корзину. А вот что выдал Pexafy на ту же фразу, дословно:
Взгляните на первый результат: пожилой мужчина, один, за столиком уличного кафе — пойманный ровно в том привычном утреннем покое, о котором говорила фраза. Тега «тридцать лет» к этому фото никто не приписывал. Движок уловил, что фраза значила, и нашёл само чувство. Один раз — случайность. Так что повторим ещё трижды.
Ещё три запроса, на которых ломается поиск по тегам
1 · Эмоция без объекта: «одиночество в многолюдном городе»
Тега «одиночество» попросту нет. Поиск по ключевым словам видит только город и толпа — и подсовывает вам
открыточные виды. Pexafy же считывает само чувство: одну застывшую фигуру в размытой толчее незнакомцев:
2 · Чистая метафора: «тяжесть чужих ожиданий, которые приходится нести»
В этой фразе нет ни одного предмета, который можно сфотографировать. Поиск по тегам тут бессилен. А Pexafy разворачивает метафору в самую буквальную, человеческую форму — люди, тащащие на себе непомерный груз:
Эмоция, метафора, целая история — три разных сорта «невозможного» и три подборки по-настоящему точных снимков. Осталась ещё одна способность, которая незаметно расширяет круг тех, кому стоковые фото вообще доступны.
3 · Одна фраза — на любом языке
Поиск по ключевым словам хорош ровно настолько, насколько хорош язык тегов, — а это почти всегда английский. Pexafy проецирует смысл в одно и то же пространство независимо от языка, так что запрос попадает в одну и ту же точку, набрали вы его по-английски или по-русски. Смотрите, что выходит, когда мы ищем рыбака двумя способами:
Те же два фото в топе — и на русском, и на английском. Это не перевод списка ключевых слов, а одно и то же понимание, к которому система приходит хоть с русского, хоть с английского. И так Pexafy работает на 100+ языках — по одному общему индексу.
Чем это отличается от Google Картинок, Unsplash и Pexels
Сразу оговоримся: Unsplash, Pexels и Pixabay — это прекрасные, по-настоящему свободные в использовании фото, и Pexafy ищет по ним всем, и не только. А Google Картинки вне конкуренции по охвату открытого веба. Разница не в самих снимках — она в том, в какой форме вам разрешают спрашивать.
| Поиск по ключевым словам / тегам Unsplash · Pexels · Pixabay | Google Картинки | Pexafy | |
|---|---|---|---|
| Ищет по | Словам в тегах | Тексту страницы и тегам | Визуальному смыслу |
| Запрос целой фразой | Работает хуже | Работает хуже | Работает лучше |
| Эмоция и метафора | Отбрасываются | Отбрасываются | Понимаются |
| Запрос не на английском | Только английские теги | Частично | 100+ языков, один индекс |
| Источников на запрос | Одна библиотека | Открытый веб | 9 библиотек сразу |
| Понятная свободная лицензия | Да | Проверять придётся на каждом сайте | Да — у каждого результата есть ссылка на источник |
Под капотом Pexafy «читает» каждое фото так, как это сделал бы человек, — не полагаясь на теги, а вглядываясь в пиксели. Нейросеть разбирает и реальное содержимое каждого снимка, и смысл ваших слов, а затем сводит то и другое в одно общее пространство. Найти нужное фото — значит отыскать те, что ближе всего к вашей фразе, и всё это по 9 библиотекам — меньше чем за 100 миллисекунд.
Как искать по фразе: 4 совета
Чтобы выжать из семантического поиска максимум, придётся отвыкнуть от пары привычек, оставшихся от ключевых слов:
- Описывайте сцену, а не перечисляйте существительные. Пишите «усталая медсестра на тихом ночном перерыве в больничном коридоре», а не «медсестра больница».
- Добавляйте настроение. Слова вроде спокойный, хаотичный, ностальгический, минималистичный действительно направляют выдачу — это часть смысла, а не шум.
- Пишите на родном языке. Переводить ничего не надо — набирайте фразу на том языке, на котором думаете.
- Уточняйте словами, а не фильтрами. Слишком «корпоративно»? Допишите «непостановочно, естественный свет, документальная съёмка». Доводите запрос описанием, а не кликами по галочкам.
В этом и весь поворот: хватит переводить идею в ключевые слова, которые стерпит машина, — просто опишите картинку, которую вы и так видите перед глазами. Узким местом всегда был поиск, а не библиотека.