欲しいストックフォトは、キーワードより「一文」で探す時代へ

実際の検索を 4 つ——通い慣れたカフェの常連客、人混みの中の孤独、純粋な比喩、そして同じクエリを 2 言語で。シーンをそのまま一文で描写するだけで、どんなキーワード欄にも勝るストックフォト検索の実力をお見せします。

シェア
朝の日差しが差し込む屋外のカフェのテーブルに腰かける年配の男性
写真提供:Pexels

その写真は、頭の中ではもう完璧に見えているはずです。やわらかな朝の光。歳月の刻まれた顔。小ぶりのカップ、人けのない通り、 そして「この人はこれを何千回も繰り返してきたのだろう」と一目で伝わる空気感。ところがストックフォトのサイトを開いた瞬間、 その鮮明なイメージを裏切って、検索欄が受け付けてくれる程度のキーワードに切り詰めるしかなくなります—— 老人カフェコーヒー。返ってくるのは、硬くて、ありきたりで、どこかズレた写真ばかり。

画像探しにつきまとうこのもどかしさは、世の中に写真が何枚あるかとはまるで関係ありません。 本当の問題は、こちらがどんな頼み方を許されているかという一点に尽きます。そこを変えていきましょう——そして、4 回続けて証明します。

キーワード検索が空回りする理由

従来のストックフォト検索——多くの写真ライブラリや Google Images のテキスト欄を支えているあの仕組み——の正体は、 要するにタグマッチングです。どの写真にも、人間やアルゴリズムがあらかじめ言葉を貼り付けてあります。たとえば 男性・テーブル・コーヒー・屋外といった具合に。検索すると、エンジンはこちらの言葉と そちらのタグを照らし合わせ、重なった数で順位を決めます。この方式は、決まって次の 3 通りで行き詰まります。

  • 語彙のズレ。こちらは「カフェ」、タグは「喫茶店」。こちらは「年配」、タグは「シニア」。意味は同じでも言い回しが違えば、タグマッチングはあっさり取りこぼします。
  • 意図の取りこぼし。クエリにはニュアンスが宿っています——日課であること、ひとりであること、30 年来の習慣であること。それを表すタグは存在しないので、エンジンはその意図を切り捨て、結局は名詞だけを拾います。
  • 長文ほど不利になる罠。丁寧に描写するほど、キーワード検索の精度は下がっていきます。単語を一つ足すたびに、タグに含まれていない確率の高い要素が一つ増えるからです。こうして私たちは、いつしかクエリをわざと雑にするクセを刷り込まれてしまいます。

セマンティック画像検索の正体

セマンティック画像検索とは、タグの言葉を突き合わせるのではなく、意味を手がかりに画像を探し出す仕組みです。 AI モデルが、入力したクエリと、インデックス上のすべての画像とを、それが何を主題にしているかを映し取った 数値の「指紋」(ベクトル)へと変換します。あとはエンジンが、クエリの指紋に最も近い指紋を持つ画像を返すだけ。 照合が「意味の空間」で行われるからこそ、入力した言葉が一つもタグに含まれていない写真でも、ぴたりと言い当てられるのです。

ここから導かれる 2 つの結論こそ、この記事で言いたいことのすべてです。

  • ふだんの自然な言葉でそのまま検索できます——友人にシーンを語って聞かせるように、一文まるごとで構いません。
  • 長く、具体的なクエリほど結果は良くなります。逆ではありません。ディテールを足すたびに照合が痩せるどころか、指紋の輪郭がくっきりしていきます。

検証:あえて「無理ゲー」な一文で試す

違いをはっきり見せるために、どんなキーワードシステムでも処理しきれない一文を選びました。長すぎて、具体的すぎて、しかもモノの羅列ではなく一つの物語を抱えているクエリです。

「30 年間、毎朝通い続けてきたカフェのテーブルに座る年配の男性。」

キーワード欄に入れると、結末は二つに一つ。文を 男性カフェ あたりまで削ぎ落とし、 ありきたりなストック写真をずらりと並べてくるか——あるいは文字列をそのまま受け取り、そんなタグの付いた写真など見つからず、 ほとんど何も返してこないか。30 年も、毎朝も、日課という静かな重みも、まるごと捨てられてしまうのです。 では、この一文をそのまま投げたとき、Pexafy が返してきたのが以下です。

30 年間、毎朝通い続けてきたカフェのテーブルに座る年配の男性
複数のライブラリを横断して取得した、実際の 1 ページ目の結果です。 同じ検索を自分で試す →

トップに出てきた一枚を見てください。屋外のカフェのテーブルにひとり腰かけた年配の男性が、まさに文章どおりの、 習慣めいた朝の静けさの中に収まっています。この写真に「30 年」とタグを付けた人はどこにもいません。それでもエンジンは、 文章が言わんとしたことをくみ取り、その情感ごと探し当てたわけです。一度なら、まぐれかもしれません。なら、あと 3 回やってみましょう。

1 ・ 対象のない感情:「人混みの街の中の孤独」

「孤独」というタグはどこにもありません。キーワードエンジンに見えているのは 人混み だけ。 だから返ってくるのは、絵はがきのような風景写真ばかりです。一方の Pexafy は、その奥にある感情を読み取ります—— 見知らぬ人々がぼやけて流れていく中に、ひとりだけ立ち止まった人物を、ちゃんと拾い上げてくるのです。

人混みの街の中の孤独
この検索を試す →

2 ・ 純粋な比喩:「みんなの期待を背負う重さ」

この一文には、そもそも写真に撮れる被写体が一つも出てきません。タグマッチングはお手上げです。ところが Pexafy は、 この比喩を最も具体的で人間くさい形に翻案してみせます——重い荷物を実際に背負って運ぶ人々の姿へと。

みんなの期待を背負う重さ
この検索を試す →

感情、比喩、物語——タイプの違う「無理ゲー」が 3 つ、そのどれにも、ちゃんとハマる写真が 3 組。 さらにもう一つ、そもそも誰がストックフォトを使えるのかを静かに塗り替えてしまう機能があります。

3 ・ 同じ検索を、どんな言語でも

キーワード検索の実力は、タグがどの言語で書かれているか——その大半は英語です——に縛られます。対する Pexafy は、 言語を問わず意味を同じ空間に投影するので、英語で打っても日本語で打っても、クエリは結局同じ場所に着地します。 試しに「漁師」を 2 通りの言語で検索してみると、こうなります。

EN “an old fisherman repairing his net at sunrise”

JA「夜明けの浜辺で網を繕う老漁師」

どちらの言語でも、トップに並ぶのは同じ 2 枚。翻訳したキーワードを突き合わせた結果ではありません—— 日本語からも英語からも、まったく同じ「理解」にたどり着いているのです。Pexafy はこの仕組みを、たった一つの 共通インデックス上で、100 以上の言語にわたって実現しています。

Google Images・Unsplash・Pexels との違い

誤解のないように言っておくと、Unsplash・Pexels・Pixabay は美しく、本当に自由に使える写真の宝庫です——Pexafy は それらすべて、さらにそれ以外のライブラリまで横断検索します。Google Images もオープンウェブのインデックス化にかけては無敵です。 差がつくのは写真そのものではなく、どんな頼み方を許されているかという一点なのです。

キーワード/タグ検索
Unsplash · Pexels · Pixabay
Google ImagesPexafy
照合の対象タグの言葉ページのテキストとタグ視覚的な意味
一文での検索精度が落ちる精度が落ちる精度が上がる
感情・比喩切り捨てられる切り捨てられるくみ取られる
英語以外のクエリ英語タグのみ対応一部対応100 以上の言語を単一インデックスで
1 検索あたりのソース1 ライブラリオープンウェブ9 個のライブラリを一括
明確なフリーライセンスありサイトごとに要確認あり——全結果が出典にリンク

舞台裏では、Pexafy は人間と同じやり方で一枚一枚を読み解いています——タグを鵜呑みにするのではなく、 ピクセルそのものを見るのです。ニューラルネットワークが、画像の中身と入力された言葉の意味の両方を吟味し、 それらを一つの共通空間に並べて配置します。あとは、入力した文章に最も近い画像を探すだけ——9 個の ライブラリを横断しても、所要時間は 100 ミリ秒に届きません。

一文で探すコツ:4 つのヒント

セマンティック検索を使い倒すには、しみついたキーワードのクセをいったん手放すのが近道です。

  1. 名詞を並べず、シーンを描く。「看護師 病院」ではなく、「夜の病院の廊下でひと息ついて休む、疲れた看護師」と書いてみてください。
  2. ムードを言葉にする。穏やか混沌ノスタルジックミニマル といった形容は、結果をしっかり方向づけます。ノイズどころか、れっきとした意味の一部です。
  3. 母語のままで入力する。わざわざ英訳する必要はありません。頭の中で考えているその言語で、そのまま打ち込みましょう。
  4. フィルターではなく、言葉で詰める。お堅い写真ばかり?「自然体、自然光、ドキュメンタリー」と足してみましょう。クリックで絞るのではなく、描写を重ねて研ぎ澄ますのです。

発想の転換はこれに尽きます——アイデアを「機械が渋々受け付けるキーワード」へ翻訳するのをやめ、 頭にすでに浮かんでいる絵を、ただありのまま描写すること。詰まっていたのは検索のやり方であって、ライブラリの中身では決してなかったのです。

よくある質問

セマンティック画像検索とは何ですか?
セマンティック画像検索とは、タグの言葉を突き合わせるのではなく、意味を手がかりに画像を探し出す仕組みです。AI モデルが、入力したクエリと手持ちのすべての画像を数値ベクトルに変換し、クエリのベクトルに最も近い画像を返します。だから「行きつけのカフェにいる年配の男性」のような一文の描写でも、その言葉でタグ付けされていない写真までぴたりと言い当てられるのです。
ストックフォトを一文(文章)で検索できますか?
できます。Pexafy では、人に語りかけるようにシーンをそのまま入力します——100 以上の言語のどれでも、一文まるごとで構いません。エンジンはその意図をどれだけ的確にとらえているかで写真をランク付けします。長く具体的なクエリほど結果が良くなるのがふつうで、キーワード検索とはまさに正反対です。
Pexafy は Pexels・Unsplash・Pixabay とどう違うのですか?
これらのライブラリ自体は優れた写真の供給源ですが、その検索は入力した言葉を人手で付けたタグと照合する方式です。Pexafy は Unsplash・Pexels・Pixabay にさらに 6 つのライブラリを加えた画像を一か所にインデックス化し、ニューラルモデルで視覚的な意味から検索します。クエリは一つ、結果も一つにまとまり、順位はタグではなく関連性で決まります。
Pexafy は無料で使えますか?
はい。Pexafy はフリーライセンスの画像(無料画像・著作権フリー画像)を対象とした無料の画像検索エンジンで、すべての結果は明確なライセンス情報とともに出典元へリンクされています。画像選定を自動化したいチーム向けには、開発者用の API も用意しています。

キーワード探しはもう終わり。伝えたいことをそのまま書きましょう。

無料利用可能な9M+点の画像を意味で検索。どの言語でも、100 ms未満で。