Bildsuche-Infrastruktur für KI-Agenten: Was der Markt wirklich liefert

Getty hat diesen Monat einen MCP-Server ausgeliefert; die freien Bibliotheken haben noch gar keinen. Ein reproduzierbarer Benchmark, eine Registry-Zählung und die Bedingungen der vier großen Foto-APIs — gelesen, als wärst du die Maschine, die ihnen gehorchen muss.

Ein weißer, 3D-gerenderter Roboter, der eine Lupe über den Kopf hält, auf rosa Hintergrund.
Foto über Unsplash

Jedes Agenten-Framework, das dieses Jahr ausgeliefert wurde, kann schreiben, planen, Tools aufrufen und einen Pull Request öffnen. Bittet man eines um ein Foto, verkommt das Ganze zu einem Achselzucken: eine aus dem Gedächtnis erfundene Stock-URL, ein defekter Hotlink, oder ein generiertes Bild, weil das Suchen nach einem echten schwieriger war als das Erfinden eines neuen. Die Modelle sind nicht das schwache Glied. Die Bild-Ebene darunter ist es — und sie fehlt auf sehr konkrete, messbare Weise.

Das hier ist eine Marktstudie, kein Manifest. Alles Folgende wurde am 18. August 2026 gemessen oder aus einer Primärquelle gelesen: eine Bestandsaufnahme des offiziellen MCP-Registry, die veröffentlichten Nutzungsbedingungen der vier großen freien Foto-APIs, die Zugangsbedingungen der beiden zahlungspflichtigen Platzhirsche, die diesen Monat Agenten-Connectoren ausgeliefert haben, sowie ein kleiner reproduzierbarer Benchmark, den man ohne API-Key in einer Minute selbst nachvollziehen kann.

Eine Abgrenzung vorab, damit Sie früh aufhören können zu lesen, falls das nicht Ihre Frage ist: Dieser Artikel behandelt die Zugriffsebene — Retrieval, Erreichbarkeit, Nutzungsbedingungen, Kontingente. Nicht die Publishing-Pipeline. Wenn Sie wissen wollen, wie aus einem Entwurf illustrierte, mit Credits versehene, ausgezeichnete Seiten werden — der Router-Prompt, die visuellen Briefings, die Montage, das ImageObject-Markup —, das ist separat ausgearbeitet in der Pipeline, die KI-geschriebene Artikel illustriert.

Was sich ändert, wenn der Aufrufer eine Maschine ist

Ein Mensch, der ein Foto sucht, tippt zwei oder drei Wörter, überblickt ein Raster und erkennt ein gutes Bild, wenn er es sieht. Jede je gebaute Stock-Suchmaschine setzt diesen Ablauf voraus. Ein Agent bricht alle drei Annahmen gleichzeitig:

  1. Er schreibt Sätze, keine Keywords. Ein Modell, das gerade einen Abschnitt über Hypothekenunterlagen entworfen hat, gibt nicht Hypothek aus; es gibt „eine Frau, die an einem Küchentisch ein Hypothekendokument unterschreibt, während ein Bankberater die Bedingungen erklärt“ aus. Das ist die natürliche Ausgabe eines Sprachmodells, und genau das kann ein Token-Matching-Index nicht bedienen.
  2. Er kann kein Raster überblicken. Was das Tool zurückgibt, ist alles, was der Agent weiß. Wenn die Antwort nur eine Liste von URLs ohne Beschreibung, Abmessungen oder Credit ist, muss der Agent jedes Bild abrufen und ansehen — oder, viel häufiger, raten.
  3. Er hat keine Hände. Er kann keine Screenshots in eine Prüfwarteschlange laden, keine Bedingungen akzeptieren, keinen Key rotieren oder drei Werktage auf eine Produktions-Freischaltung warten. Jeder menschliche Schritt im Onboarding einer API ist eine Wand, an der der Agent stehen bleibt.

„Bildsuch-Infrastruktur für KI-Agenten“ ist also keine Marketingphrase. Es ist eine Checkliste: Retrieval in natürlicher Sprache, maschinenlesbare Ergebnisse, reich genug, um darüber nachzudenken, und ein Authentifizierungs- und Kontingentmodell, das ein Programm eigenständig durchlaufen kann.

Der Test: ein Satz gegen einen Keyword-Index

Der günstigste Weg, das Problem zu sehen, ist, einer Keyword-Engine die eigenen Worte eines Agenten zu schicken. Der folgende Test verwendet Openverse, die von WordPress.org betriebene Suche für frei lizenzierte Medien, weil deren API öffentlich ist, keinen Key benötigt, und jeder, der dies liest, ihn in unter einer Minute selbst nachvollziehen kann. Vier Briefings, wie sie ein Modell schreibt, wenn es illustriert, was es gerade entworfen hat:

openverse_briefs.py — kein Key, keine Anmeldung, 20 Zeilen
import json, urllib.request, urllib.parse

BRIEFS = [
  "a woman signing a mortgage document at a kitchen table while a bank"
  " adviser explains the terms, warm morning light",
  "An elderly couple enjoying a peaceful retirement together",
  "a child discovering snow for the first time in a suburban garden",
  "a delivery cyclist waiting at a red light in heavy rain",
]

def count(q):
    u = "https://api.openverse.org/v1/images/?" + urllib.parse.urlencode({"q": q})
    r = urllib.request.Request(u, headers={"User-Agent": "benchmark/1.0"})
    return json.load(urllib.request.urlopen(r))["result_count"]

for b in BRIEFS:
    print(count(b), "|", b[:48])
# 0 | a woman signing a mortgage document at a kitchen
# 0 | An elderly couple enjoying a peaceful retirement
# 0 | a child discovering snow for the first time in a
# 0 | a delivery cyclist waiting at a red light in hea

Vier Briefings, vier leere Ergebnismengen. Kürzt man jedes Briefing nun auf die zwei Keywords, die ein Mensch getippt hätte — signing document, elderly couple, child snow, cyclist rain —, liefert jedes eine volle Ergebnisseite mit Fotos (die API meldet 240, dort deckelt sie die Zählung für anonyme Aufrufer). Der Katalog enthält die Bilder. Der Satz ist das, was er nicht verarbeiten kann.

Das Briefing, das ein Agent tatsächlich schreibt Keyword-EngineOpenverse, ganzer Satz Keyword-Engineauf 2 Keywords gekürzt Semantische EnginePexafy, ganzer Satz
„eine Frau, die an einem Küchentisch ein Hypothekendokument unterschreibt, während ein Bankberater die Bedingungen erklärt…“ 0 Ergebnisse 240 (gedeckelt) 16 Ergebnisse · 148 ms
„Ein älteres Paar genießt gemeinsam einen friedlichen Ruhestand“ 0 Ergebnisse 240 (gedeckelt) 16 Ergebnisse · 135 ms
„ein Kind entdeckt in einem Vorstadtgarten zum ersten Mal Schnee“ 0 Ergebnisse 240 (gedeckelt) 16 Ergebnisse · 147 ms
„ein Lieferrad-Fahrer wartet bei starkem Regen an einer roten Ampel“ 0 Ergebnisse 240 (gedeckelt) 16 Ergebnisse · 149 ms

Die Pexafy-Spalte zeigt dieselben vier Sätze, unverändert an search_photos auf dem gehosteten MCP-Server gesendet, mit der vom Server selbst gemeldeten Latenz. Das ist ein Vergleich von Anfrageformen, nicht von Katalogqualität — und der Katalog ist ausdrücklich nicht das Problem. Openverses eigener Statistik-Endpunkt meldet am Testtag 915 Millionen Bilder aus 52 Quellen, und die Engine ist ausgezeichnet in dem, wofür sie gebaut wurde: Keyword-Suche, für Menschen. Daran ist nichts kaputt. Sie wurde nur nie für einen Aufrufer entworfen, der in Sätzen denkt. Warum Tag-Matching an einer beschriebenen Szene scheitert — und was semantisches Retrieval stattdessen leistet — wird aus Sicht der Leserin/des Lesers dargelegt in Suchen mit einem Satz statt mit Keywords; neu ist hier die Messung, und was sie bedeutet, wenn der Aufrufer ein Programm statt eine Person ist.

„Ein älteres Paar genießt gemeinsam einen friedlichen Ruhestand“ · 16 Ergebnisse in 135 ms · drei davon
Eine Anfrage, drei verschiedene Bibliotheken, Credits inklusive. Kein Wort in diesem Satz ist ein Tag: friedlich und gemeinsam sind es, die Bänke, Gärten und ruhiges Wasser nach oben bringen — statt eines Stock-Porträts von zwei Menschen über sechzig.

Der Markt, Stand 18. August 2026

Retrieval ist die eine Hälfte. Die andere ist Erreichbarkeit: Kommt ein Agent überhaupt an den Katalog heran, und zu welchen Bedingungen? Seit das Model Context Protocol zum Standardweg wurde, über den Assistenten sich mit externen Systemen verbinden — dessen aktuelle Spezifikation vom 28. Juli 2026 das Protokoll auf einen zustandslosen Request/Response-Kern umgestellt hat, sodass Server hinter gewöhnlichen Load-Balancern stehen können1 — ist der ehrliche Weg, diesen Markt zu erfassen, der Blick auf das tatsächlich Veröffentlichte, nicht das Angekündigte.

Die zahlungspflichtigen Platzhirsche kamen diesen Monat

Getty Images hat seinen MCP-Server am 12. August 2026 gestartet, sechs Tage vor diesem Artikel, und öffnet damit kreative, editoriale und archivarische Suche sowie Download für KI-Workflows.2 Er richtet sich an Enterprise-Teams und Plattformbauer, und die eigene Zugangsseite ist eindeutig über den Einstiegspreis: Man braucht einen aktiven Getty-Images-Vertrag, etwa Premium Access, plus Zustimmung zu den Web-Service-Bedingungen. Eine kostenlose Stufe gibt es nicht. Shutterstock-Inhalte sind ebenfalls über einen MCP-Server erreichbar — 24 Tools für Suche, Sammlungen und Lizenzierung —, wobei Downloads hinter einem Konto mit aktivem Abonnement liegen.3

Beide Schritte sind rational, und beide zielen auf einen bestimmten Käufer. Getty verbuchte 2025 einen Umsatz von 981,3 Millionen US-Dollar4 in einem Stockfotografie-Markt, der für 2026 auf rund 5,4 Milliarden US-Dollar taxiert wird5; Connectoren, die einen Vertrag voraussetzen, schützen diesen Umsatz, statt ihn zu öffnen. Wer eine Bank oder ein Sendeunternehmen ist, will genau das. Wer ein Nebenprojekt verkabelt — oder ein Agent ist, der nicht anhalten und einen Menschen bitten darf, etwas zu unterschreiben — steht vor einer verschlossenen Tür.

Die freien Bibliotheken haben überhaupt keinen ausgeliefert

Unsplash, Pexels und Pixabay sind die drei Kataloge, zu denen die meisten Entwickler greifen, und keiner davon veröffentlicht einen offiziellen MCP-Server. Was es stattdessen gibt, ist ein Regal voller Community-Wrapper. Wir haben das offizielle MCP-Registry vollständig durchsucht — 22.607 Server, 75.487 veröffentlichte Versionen — und jeden Eintrag behalten, dessen Name oder Beschreibung sich auf Foto- oder Stockbild-Suche bezieht. Das Muster ist einheitlich:

Offizielles MCP-Registry, 18. Aug. 2026 Anzahl Was das für einen Agenten bedeutet
Im Registry gelistete Server, alle Kategorien 22.607 Das gesamte Ökosystem, aus dem ein Agent Tools ziehen kann
Server passend zu photo / image / stock / picture und den Bibliotheksnamen 137 Die meisten sind Editoren, Generatoren oder persönliche Fototools, keine Suche
…die tatsächlich Stock- oder frei lizenzierte Fotografie durchsuchen 11 Das gesamte adressierbare Angebot
…veröffentlicht von Unsplash, Pexels, Pixabay oder Openverse selbst 0 Jeder ist ein Wrapper von Dritten; einer wird in der eigenen Beschreibung als „Unofficial“ bezeichnet
…die lokal laufen und Ihren eigenen Drittanbieter-API-Key benötigen 7 UNSPLASH_ACCESS_KEY, PEXELS_API_KEY, PIXABAY_API_KEY… ein Mensch muss jeden davon zuerst beschaffen
…erreichbar als gehosteter Remote-Server 4 Alle vier sind Single-Source-Gateways eines einzigen Drittanbieters, vorgeschaltet vor denselben Keyword-APIs
Einträge für Getty oder Shutterstock 0 Ihre Server existieren, werden aber außerhalb des öffentlichen Registrys an Kontoinhaber verteilt
census.py — der Registry-Crawl hinter dieser Tabelle
import json, urllib.request, urllib.parse

def crawl(term):                      # das Registry paginiert per `nextCursor`
    out, cursor = {}, None
    while True:
        p = {"limit": "100", "search": term} | ({"cursor": cursor} if cursor else {})
        d = json.load(urllib.request.urlopen(
            "https://registry.modelcontextprotocol.io/v0/servers?" + urllib.parse.urlencode(p)))
        for e in d["servers"]: out[e["server"]["name"]] = e["server"]
        cursor = (d.get("metadata") or {}).get("nextCursor")
        if not cursor or not d["servers"]: return out

servers = {}
for t in ["photo", "image", "stock", "picture", "unsplash",
          "pexels", "pixabay", "getty", "shutterstock", "openverse"]:
    servers |= crawl(t)

# 137 eindeutige Server · remote vs. lokal steht in `server["remotes"]`
# die benötigten Drittanbieter-Keys stehen in packages[].environmentVariables

Jeder dieser Wrapper ist ein dünner Client derselben drei Keyword-APIs, was bedeutet, dass der Benchmark oben auf alle zutrifft: Der Transport hat sich geändert, das Retrieval nicht. Ein Wrapper kann einem Tag-Index nicht beibringen, einen Satz zu verstehen.

Die Klausel, die eine Maschine stoppt, ist nicht das Kontingent

Die Kontingente und Nutzungsbedingungen der freien Bibliotheken werden in einer gemeinsamen Einheit nebeneinandergestellt in dem Vergleich freier Stock-Foto-APIs — die Freigabewarteschlangen, der obligatorische Download-Aufruf, die 24-Stunden-Caching-Pflicht, die Attributionsregeln. Jener Artikel liest sie aus der Perspektive eines Entwicklers, der einen Anbieter auswählt. Liest man sie erneut aus der Perspektive des Programms, das ihnen gehorchen muss, sticht eine Zeile heraus, die nichts mit Volumen zu tun hat:

Pixabays Anfragefeld akzeptiert 100 Zeichen. Die vier Briefings im Benchmark oben sind im Schnitt 72 Zeichen lang, und das Hypotheken-Briefing kommt auf 114 — es würde von vornherein abgelehnt, nicht bloß schlecht gerankt. Pexels und Unsplash veröffentlichen keine Längenbegrenzung, weil sie nie erwartet haben, eine zu benötigen: ihre dokumentierten Beispiele sind Ocean, Tigers, Pears. Ein Feld, das für zwei Wörter dimensioniert ist, sagt etwas darüber aus, wer als Aufrufer erwartet wurde, und keine Kontingenterhöhung behebt das. Der semantische Endpunkt, mit dem ein Agent spricht, nimmt 500 Zeichen, weil der Nebensatz — „…während ein Bankberater die Bedingungen erklärt“ — genau der Teil ist, der das Retrieval gut macht.

Dieselbe Lesart gilt fürs Onboarding. Eine Demo-Stufe, die erst zur Produktivstufe wird, nachdem ein Mensch Screenshots Ihrer App geprüft hat, ist kein Rate-Limit, von dem ein Agent zurücktreten kann; es ist ein Schritt, den er überhaupt nicht ausführen kann. Pixabay formuliert die Absicht ausdrücklich — die API ist für legitime menschliche Nutzung, und massenhaftes automatisiertes Herunterladen ist untersagt. Nichts davon ist unangemessen: Fotografinnen und Fotografen geben die Arbeit her, und jemand bezahlt die Bandbreite. Es beschreibt schlicht eine API, deren Aufrufer als Wesen mit Bildschirm und einem Paar Händen gedacht war.

Vier Anforderungen, und wer sie erfüllt

Setzt man die beiden Hälften zusammen, ergibt sich für eine Bild-Ebene, die ein Agent tatsächlich nutzen kann, eine kurze und überprüfbare Spezifikation. Es ist bewusst kein Anbietervergleich — Katalogumfang, Preise und Lizenzbedingungen stehen nebeneinander in dem Vergleichsartikel. Diese vier Punkte betreffen nur, ob ein Programm überhaupt an die Bilder herankommt:

  1. Semantisches Retrieval — ein ganzer Satz liefert eine gerankte Ergebnisseite, keine leere Menge.
  2. Freie Lizenzen, mehrere Quellen — nichts, was pro Bild lizenziert werden muss, und kein Geschmack einer einzelnen Bibliothek, der jede veröffentlichte Seite bestimmt.
  3. Ein gehosteter Server mit eigenem Sign-in — remote, OAuth, kein lokaler Prozess zum Installieren und kein API-Key eines Dritten, der in eine Konfigurationsdatei eingefügt werden muss.
  4. Eine kostenlose Stufe, die eine Maschine allein durchlaufen kann — keine Screenshot-Prüfung, kein Vertrag, ein monatliches Kontingent und ein Rate-Limit pro Minute, an dem sich ein Worker orientieren kann.
Stand 18. Aug. 2026 Semantisch Freie Lizenzen, mehrere Quellen Gehosteter Server + OAuth Self-Service-Free-Tier
Getty Images MCP Suche in natürlicher Sprache Lizenzierter Katalog, pro Vertrag Ja, für Kontoinhaber Nein — aktiver Vertrag erforderlich
Shutterstock via MCP Keyword-basiert Lizenzierter Katalog, Abonnement Ja, mit Konto-Authentifizierung Nein — Abonnement zum Download erforderlich
Unsplash-/Pexels-/Pixabay-Wrapper Nein — darunter liegende Keyword-APIs Jeweils eine einzige Quelle Nein — lokaler Prozess, eigener Key Erbt das menschliche Onboarding der Host-API
Openverse Nein — Keyword-Index Ja, sehr breiter CC-Katalog Kein offizieller MCP-Server Ja, offene API
Pexafy Ja — Sätze, bis zu 500 Zeichen 9 freie Lizenzquellen, 9 Mio.+ Fotos Ja — mcp.pexafy.com/mcp, OAuth 2.1 Ja — 5,000 Anfragen/Monat, 20/Min., keine Karte

Wir bauen Pexafy, lesen Sie diese letzte Zeile also mit der Skepsis, die ihr zusteht — und prüfen Sie sie dann: Die Registry-Bestandsaufnahme ist mit einem Skript reproduzierbar, die Zugangsbedingungen von Getty und Shutterstock stehen auf ihren eigenen Seiten, und die Limits der drei Foto-APIs stehen in ihrer eigenen Dokumentation, alles unten verlinkt. Die Aussage ist eng gefasst und falsifizierbar: Am 18. August 2026 konnten wir keinen zweiten Dienst finden, der alle vier Punkte erfüllt. Wenn Sie einen kennen, fügen wir ihn dieser Tabelle hinzu — der Sinn, die Anforderungen niederzuschreiben, ist ja, dass jeder sie gegen jedes Produkt prüfen kann, einschließlich unseres eigenen.

Was ein guter Bild-Server über MCP leistet

Ein Connector ist kein REST-Endpunkt mit neuem Anstrich. Zwei Anwendungen dieser Ebene sind an anderer Stelle ausgearbeitet und werden hier nicht wiederholt — das Illustrieren eines Entwurfs in dem Pipeline-Artikel, und das visuelle Zusammenhalten einer langen Serie in dem Artikel über Volumen. Was zur Infrastruktur gehört, ist das, worauf beide aufbauen und was keines nachträglich hinzufügen kann: drei serverseitige Entscheidungen, einmal getroffen, für jeden Agenten, der sich je verbindet.

1. Objekte zurückgeben, über die ein Agent nachdenken kann. Was das Tool zurückgibt, ist alles, was das Modell weiß — es kann kein Raster überblicken. Der Unterschied zwischen den beiden folgenden Formen ist der Unterschied zwischen einem Assistenten, der über Fotografien nachdenkt, und einem, der Links weiterleitet:

Dasselbe Foto, als zwei unterschiedliche Tool-Ergebnisse
# Typischer Keyword-Wrapper: Der Agent muss abrufen und ansehen, oder raten
[{ "url": "https://…/photo-8795398.jpeg" }, { "url": "https://…/366611.jpg" }]

# Ein Ergebnis, wie zurückgegeben — hier gekürzt, nichts hinzugefügt
{
  "rank": 1,                       // der Bezug, den ein Mensch nutzt: „mehr wie #1“
  "photo_id": "019e14d9-e821-…",   // was get_similar_photos entgegennimmt
  "width": 6424, "height": 4283, "orientation": "landscape",
  "color_hex": "#918872", "blur_hash": "LPI#Px?aDikCGwW?M{kD-VR*s.fl",
  "source": "Pexels", "license_type": "free",
  "alt_description": "Older couple sits together on wooden bench in a park",
  "attribution": { "plain": "Photo by Anastasia Shuraeva on Pexels", "html": "…" },
  "urls": { "thumb": "…", "small": "…", "regular": "…", "large": "…" }
}

Mit der zweiten Form kann ein Agent sagen „#3 ist Hochformat, das sprengt Ihren Hero-Slot“, einen doppelt vorkommenden Fotografen streichen, die Credit-Zeile ausgeben und Ihrer Vorlage ein width/height-Paar übergeben, das Layout-Shift verhindert — ohne ein einziges Bild abzurufen. Mit der ersten ist jede dieser Entscheidungen ein Ratespiel oder ein Extra-Aufruf.

2. Ergebnisse nummerieren, damit jemand darauf zeigen kann. Ergebnisse kommen gerankt zurück als #1, #2, #3…, so wie jeder im Gespräch auf ein Foto verweist — „mehr wie #3“ — ohne handschriftlich kopierte IDs. In Clients, die MCP Apps unterstützen, werden die Thumbnails inline gerendert, und das Öffnen eines davon zeigt Metadaten, die bereits im Tool-Ergebnis vorhanden waren, ohne zusätzlichen Aufruf.

3. Read-only bleiben, und das ausdrücklich. Drei Tools, kein Schreibzugriff, keine Kontoänderung. Eines davon hat nirgendwo ein Keyword-Äquivalent: search_photos_by_image nimmt ein Referenzbild — das bestehende Hero-Bild eines Kunden, einen ins Chat eingefügten Screenshot — plus einen optionalen Satz, um es zu variieren („wie dieses, aber nachts“). Es gibt kein Feld in einer Tag-Matching-API, in das man diese Anfrage überhaupt eintippen könnte. Und ein Agent, der nichts verändern kann, ist ein Agent, dessen schlimmstes Ergebnis eine leere Ergebnismenge ist, kein Support-Ticket.

Die zwei Zugangswege, und welchen Sie wollen

Es gibt genau zwei Wege hinein, und die Wahl richtet sich danach, wer eingebunden ist, nicht nach Fähigkeiten — die Tools und der Katalog sind auf beiden identisch.

Der Connector, wenn ein Mensch beteiligt ist. Eine einzige URL, https://mcp.pexafy.com/mcp, einmal in den Connector-Einstellungen eines Assistenten hinzugefügt; die Anmeldung erfolgt in einem Browserfenster, und der Client erhält seine eigenen Zugangsdaten, sodass es keinen Key gibt, der in eine Konfigurationsdatei eingefügt oder später rotiert werden müsste. Clients, die OAuth nicht implementieren, senden einen Pexafy-API-Key als Bearer-Token an denselben Endpunkt — wodurch der Connector auch von einem Cron-Job auf einem Build-Server aus nutzbar ist, wo niemand da ist, um auf „Erlauben“ zu klicken. Die Schritt-für-Schritt-Verkabelung für Claude, ChatGPT und eine Fleet-Konfigurationsdatei steht in dem Pipeline-Artikel; daran hat sich nichts geändert.

Die HTTP-API, wenn niemand beteiligt ist. Ein Batch-Job, der einen Pool für 800 Themen-Cluster füllt, sollte nicht so tun, als sei er ein Chat-Client: dasselbe Konto, derselbe Key, reines HTTP, 100 Ergebnisse pro Aufruf. Die dazugehörigen Taktregeln — die Rate-Limit-Header, warum sich ein Pro-Minute-429 lohnt zu wiederholen und ein Monatskontingent-429 nicht, was ein Worker im großen Umfang kostet — gehören zu dem Artikel über das Illustrieren im großen Maßstab, wo dieser Worker vollständig ausgearbeitet ist.

Der Punkt, den man hier festhalten sollte, ist enger gefasst, und genau darum dreht sich die Marktstudie: Beide Zugangswege sind für ein Programm am Tag ihrer Erstellung erreichbar, ohne Warteschlange und ohne Vertrag.

Was das nicht löst

Eine ehrliche Liste, denn jeder dieser Punkte hat schon jemanden ein Rollback gekostet.

  • Die Lizenz regelt weiterhin das Bild. Attribution ist von den Pexafy-API-Nutzungsbedingungen nicht vorgeschrieben, und jedes Ergebnis liefert eine fertige Attributionszeile mit — aber die Lizenz der Ursprungsbibliothek gilt für Ihre Nutzung dieses Fotos. Rendern Sie den Credit automatisch; das ist günstiger als eine spätere Prüfung.
  • Freie Lizenzkataloge sind keine editorialen Archive. Keine Nachrichten, kein Sport, keine erkennbaren Marken oder Personen des öffentlichen Lebens auf Abruf. Wenn Ihre Seite ein Foto eines bestimmten Ereignisses oder einer bestimmten Person braucht, sind dafür die lizenzierten Platzhirsche da, und ihre Connectoren existieren jetzt.
  • Es ist Retrieval, und nur Retrieval. Diagramme, Grafiken und Screenshots werden aus Code gerendert, nicht gesucht; Deduplizierung über Ihre Seiten hinweg ist eine Spalte in Ihrer Datenbank, kein Parameter des Endpunkts; und kein Foto verhilft einer dünnen Seite zu einem Ranking — Googles Spam-Richtlinien behandeln Scaled Content Abuse gleich, ob die Seiten illustriert sind oder nicht.6 Diese drei Punkte sind Pipeline-Probleme mit Pipeline-Lösungen, ausgearbeitet in dem Pipeline-Artikel und dem Artikel über Volumen.

Wo Sie anfangen

  1. Führen Sie den Benchmark selbst aus. Zwanzig Zeilen, kein Key. Welche Bild-API Sie heute auch nutzen — schicken Sie ihr drei Briefings Ihres eigenen Agenten wortgetreu und zählen Sie die leeren Ergebnismengen.
  2. Binden Sie einen Connector ein in den Assistenten, den Sie bereits nutzen, und bitten Sie ihn, in einem Satz, um ein Foto, das Sie diese Woche tatsächlich brauchen. Das ist die ganze Bewertung.
  3. Verlegen Sie die Briefings in den Agenten — eine Szene pro Slot, aus dem Entwurf geschrieben, nie aus dem Titel.
  4. Fügen Sie die Spalte photo_id hinzu, bevor Sie irgendetwas im großen Umfang veröffentlichen.
  5. Betreiben Sie es auf der kostenlosen Stufe — 5,000 Suchen pro Monat bei 20 pro Minute, bis ein Build-Fenster, nicht eine Rechnung, Sie zum Upgrade zwingt.

Quellen & Fußnoten

1 Model-Context-Protocol-Spezifikation vom 28. Juli 2026: zustandsloser Request/Response-Kern, Issuer-Validierung nach RFC 9207, Client-ID-Metadata-Dokumente als Ersatz für Dynamic Client Registration, sowie Methoden-/Tool-Namen in HTTP-Headern für das Gateway-Routing.

2 Getty Images Newsroom, 12. August 2026 — „Getty Images Launches MCP Server to Connect Creative and Editorial Content to AI Workflows and Products“. Die Zugangsseite stellt klar, dass die Nutzung einen aktiven Getty-Images-Vertrag voraussetzt, etwa Premium Access, sowie die Zustimmung zu den Web-Service-Bedingungen.

3 Shutterstocks Katalog ist über einen MCP-Server mit 24 Tools (Suche, Sammlungen, Lizenzierung) zugänglich, verteilt über eine Drittanbieter-MCP-Plattform statt, zum Zeitpunkt der Erstellung dieses Artikels, über Shutterstocks eigenes Entwicklerportal angekündigt; Lizenzierung und Download setzen ein Konto mit aktivem Abonnement voraus.

4 Getty Images Holdings, Jahresergebnis 2025 (veröffentlicht am 16. März 2026): Umsatz von 981,3 Mio. US-Dollar, ein Plus von 4,5 % gegenüber dem Vorjahr.

5 Mordor Intelligence, Stockfotografie-Markt: 5,44 Mrd. US-Dollar im Jahr 2026, mit einer CAGR von 6,86 %. Marktgrößenschätzungen unterscheiden sich je nach Methodik; sie wird hier nur zur Größenordnung zitiert.

6 Googles Spam-Richtlinien für die Suche — Scaled Content Abuse: das Erzeugen vieler Seiten primär zur Manipulation von Rankings, mit geringem Nutzen für die Nutzer, unabhängig davon, ob dies durch Automatisierung, menschlichen Aufwand oder eine Kombination beider geschieht.

Häufig gestellte Fragen

Warum liefern Stock-Foto-APIs nichts, wenn ein KI-Agent sie durchsucht?
Weil der Agent einen Satz sendet und die API Tags indexiert. Wortgetreu an eine Keyword-Bild-API gesendet, lieferten vier agentenartige Briefings — zum Beispiel „An elderly couple enjoying a peaceful retirement together” — jeweils null Ergebnisse; auf zwei Schlagwörter gekürzt (elderly couple), lieferte derselbe Katalog Hunderte. Pixabay begrenzt seine Anfrage auf 100 Zeichen, was die meisten Agenten-Briefings von sich aus überschreiten. Eine semantische Engine bettet den gesamten Satz ein, sodass Nebensätze wie „tired” oder „at night” das Ranking verändern, statt den Treffer zu zerstören.
Gibt es einen offiziellen MCP-Server für Unsplash, Pexels oder Pixabay?
Nein. Ein vollständiger Crawl der offiziellen MCP-Registry am 18. August 2026 fand 11 Server, die Stock- oder freilizenzierte Fotografie durchsuchen, und keinen davon von Unsplash, Pexels, Pixabay oder Openverse selbst veröffentlicht — ein Wrapper bezeichnet sich sogar selbst als „Unofficial”. Sieben laufen lokal über stdio und erfordern, dass man den eigenen API-Key der jeweiligen Bibliothek bereitstellt; die vier entfernten sind Single-Source-Gateways, die von einem Drittanbieter vor denselben Keyword-APIs betrieben werden.
Was kostet der Getty-Images-MCP-Server, und kann ihn jeder nutzen?
Getty hat seinen MCP-Server am 12. August 2026 für Entwickler, Enterprise-Teams und KI-Plattform-Builder eingeführt, mit Abdeckung von kreativer, redaktioneller und archivarischer Suche und Download. Der Zugang erfordert eine aktive Getty-Images-Vereinbarung, etwa Premium Access, sowie die Akzeptanz der Web-Service-Bedingungen; es wird keine kostenlose Stufe angeboten, und die Preisgestaltung übernimmt ein Account-Vertreter. Shutterstock-Inhalte sind ähnlich über MCP erreichbar, wobei die Lizenzierung an ein aktives Abonnement gebunden ist.
Was braucht eine Bildsuch-API, um von einem KI-Agenten nutzbar zu sein?
Vier Dinge. Semantisches Retrieval, sodass ein vollständiger Satz eine gerankte Ergebnisseite statt eine leere Menge liefert. Ergebnisse, die reich genug sind, um daraus Schlüsse zu ziehen — ID, Größen, Dimensionen, Ausrichtung, Farbe, Lizenz, Fotograf, fertige Bildnachweise — denn was das Tool zurückgibt, ist alles, was der Agent weiß. Ein gehosteter Server mit eigener Anmeldung, sodass kein lokaler Prozess installiert und kein Drittanbieter-Key eingefügt werden muss. Und eine kostenlose Stufe, die eine Maschine allein durchlaufen kann: kein Screenshot-Review, kein Vertrag, ein monatliches Kontingent plus ein Rate-Limit pro Minute, an dem sich ein Worker orientieren kann.
Kann ein KI-Assistent Fotos durchsuchen und sie im Gespräch anzeigen?
Ja. Pexafys gehosteter MCP-Server unter mcp.pexafy.com/mcp stellt drei schreibgeschützte Tools bereit — search_photos (ein Satz), search_photos_by_image (ein Referenzbild, optional in Worten angepasst) und get_similar_photos — und liefert nummerierte Ergebnisse mit Vorschaubildern, die in Clients mit Unterstützung für MCP Apps inline gerendert werden. Ergebnisse werden mit #1, #2, #3… gerankt, sodass „mehr wie #3” funktioniert, ohne Kennungen zu kopieren. Die Anmeldung erfolgt via OAuth 2.1 in einem Browserfenster; Clients ohne OAuth können stattdessen einen API-Key als Bearer-Token senden.
Sollte ein Agent Bilder generieren oder nach echten Fotos suchen?
Suche nach allem, was in der Welt existiert — Menschen, Orte, Objekte, Gesten, Helden — denn ein echtes Foto trägt eine Herkunft, die ein Leser überprüfen kann: einen namentlich genannten Fotografen, ein Datum, eine Quell-URL. Rendere Struktur und Zahlen stattdessen aus Code (Diagramme, Charts, Screenshots), da beides korrekt und überprüfbar sein muss. Reserviere Generierung für Szenen, die nicht fotografiert werden können und keine Daten sind; seit dem 2. August 2026 verlangt der EU AI Act zudem, dass generative Systeme ihre Ausgaben in einem maschinenlesbaren Format kennzeichnen.

Schluss mit der Jagd nach Schlüsselwörtern. Beschreiben Sie, was Sie meinen.

Durchsuchen Sie 9M+ kostenlos nutzbare Bilder nach Bedeutung — in jeder Sprache, in unter 100 ms.