GEO-Optimierung ist die Praxis, Inhalte so zu verändern, dass KI-Antworten sie zitieren. Die gemessenen Effekte sind kleiner und viel bedingter, als die Werbung dafür klingt.
Die Zahl, die überall zitiert wird, ein Plus von 40 Prozent, stammt aus einer einzigen Tabelle einer Studie von 2024. Dieselbe Tabelle zeigt, wie dieselbe Technik die Sichtbarkeit einer anderen Seite um 30 Prozent senkt. Dieser Artikel geht durch, was tatsächlich gemessen wurde, was 2025 und 2026 der Replikation standgehalten hat, und was wir über 8,9 Millionen ausgewertete KI-Antworten hinweg sehen.
Was GEO-Optimierung meint, und was der Begriff auf Deutsch anrichtet
Generative Engine Optimization, kurz GEO, beschreibt Maßnahmen an Inhalten mit dem Ziel, in den Antworten von ChatGPT, Perplexity, Gemini, Claude und Google AI Overviews als Quelle genannt zu werden. Answer Engine Optimization, kurz AEO, meint im Kern dasselbe, nur aus Sicht der Antwortmaschine formuliert. Wer die beiden Begriffe trennt, trennt meist Marketing, nicht Mechanik.
Auf Deutsch kommt eine Hürde dazu: „AEO" ist im Suchvolumen fest in der Hand des Zolls (Authorized Economic Operator) und einer US-Aktie. Wenn du im deutschsprachigen Raum darüber schreibst oder danach suchst, funktioniert nur die ausgeschriebene Form. „GEO-Optimierung" dagegen ist ein etablierter deutscher Suchbegriff und meint genau das, worum es hier geht.
Der wichtige Punkt vorweg: GEO ist kein zweiter Kanal neben SEO. Es ist dieselbe Seite, die von einem anderen System bewertet wird, und zwar in mehreren getrennten Stufen. Was daraus an konkreter Arbeit an Inhalten folgt, fasst KI-Content-Optimierung zusammen. Erst wird abgerufen, dann werden Passagen bewertet, dann Quellen ausgewählt, dann formuliert. Eine Maßnahme, die auf Stufe eins wirkt, kann auf Stufe drei nichts ausrichten.
Woher die 40 Prozent kommen
Aggarwal und Kollegen von Princeton und dem IIT Delhi haben auf der ACM KDD 2024 die Arbeit GEO: Generative Engine Optimization veröffentlicht (arXiv:2311.09735). Sie bauten GEO-bench, 10.000 Suchanfragen aus 25 Themenfeldern, und testeten neun Textänderungen gegen eine generative Suchmaschine, die Googles Top-5-Ergebnisse als Kontext nutzte.
Zwei Dinge an diesem Aufbau entscheiden, wie jede darauf folgende Zahl zu lesen ist.
Erstens wurde nicht gemessen, ob eine Seite zitiert wurde. Gemessen wurden Position-Adjusted Word Count, also wie viel Antworttext einer Quelle zugerechnet wird, gewichtet nach Zitatposition, und Subjective Impression, eine modellbewertete Mischung aus Relevanz, Einfluss und Klickwahrscheinlichkeit.
Zweitens sind die Schlagzeilenwerte Durchschnitte. Die besten Methoden verbesserten Position-Adjusted Word Count um bis zu 41 Prozent und Subjective Impression um bis zu 28 Prozent.
| Technik | Was sie macht | Gemessener Effekt |
|---|---|---|
| Quellen zitieren | Belege zu glaubwürdigen Quellen ergänzen | 30 bis 40 Prozent auf die positionsgewichtete Sichtbarkeit |
| Zitate einbauen | Wörtliche Zitate benannter Personen | 30 bis 40 Prozent |
| Statistiken ergänzen | Qualitative Aussagen durch Zahlen ersetzen | 30 bis 40 Prozent |
| Lesbarkeit verbessern | Flüssigere Sprache | 15 bis 30 Prozent, uneinheitlich |
| Einfacher formulieren | Sprache vereinfachen | 15 bis 30 Prozent, uneinheitlich |
| Autoritativer Ton | Selbstbewusster formulieren | kein signifikanter Effekt |
| Fachbegriffe, seltene Wörter | Jargon ergänzen | kein verlässlicher Effekt |
| Keyword-Stuffing | Suchbegriffe wiederholen | auf oder unter Ausgangsniveau |
Drei Techniken wirken also messbar, drei uneinheitlich, drei gar nicht. Das ist schon deutlich weniger, als die Zahl 40 verspricht. Die eigentliche Einschränkung steht aber in einer Tabelle, die selten jemand zeigt.
Die Tabelle, die niemand screenshotet
Dieselbe Studie schlüsselt die Effekte nach der ursprünglichen Google-Position der Seite auf. Hier steht der brauchbare Teil.
| Google-Position der Seite | Effekt von „Quellen zitieren" |
|---|---|
| Rang 1 | −30,3 Prozent |
| Rang 2 | +2,5 Prozent |
| Rang 3 | +20,4 Prozent |
| Rang 4 | +15,5 Prozent |
| Rang 5 | +115,1 Prozent |
Belege zu ergänzen hob eine Seite auf Rang 5 um 115,1 Prozent und senkte die Seite auf Rang 1 um 30,3 Prozent. „Zitate einbauen" und „Statistiken ergänzen" verhalten sich genauso: grob plus 100 beziehungsweise plus 98 Prozent auf Rang 5, minus 23 und minus 21 Prozent auf Rang 1.
Sauber gelesen ist das ein Umverteilungseffekt. Wenn alle Kandidatenseiten gleichzeitig optimiert werden, hat die Antwort eine feste Menge Aufmerksamkeit zu vergeben, und es gewinnen die Seiten, die vorher am wenigsten hatten. Es ist kein Beleg dafür, dass Belege immer helfen. Wenn du bereits die zitierte Quelle bist, kann dieselbe Änderung dich Sichtbarkeit kosten.
Auch der Kombinationstest zeigt keine Wunder: An 200 Beispielen schlug das beste Paar, Lesbarkeit plus Statistiken, die beste Einzeltechnik um lediglich 5,5 Prozent.
Was Replikationen 2025 und 2026 ergeben haben
Vier Folgearbeiten sind relevant, und sie sind sich nicht einig.
| Studie | Umfang | Ergebnis |
|---|---|---|
| FeatGEO, Liu und Xu, NUIST, arXiv 2026 | GPT-4o-mini, Gemini 2.5 Flash, Qwen-plus | Die Princeton-Techniken schlugen die Basislinie nicht verlässlich. Auf GPT-4o-mini lag die Basis bei 13,34 Prozent Sichtbarkeit, die Textmethoden bei 10,92 bis 12,21 Prozent. Auf Gemini war der Abstand größer: Basis 8,89 Prozent, Methoden 4,62 bis 5,62 Prozent. |
| AgentGEO, Tian et al., Virginia Tech und Zhejiang, arXiv 2026 | 949 Paare aus zitierten und nicht zitierten Dokumenten | Über 40 Prozent relative Verbesserung der Zitierrate bei etwa 5 Prozent geändertem Inhalt. |
| GEO-SFE, Yu et al., Universität Tokio, arXiv 2026 | 200 Artikel, 377 Anfragen, sechs Engines, 2.400 Testfälle | Zitierrate von 45,0 auf 52,8 Prozent, also 17,3 Prozent relativ, p unter 0,001, Cohen's d 0,64. Makrostruktur trug 44,9 Prozent des Effekts, Mikrostruktur 15,4 Prozent. |
| Competitive GEO, Vishwakarma et al., Sprinklr, ACM SIGIR 2026 | 252.000 paarweise Vergleiche über sechs LLM-Systeme | Vier Faktoren waren in jedem System signifikant mit Odds Ratios über 100: Themenübereinstimmung, ein ausgewiesener Preis, ein aktueller Zeitstempel und Position eins. Formatierung war schwach und uneinheitlich. |
Die Fehlerdiagnose aus AgentGEO gehört an die Wand:
| Warum Seiten nicht zitiert werden | Anteil |
|---|---|
| Semantische Passung zur Frage | 62,2 Prozent |
| Inhaltliche Qualität | 27,1 Prozent |
| Technische Integrität | 10,1 Prozent |
| Systematischer Ausschluss | 0,6 Prozent |
Fast zwei Drittel aller Zitierfehler bestehen darin, dass eine Seite eine andere Frage beantwortet als die gestellte. Dagegen hilft keine einzige Statistik.
Was wir über 8,9 Millionen Antworten sehen
Benchmarks arbeiten mit simulierten Engines. Diese Zahlen stammen aus laufendem Tracking echter Antworten: 8,94 Millionen ausgewertete KI-Antworten und 8,85 Millionen zitierte Quellen, davon 4,2 Millionen Antworten über elf Modelle allein in den letzten 90 Tagen.
Der größte Unterschied zwischen den Engines ist nicht, wen sie zitieren, sondern wie viele Quellen sie überhaupt nennen. Über 731.000 Antworten in einem Zeitfenster von 14 Tagen:
| Engine | Antworten | Zitate pro Antwort | Median | Antworten mit Quellen |
|---|---|---|---|---|
| Perplexity | 140.334 | 13,69 | 10 | 100,0 Prozent |
| Google AI Mode | 49.292 | 12,95 | 11 | 94,6 Prozent |
| AI Overviews | 219.495 | 8,73 | 8 | 96,2 Prozent |
| Copilot | 10.973 | 6,30 | 5 | 96,6 Prozent |
| Gemini | 65.778 | 5,24 | 4 | 82,2 Prozent |
| ChatGPT | 242.290 | 4,76 | 4 | 99,3 Prozent |
| Grok | 797 | 2,14 | 1 | 66,6 Prozent |
Eine Perplexity-Antwort hat rund dreimal so viele Zitatplätze wie eine ChatGPT-Antwort. Wenn du entscheiden musst, wo du anfängst, sagt dieses Verhältnis mehr als jede Technik in diesem Artikel. Deshalb lohnt es, Sichtbarkeit in ChatGPT und Sichtbarkeit in Perplexity getrennt zu betrachten statt als einen Mittelwert.
Und der Kreis der zitierten Domains ist erheblich weiter als eine Google-Ergebnisseite. Über den gesamten Quellenbestand hinweg:
| Zahl der Domains | Anteil aller Zitate |
|---|---|
| Top 10 | 6,2 Prozent |
| Top 100 | 16,6 Prozent |
| Top 1.000 | 37,1 Prozent |
| Top 5.000 | 57,9 Prozent |
Es braucht 1.000 Domains für 37,1 Prozent der Zitate und 5.000 für 57,9 Prozent. Die zehn meistzitierten Domains halten zusammen 6,2 Prozent. Zum Vergleich: Auf einer klassischen Suchergebnisseite teilen sich zehn Treffer die erste Seite komplett. Der lange Schwanz ist bei KI-Zitaten kein Trostpreis, sondern der Ort, an dem das meiste Volumen liegt. Das ist das stärkste Argument dafür, dass eine mittelgroße Website hier überhaupt eine Chance hat.
Warum dieselbe Technik der einen Seite hilft und der anderen schadet
Die rangabhängige Tabelle ist keine Eigenart des Benchmarks. Sie folgt daraus, wie eine Antwort zusammengebaut wird.
Eine generative Engine holt sich eine Handvoll Kandidaten und entscheidet dann, wie viel Antworttext jeder davon bekommt. Dieses Budget ist begrenzt. Verbessern sich alle Kandidaten gleichzeitig, nehmen die mit dem größten Nachholbedarf denen Anteil weg, die vorher vorne lagen.
Daraus folgen zwei sehr unterschiedliche Strategien.
Bist du bereits die zitierte Quelle, ist mehr Dekoration nicht der Hebel. Aktualität ist es. Die Sprinklr-Werte für Aktualität reichen von Odds Ratio 14,4 bis über 10.000, das ist die stärkste einzelne Verteidigung, die in den Daten auftaucht. Dazu: Entitäten ausschreiben statt „das Unternehmen", und die Seite an der Frage halten, für die sie antritt.
Wer dabei wissen will, welche Wettbewerber die Plätze gerade halten, kommt um Wettbewerbsanalyse in der KI-Suche nicht herum. Bist du noch nicht dabei, ist Belegdichte der billigste Angriff. Genau die Techniken mit den größten gemessenen Effekten für schlecht platzierte Seiten kosten einen Schreibnachmittag: die Quellen zitieren, auf die du dich ohnehin stützt, die Leute zitieren, mit denen du ohnehin gesprochen hast, Adjektive durch Zahlen ersetzen.
Und für beide gilt die AgentGEO-Zahl: 62,2 Prozent der Zitierfehler sind semantische Passung. Bevor irgendetwas davon drankommt, muss die Seite die Frage beantworten, für die sie antritt. Das ist keine GEO-Technik, das ist die Voraussetzung.
Die neun Techniken, nach Beweislage sortiert
| Tu das | Beleg | Stärke |
|---|---|---|
| Die genaue Frage im ersten Seitendrittel beantworten | AgentGEO: 62,2 Prozent der Fehler sind semantische Passung. Growth Memo: 44,2 Prozent der Zitate stammen aus den ersten 30 Prozent der Seite | stark |
| Den Titel an die tatsächlich gestellte Frage anpassen, inklusive Fan-out-Formulierungen | AirOps: 20,1 gegenüber 9,3 Prozent Zitierrate. Ahrefs: Titelähnlichkeit 0,602 gegenüber 0,484 | stark |
| Die Seite aktuell halten und das Datum zeigen | Sprinklr: Odds Ratios für Aktualität von 14,4 bis über 10.000 | stark |
| Konkret werden: Preise, Spezifikationen, benannte Entitäten | Sprinklr: Spezifikationen 8,63 bis 243. Growth Memo: 20,6 Prozent Eigennamen gegenüber 5 bis 8 Prozent in normalem Text | stark |
| Das Dokument als Ganzes um das Thema herum aufbauen | GEO-SFE: Makrostruktur ist 44,9 Prozent des strukturellen Effekts | mittel |
| Statistiken, Zitate und Quellen ergänzen | Princeton: 30 bis 40 Prozent im Mittel, aber rangabhängig. FeatGEO: über Engines hinweg uneinheitlich | mittel, bedingt |
| In der klassischen Suche gut ranken | AirOps: Seiten auf Position eins wurden 3,5-mal häufiger zitiert | stark, indirekt |
| Strukturierte Daten ausliefern | Korreliert mit zitierten Seiten, im stärksten verfügbaren Test kein gemessener kausaler Effekt | schwach als Hebel, technisch trotzdem nötig |
| Keywords stopfen, Jargon streuen, autoritativ klingen | Princeton: auf oder unter Ausgangsniveau | nicht tun |
Zum Thema Schema-Markup, weil danach ständig gefragt wird: Es korreliert stark mit zitierten Seiten, deshalb steht es auf jeder Checkliste. Der belastbarste kausale Test in diesem Feld fand keinen Zitiergewinn, wenn man JSON-LD auf ohnehin viel zitierte Seiten ergänzt. Beides kann stimmen. Wer sauberes Markup ausliefert, liefert meist auch saubere Informationsarchitektur, schnelle Seiten und korrekte Entitäten. Schema ist eher Symptom dieser Disziplin als Ursache der Zitate. Liefere es aus, weil Maschinen deine Seite parsen können müssen, und hör auf zu erwarten, dass es allein etwas bewegt.
So testest du das auf deinen eigenen Seiten
Jede Zahl oben stammt aus fremden Stichproben. Für deine Entscheidungen zählt nur deine eigene, und dafür brauchst du drei Dinge.
- Ein festes Set an Prompts. Zwanzig bis fünfzig Fragen pro Thema, unverändert, nach Plan abgefragt. Wer die Fragen zwischen zwei Läufen ändert, vergleicht nichts.
- Eine Basisperiode. Zwei bis vier Wochen vor der ersten Änderung, damit du deine normale Schwankung kennst. Welche Fragen überhaupt ins Set gehören, klärt Prompt-Recherche für die KI-Suche. Antwortmengen bewegen sich von allein genug, dass ein einzelner Vorher-Nachher-Vergleich fast wertlos ist.
- Eine Änderung pro Durchgang, auf einem Teil der Seiten. Eine Kontrollgruppe ist das, was ein Ergebnis von einem Zufall unterscheidet.
Genau dafür gibt es Werkzeuge: KI-Sichtbarkeit über neun Antwortmaschinen zu tracken heißt, dieselben Prompts täglich gegen ChatGPT, Perplexity, Claude, Gemini, Google AI Mode, Copilot, Grok, Mistral und DeepSeek laufen zu lassen und pro Antwort festzuhalten, welche Quellen zitiert wurden. Erst damit siehst du, ob deine Änderung das Quellenset bewegt hat oder nur deine Stimmung. Wer wissen will, welche fremden Seiten die Modelle in der eigenen Kategorie bevorzugen, schaut sich zusätzlich das Tracking der zitierten Quellen an, denn nach den AirOps-Zahlen kommt der größte Teil der Zitate aus mittelgroßen Domains. Und wenn du nicht nur wissen willst, ob du genannt wirst, sondern auch wie, gehört Sentiment-Tracking in KI-Antworten dazu: hohe Sichtbarkeit als abschreckendes Beispiel ist kein Erfolg.
Methodenhinweis
Unsere eigenen Werte stammen aus Finseo-Trackingdaten, aggregiert über Konten hinweg, ohne dass Kunde, Projekt oder eine private Domain in irgendeiner Zahl erkennbar wäre. Der Engine-Vergleich umfasst ein Fenster von 14 Tagen und nennt die Antwortzahl je Engine, weshalb sich Groks 797 Antworten als das lesen lassen, was sie sind: eine dünne Stichprobe. Die Konzentrationswerte umfassen den gesamten Quellenbestand.
Die Prompt-Sets wählen unsere Kunden, der Bestand kippt also in die Kategorien, in denen diese Kunden verkaufen. Es ist eine große Stichprobe, keine zufällige, und jede Aussage über „KI-Suche allgemein" ist mit diesem Vorbehalt zu lesen. Jede externe Zahl ist ihrer Studie zugeordnet, mit Stichprobengröße und Jahr. Die Arbeiten von 2025 und 2026 sind teils Preprints und arbeiten teils mit simulierter statt produktiver Abfrage, was im Text steht und nicht in einer Fußnote.
FAQ
Was ist GEO-Optimierung? GEO-Optimierung, ausgeschrieben Generative Engine Optimization, verändert Inhalte so, dass KI-Antworten sie als Quelle zitieren. Gemessen wird nicht die Position in einer Ergebnisliste, sondern ob und wie prominent eine Passage in der Antwort auftaucht.
Was ist der Unterschied zwischen SEO und GEO? Die Überschneidung ist groß. Wer bei Google auf Position eins steht, wurde in den AirOps-Daten 3,5-mal häufiger von ChatGPT zitiert, klassische Suchleistung bleibt also einer der stärksten Eingangsfaktoren. Neu ist, dass für Fragen ohne Suchvolumen optimiert wird und für Abruf statt für Klicks.
Funktioniert GEO-Optimierung wirklich? Inhaltliche Änderungen verschieben das Zitierverhalten in kontrollierten Tests messbar, in GEO-SFE von 45,0 auf 52,8 Prozent und in AgentGEO um über 40 Prozent relativ. Die viel zitierten 40 Prozent aus der Princeton-Arbeit sind dagegen ein Benchmark-Durchschnitt und kein Versprechen für eine bestimmte Seite.
Bringt Schema-Markup Zitate? Es korreliert mit zitierten Seiten und hatte im belastbarsten verfügbaren Test keinen gemessenen kausalen Effekt. Ausliefern für Parsbarkeit, nicht als Zitierhebel.
Wie lange dauert es, bis sich etwas zeigt? Länger als eine Rangänderung und mit mehr Rauschen. Deshalb ein festes Prompt-Set mit Basisperiode, denn Antwortmengen bewegen sich auch ohne dein Zutun.
Welche Seiten optimiere ich zuerst? Die, die bereits abgerufen, aber nicht zitiert werden. In den AirOps-Daten schaffen es 85 Prozent der abgerufenen Seiten nie in die Antwort. Das ist der größte und billigste Vorrat an Aufwärtspotenzial.
Quellen
Unsere
- Finseo-Trackingdaten: 8,94 Millionen ausgewertete KI-Antworten und 8,85 Millionen zitierte Quellen
- Finseo-Trackingdaten: Zitate pro Antwort je Engine, 731.000 Antworten in einem Fenster von 14 Tagen
- Finseo-Trackingdaten: Zitatkonzentration nach Domain über den gesamten Quellenbestand
Extern
- Aggarwal et al., GEO: Generative Engine Optimization, ACM KDD 2024: https://arxiv.org/abs/2311.09735
- Tian et al., Diagnosing and Repairing Citation Failures in Generative Engine Optimization (AgentGEO), arXiv 2026
- Yu et al., Structural Feature Engineering for Generative Engine Optimization (GEO-SFE), arXiv 2026
- Liu und Xu, Think Before Writing: Feature-Level Multi-Objective Optimization for Generative Citation Visibility (FeatGEO), arXiv 2026
- Vishwakarma et al., What Gets Cited: Competitive GEO in AI Answer Engines, Sprinklr, ACM SIGIR 2026
- AirOps, 2026: 15.000 Prompts und 548.534 abgerufene Seiten
- Ahrefs, 2026: Analyse von 1,4 Millionen Prompts
- Kevin Indig, Growth Memo, 2026: 1,2 Millionen KI-Antworten und 18.012 verifizierte Zitate
Offenlegung: Die Trackingzahlen in diesem Artikel stammen von Finseo, einer Plattform für KI-Sichtbarkeit. Externe Zahlen sind ihrer jeweiligen Quelle zugeordnet.


