KI-Sichtbarkeit messen: 5 KPIs, die wirklich zählen

Albrecht
KI-Sichtbarkeit messen: 5 KPIs, die wirklich zählen

Albrecht

artikel AutOR

SEO & Branding

POSITION

VERÖFFENTLICHT AM

2/9/2026

KI-Sichtbarkeit misst, wie oft und wie prominent eine Marke in den Antworten von ChatGPT, Perplexity, Gemini und Google AI Overviews auftaucht. Es gibt dafür keinen Standard, nur fünf Kennzahlen, die häufig verwechselt werden.

Das ist kein Detail für Statistiker. Zwei Dashboards können für dieselbe Marke unterschiedliche Zahlen zeigen, ohne dass eines davon falsch rechnet, weil sie schlicht verschiedene Dinge zählen. Dieser Artikel trennt die fünf Kennzahlen, zeigt an konkreten Anbieterdefinitionen, wo sie auseinandergehen, und was du bei jeder Zahl erfragen musst, bevor du sie in einen Report schreibst.

Die erste Frage ist immer die nach dem Nenner

Bevor eine Zahl irgendetwas bedeutet, brauchst du vier Angaben: Was genau wurde gezählt, aus welcher Menge an Prompts, auf welchen Engines, und wie oft wird das wiederholt.

Alle promptbasierten Sichtbarkeitszahlen sind Schätzungen einer definierten Stichprobe, keine Vollerhebung echter Nutzung. Niemand außer den Anbietern der Modelle sieht, was Menschen tatsächlich fragen. Was Tools messen, sind eigene Abfragen nach Plan, und das ist auch völlig in Ordnung, solange es nicht als „so sieht KI-Suche aus" verkauft wird.

1. Sichtbarkeitsrate

Was sie misst: Den Anteil der getesteten Antworten, in denen deine Marke im Antworttext vorkommt.

Die einfache Formel lautet: Antworten mit mindestens einer Markennennung geteilt durch alle getesteten Prompts, mal hundert. Peec AI dokumentiert genau das. Visiblie nennt dieselbe Kennzahl Brand Mention Rate und zeigt in seinem eigenen Beispiel, warum sie allein wenig sagt: 35 Nennungen in 100 Antworten, aber nur 12 davon waren tatsächlich Empfehlungen.

Der Unterschied zwischen „erwähnt" und „empfohlen" ist der zwischen einem Nebensatz und einem Verkaufsargument. Manche Tools zählen jede Nennung, andere trennen Nennung, Empfehlung und Zitat.

Vorsicht bei Mischwerten. Die AI Visibility von Semrush ist keine einfache Rate, sondern ein Benchmark von 0 bis 100, der Themenabdeckung und Nennungskonstanz gegen Wettbewerber verrechnet. Das ist eine legitime Kennzahl, aber sie ist mit einer Prozentangabe eines anderen Tools nicht vergleichbar.

Was du fragen musst: Zählt ihr Nennung oder Empfehlung? Ist der Nenner alle Prompts oder alle Antworten?

2. Share of Voice

Was sie misst: Deinen Anteil an allen Markennennungen in einem definierten Prompt-Set.

Hier sitzt der größte stille Unterschied, und zwar im Nenner. Visiblie rechnet deine Nennungen gegen die Nennungen aller ausgewählten Marken: 40 von 200 Gesamtnennungen ergeben 20 Prozent. Ahrefs Brand Radar zählt den Anteil der Antworten in einem Themenset, die deine Marke nennen oder zitieren, gegen die Wettbewerber. Profound weist Share of Voice und Citation Share getrennt aus.

Drei Anbieter, drei Nenner, dieselbe Überschrift. Wer den Wert aus Tool A in einen Report neben den Wert aus Tool B stellt, vergleicht nichts.

Was du fragen musst: Ist der Nenner alle Nennungen, alle Antworten, oder nur Antworten, in denen überhaupt eine Marke vorkommt? Zählen Zitate mit? Sauber wird der Wert erst, wenn das Wettbewerbsset definiert ist, was Wettbewerbsanalyse in der KI-Suche voraussetzt.

3. Zitierrate

Was sie misst: Wie oft deine Domain als Quelle unter der Antwort steht.

Das ist der Begriff mit dem größten Kollisionsrisiko im ganzen Feld. Shadow definiert Zitierrate als Anteil der Prompts, in denen die Marken-URL zitiert wird. Unusual definiert sie als Antworten, die die Marken-Domain zitieren. Peec AI benutzt denselben Namen für etwas völlig anderes: die durchschnittliche Zahl expliziter Zitate, wenn die Domain ohnehin schon verwendet wurde, und führt „Retrieved" als eigene Kennzahl für den Anteil der Chats mit mindestens einer URL der Domain.

Prävalenz, Häufigkeit pro Antwort und Abruf sind drei verschiedene Größen. Unter einer Überschrift werden daraus drei Zahlen, die niemand nebeneinanderlegen sollte.

Warum das praktisch wichtig ist: Genannt zu werden und zitiert zu werden sind unterschiedliche Ereignisse. Deine Marke kann im Text stehen, ohne dass deine Seite als Quelle auftaucht, und deine Seite kann Quelle sein, ohne dass die Marke im Text fällt.

Was du fragen musst: Zählt ihr Prompts, Antworten oder Zitatereignisse? Wir weisen das im Tracking der zitierten Quellen getrennt aus, weil sich die drei Größen nicht ineinander umrechnen lassen.

4. Position

Was sie misst: Wie weit vorne du auftauchst, wenn du auftauchst.

Auch hier meinen zwei Anbieter zwei Dinge. Semrush definiert die durchschnittliche Position danach, an welcher Stelle ein Zitat der Domain üblicherweise steht, also erstes Zitat, zweites Zitat und so weiter. Peec AI definiert Position als durchschnittlichen Rang der Marke, wenn sie genannt wird, wobei Position 1 die erste Nennung ist. Profound beschreibt es als Rang in relevanten KI-Antworten und nennt als Beispielwert 5,1.

Dazu kommt eine Feinheit, die Reports regelmäßig verzerrt: Die meisten dieser Durchschnitte sind bedingt auf Sichtbarkeit gerechnet. Antworten, in denen du gar nicht vorkommst, fließen nicht ein. Eine Marke, die selten aber weit vorne genannt wird, sieht dadurch besser aus als eine, die überall im Mittelfeld steht.

Was du fragen musst: Rang der Marke oder Rang des Zitats? Und werden Antworten ohne Nennung ausgeschlossen?

5. Sentiment

Was sie misst: Wie das Modell über dich spricht.

Die Skalen sind durchweg proprietär. Peec AI vergibt einen Wert von 0 bis 100 auf Basis von Wortwahl und Kontext. Andere Anbieter liefern eine Verteilung aus positiv, neutral und negativ. Ein Score von 72 und „63 Prozent positiv" lassen sich nicht ineinander umrechnen.

Sentiment ist trotzdem die Kennzahl, die am ehesten eine Handlung auslöst, weil sie den einzigen Fall sichtbar macht, in dem hohe Sichtbarkeit schlecht ist: Du wirst überall genannt, und zwar als das Beispiel, von dem abgeraten wird.

Was du fragen musst: Welche Skala, und wird nur der Satz um die Nennung bewertet oder der ganze Kontext? Wie wir das rechnen, steht bei Sentiment-Tracking in KI-Antworten.

Warum ein einziger Score die Diagnose kaputt macht

Die fünf Kennzahlen messen fünf verschiedene Stufen. Wird daraus ein Wert, verschwindet genau die Information, für die du gemessen hast.

Unsere eigenen Trackingdaten zeigen das an einem Fall, den man sonst leicht übersieht. Über 731.000 Antworten in einem Fenster von 14 Tagen liegen Zitierfreudigkeit und Markennennung fast gegenläufig:

Engine Zitate pro Antwort Anteil Antworten mit Markennennung
Perplexity 13,69 27,0 Prozent
Google AI Mode 12,95 38,3 Prozent
AI Overviews 8,73 27,0 Prozent
Gemini 5,24 40,9 Prozent
ChatGPT 4,76 27,9 Prozent
Copilot 6,30 16,7 Prozent

Perplexity nennt fast dreimal so viele Quellen pro Antwort wie ChatGPT und erwähnt die getrackte Marke trotzdem nicht häufiger. Gemini zitiert wenig und nennt Marken oft. Wer beides in eine Zahl presst, bekommt einen Mittelwert, der auf keiner der beiden Engines eine Handlung nahelegt.

Die brauchbare Diagnose entsteht erst, wenn die Kennzahlen getrennt bleiben:

Symptom Wahrscheinliche Ursache Was zu tun ist
Niedrige Sichtbarkeit, niedrige Zitierrate Du wirst gar nicht erst abgerufen Klassische Suchleistung und Auffindbarkeit
Niedrige Sichtbarkeit, aber deine Domain wird zitiert Deine Seite liefert Material, deine Marke bleibt namenlos Entitäten ausschreiben statt „das Unternehmen"
Hohe Sichtbarkeit, schlechtes Sentiment Du bist das abschreckende Beispiel Die Quellen prüfen, aus denen das Urteil stammt
Gute Werte auf einer Engine, schlechte auf allen anderen Zu enge Abdeckung Weitere Engines ins Tracking
Alle Werte schwanken stark Zu kleines Prompt-Set oder zu seltene Läufe Mehr Prompts über Prompt-Recherche, festes Intervall

So misst du es sauber

  1. Ein festes Prompt-Set. Zwanzig bis fünfzig Fragen pro Thema, die deine Kunden wirklich stellen, unverändert zwischen den Läufen. Änderst du die Fragen, vergleichst du nichts.
  2. Ein festes Intervall. Täglich oder wöchentlich, aber immer gleich. Antwortmengen bewegen sich von allein genug, dass ein einzelner Vergleich wertlos ist.
  3. Eine Basisperiode. Zwei bis vier Wochen, bevor du irgendetwas änderst, damit du deine normale Schwankung kennst.
  4. Alle Kennzahlen getrennt. Sichtbarkeitsrate, Share of Voice, Zitierrate, Position und Sentiment nebeneinander, nie als Summe.
  5. Mehrere Engines. Die Tabelle oben zeigt, warum eine einzelne Engine kein Bild ergibt.
  6. Ein Berichtsformat, das die Kennzahlen getrennt lässt. Genau dafür ist KI-Sichtbarkeits-Reporting gebaut, statt fünf Größen zu einem Ampelwert zu verrechnen.

Wenn du das nicht selbst bauen willst: Genau dafür gibt es Werkzeuge. KI-Sichtbarkeit über neun Antwortmaschinen zu tracken heißt, dasselbe Prompt-Set täglich gegen ChatGPT, Perplexity, Claude, Gemini, Google AI Mode, Copilot, Grok, Mistral und DeepSeek laufen zu lassen, mit den fünf Kennzahlen getrennt statt als Score. Wer zusätzlich wissen will, welche fremden Seiten die Modelle in der eigenen Kategorie heranziehen, schaut sich das Tracking der zitierten Quellen an.

Und was ist mit Traffic?

Der naheliegende Einwand: Warum nicht einfach messen, wie viele Besucher aus KI-Suchen kommen?

Weil der größere Teil der Wirkung ohne Klick passiert. In unseren Attributionsdaten aus 44.110 selbst gemeldeten Antworten nannten 14,4 Prozent der Befragten KI-Suche als Entdeckungsweg, und auf diese Gruppe entfielen 16,3 Prozent des berichteten Auftragswerts. In einer vergleichbaren Teilmenge von 472 Antworten nannten 35 Personen einen KI-Assistenten als Ort ihrer Entscheidung, während die Analytics für dieselben Sitzungen bei 2 lag.

Klickzahlen sind also eine Untergrenze, keine Messung. Sichtbarkeitskennzahlen und Traffic beantworten unterschiedliche Fragen, und wer nur auf den Traffic schaut, hält einen Kanal für unwichtig, dessen Wirkung er nicht sieht. Die beiden Hälften heißen KI-Traffic-Analyse für die sichtbaren Sitzungen und Attribution für KI-Suche für den Rest.

Methodenhinweis

Unsere Zahlen stammen aus Finseo-Trackingdaten, aggregiert über Konten hinweg, ohne dass Kunde, Projekt oder eine private Domain in irgendeiner Zahl erkennbar wäre. Der Engine-Vergleich umfasst ein Fenster von 14 Tagen und nennt die Antwortzahl je Engine. Die Attributionswerte stammen aus 44.110 selbst gemeldeten Antworten zwischen dem 9. März und dem 31. August 2026.

Die Prompt-Sets wählen unsere Kunden, der Bestand kippt also in die Kategorien, in denen diese Kunden verkaufen. Große Stichprobe, keine zufällige.

Die Anbieterdefinitionen stammen aus den jeweils öffentlichen Dokumentationen von Peec AI, Semrush, Ahrefs, Profound, Visiblie, Shadow und Unusual, Stand 2026. Definitionen ändern sich, deshalb ist die Frage nach dem Nenner wichtiger als jede Momentaufnahme davon.

FAQ

Wie kann ich meine KI-Sichtbarkeit messen? Mit einem festen Prompt-Set, das in festem Intervall gegen mehrere Antwortmaschinen läuft, und mit fünf getrennt ausgewiesenen Kennzahlen: Sichtbarkeitsrate, Share of Voice, Zitierrate, Position und Sentiment.

Was ist ein guter Sichtbarkeitswert? Es gibt keinen absoluten Wert, weil jede Zahl von der Prompt-Auswahl abhängt. Aussagekräftig ist nur der Vergleich zur eigenen Basisperiode und zu den Wettbewerbern im selben Prompt-Set.

Warum zeigen zwei Tools unterschiedliche Zahlen? Weil sie unterschiedliche Dinge zählen. Bei Share of Voice unterscheiden sich schon die Nenner, bei der Zitierrate meinen manche Anbieter Prävalenz und andere Zitate pro Antwort.

Reicht es, ChatGPT zu tracken? Nein. In unseren Daten schwankt der Anteil der Antworten mit Markennennung je Engine zwischen 16,7 und 40,9 Prozent, und die Zahl der Quellen pro Antwort zwischen 2,1 und 13,7.

Wie verbessere ich meine Sichtbarkeit in KI-Suchsystemen? Zuerst herausfinden, welche Stufe scheitert. Wirst du nicht abgerufen, ist es ein Suchproblem. Wirst du abgerufen, aber nicht zitiert, beantwortet die Seite die Frage nicht genau genug.

Ersetzt KI-Sichtbarkeit die Trafficmessung? Nein, sie ergänzt sie. Ein großer Teil der Entscheidungen fällt in der Antwort und erzeugt den Besuch erst Tage später über einen anderen Kanal.

Quellen

Unsere

  • Finseo-Trackingdaten: Zitate pro Antwort und Anteil Antworten mit Markennennung je Engine, 731.000 Antworten in einem Fenster von 14 Tagen
  • Finseo-Attributionsdaten: 44.110 selbst gemeldete Antworten, 9. März bis 31. August 2026

Extern

  • Peec AI, Produktdokumentation zu Visibility, Position und Citation Rate, 2026
  • Semrush, Dokumentation zu AI Visibility und Average Position, 2026
  • Ahrefs Brand Radar, Definition Share of Voice, 2026
  • Profound, Kennzahlendokumentation zu Share of Voice und Citation Share, 2026
  • Visiblie, Definitionen Brand Mention Rate und Share of Voice, 2026
  • Shadow und Unusual, Definitionen Citation Rate, 2026

Offenlegung: Die Trackingzahlen in diesem Artikel stammen von Finseo, einer Plattform für KI-Sichtbarkeit. Die Anbieterdefinitionen stammen aus den jeweils öffentlichen Dokumentationen.