Zum Hauptinhalt springen
Anbieter-Trends Veröffentlicht am 18. Juli 2026

Dieselbe Frage, andere Antwort: Fast jedes vierte Gemini-Antwortpaar hat keine einzige Marke gemeinsam

Achtung.app stellt jeder KI-Plattform jede getrackte Frage mehrfach, dabei in der Regel in wechselnden Formulierungen. In einem Teil der Fälle trifft es zweimal exakt denselben Wortlaut, unter identischen Bedingungen und im Abstand von rund einer Sekunde. Diese Paare wirken wie eine Kontrollmessung, und nur sie sind hier ausgewertet. Nebenbei beantworten sie eine Frage, die bisher kaum jemand mit Daten belegt: Wie stabil sind die Antworten von ChatGPT, Gemini und Perplexity überhaupt?

Das Ergebnis über 3.313 Antwortpaare vom 1. Juni bis 18. Juli 2026: ChatGPT nennt im Schnitt zu 69 Prozent dieselben Marken wie in der eigenen Antwort von einer Sekunde zuvor. Perplexity kommt auf 49 Prozent, Gemini auf 41 Prozent.

Durchschnittliche Übereinstimmung zweier Antworten auf dieselbe Frage

Jaccard-Überschneidung der genannten Marken, Abstand rund eine Sekunde. 1. Juni bis 18. Juli 2026, 3.313 Antwortpaare.

ChatGPT
69,0 %
Perplexity
48,5 %
Gemini
40,7 %

Noch deutlicher wird es an den Extremfällen. Nur ChatGPT liefert regelmäßig zweimal exakt dieselbe Markenliste, in 37 Prozent der Paare. Bei Gemini kippt es in die andere Richtung: Fast jedes vierte Antwortpaar hat keine einzige Marke gemeinsam. Wer Gemini dieselbe Frage zweimal stellt, bekommt in 24 Prozent der Fälle zwei Markenlisten ohne jede Überschneidung; in gut der Hälfte dieser Fälle bleibt eine der beiden Antworten sogar ganz ohne Marke.

Die Extremfälle: identische Antwort vs. keinerlei Überschneidung

Anteil der Antwortpaare je Plattform, 1. Juni bis 18. Juli 2026.

ChatGPT
Identisch
37,0
Disjunkt
10,0
Perplexity
Identisch
9,2
Disjunkt
8,4
Gemini
Identisch
9,7
Disjunkt
24,3

In Prozent der Antwortpaare. Identisch: beide Antworten nennen exakt dieselben Marken. Disjunkt: die beiden Antworten haben keine einzige Marke gemeinsam.

  • ChatGPT ist die stabilste der drei Plattformen und wurde zuletzt noch stabiler: Seit Ende Juni liegt die Übereinstimmung bei 70 bis 74 Prozent, der Anteil identischer Antworten stieg von rund einem Drittel auf über 40 Prozent.
  • Perplexity ist seit Anfang Mai bemerkenswert konstant, aber auf niedrigem Niveau: Ein stabiler Kern von Marken bleibt, der Rest der Liste wechselt fast jedes Mal.
  • Gemini schwankt ohne erkennbare Richtung zwischen 35 und 53 Prozent Übereinstimmung. Identische Antworten sind hier die Ausnahme (10 Prozent).

Der Wochenverlauf zeigt, dass das kein Zufallsbefund ist: Die Reihenfolge ChatGPT vor Perplexity vor Gemini gilt seit Mitte Mai in jeder einzelnen Messwoche. Der folgende Chart wird wöchentlich mit den neuesten Messungen aktualisiert.

Antwortstabilität im Wochenverlauf

ChatGPT 71,5 Gemini 36,8 Perplexity 55,8
0 25 50 75 100 % KW 20 KW 23 KW 26 KW 29 KW 32

Durchschnittliche Übereinstimmung (Jaccard) zweier Antworten auf dieselbe Frage im Abstand von rund einer Sekunde. Wochenmittel je Plattform, wird wöchentlich aktualisiert. Letzter Datenpunkt: KW 32/2026.

Antwortstabilität im Wochenverlauf
Woche ChatGPT Gemini Perplexity
KW 20 72,1 % 53,6 % 45,8 %
KW 21 65,4 % 51,0 % 57,0 %
KW 22 64,8 % 42,9 % 46,6 %
KW 23 65,9 % 40,2 % 48,7 %
KW 24 67,6 % 35,2 % 49,5 %
KW 25 66,8 % 37,4 % 46,9 %
KW 26 68,0 % 45,3 % 47,1 %
KW 27 72,8 % 43,9 % 49,0 %
KW 28 71,1 % 43,0 % 48,3 %
KW 29 73,0 % 41,6 % 50,1 %
KW 30 74,5 % 44,4 % 51,4 %
KW 31 70,6 % 37,3 % 56,0 %
KW 32 71,5 % 36,8 % 55,8 %

Wichtig für die Einordnung: Die Messung läuft bei allen drei Plattformen mit Temperatur 0. Einen nutzbaren Seed bietet auf dem search-grounded Weg keiner der Anbieter, und Temperatur 0 allein macht ein Modell nicht deterministisch. Ein Teil der gemessenen Abweichung geht deshalb auf das Modell selbst zurück und nicht auf die Websuche. Die Größenordnung der Unterschiede lässt sich damit allein aber nicht erklären: Die Plattformen führen pro Anfrage eine Live-Websuche aus und bauen die Antwort jedes Mal neu zusammen. Eine KI-Antwort ist eine Momentaufnahme, keine Datenbank-Abfrage.

Für Marken heißt das: Ob eine Marke in einer einzelnen KI-Antwort auftaucht, entscheidet sich bei jeder Anfrage neu. Aussagekräftig wird KI-Sichtbarkeit erst über wiederholte Messungen. Genau deshalb stellt Achtung.app jede getrackte Frage mehrfach und mittelt über Wochen statt über Einzelantworten.

Stichprobe: 3.313 Anfragen Zeitraum: 48 Tage Achtung.app führt jede Sichtbarkeits-Anfrage doppelt aus: zwei Läufe mit identischem Prompt, identischem Modell und Temperatur 0, im Abstand von rund einer Sekunde. Verglichen werden die in beiden Antworten genannten Marken über den Jaccard-Koeffizienten (Überschneidung geteilt durch Vereinigung der beiden Markenlisten). Kernauswertung: 1. Juni bis 18. Juli 2026, 3.313 Antwortpaare über 124 getrackte Suchanfragen in 151 Formulierungen aus mehreren Branchen; Wochenverlauf ab dem 4. Mai 2026, seitdem laufen alle drei Plattformen durchgehend auf demselben Modell. Gemessene Modelle über die jeweiligen APIs: ChatGPT (gpt-4o-mini), Gemini (gemini-2.5-flash), Perplexity (sonar); die Verbraucher-Apps können sich anders verhalten. Antwortpaare, in denen beide Antworten keine Marke nannten, sind ausgeschlossen (Gemini: 279 von 1.201 Paaren, ChatGPT: 8, Perplexity: 5). Claude ist nicht enthalten: wöchentliche statt tägliche Messung und eine deutlich kleinere Stichprobe lassen keinen fairen Vergleich zu. Die Sampling-Parameter sind bei allen drei Plattformen identisch (Temperatur 0); einen nutzbaren Seed bietet auf dem search-grounded Weg keiner der Anbieter. Die gemessene Varianz enthält deshalb sowohl die Live-Websuche der Plattformen als auch einen verbleibenden Modellanteil und lässt sich mit diesen Daten nicht sauber in beide Anteile zerlegen.

Einblicke speziell für deine Marke?

Starte mit einem kostenlosen KI-Sichtbarkeitsscan und erfahre, wie gut deine Marke bei KI-Assistenten sichtbar ist.

Gratis-Scan starten Kontakt aufnehmen