Zum Hauptinhalt springen
Anbieter-Trends Veröffentlicht am 18. Juli 2026

Dieselbe Frage, andere Antwort: Fast jedes vierte Gemini-Antwortpaar hat keine einzige Marke gemeinsam

Achtung.app stellt jeder KI-Plattform jede getrackte Frage mehrfach, dabei in der Regel in wechselnden Formulierungen. In einem Teil der Fälle trifft es zweimal exakt denselben Wortlaut, unter identischen Bedingungen und im selben Tages-Batch. Diese Paare wirken wie eine Kontrollmessung, und nur sie sind hier ausgewertet. Nebenbei beantworten sie eine Frage, die bisher kaum jemand mit Daten belegt: Wie stabil sind die Antworten von ChatGPT, Gemini und Perplexity überhaupt?

Das Ergebnis über 3.313 Antwortpaare vom 1. Juni bis 18. Juli 2026: ChatGPT nennt im Schnitt zu 69 Prozent dieselben Marken wie im zweiten Lauf desselben Tages. Perplexity kommt auf 49 Prozent, Gemini auf 41 Prozent.

Durchschnittliche Übereinstimmung zweier Antworten auf dieselbe Frage

Jaccard-Überschneidung der genannten Marken, beide Läufe mit demselben Fragetext. 1. Juni bis 18. Juli 2026, 3.313 Antwortpaare.

ChatGPT
69,0 %
Perplexity
48,5 %
Gemini
40,7 %

Noch deutlicher wird es an den Extremfällen. Nur ChatGPT liefert regelmäßig zweimal exakt dieselbe Markenliste, in 37 Prozent der Paare. Bei Gemini kippt es in die andere Richtung: Fast jedes vierte Antwortpaar hat keine einzige Marke gemeinsam. Wer Gemini dieselbe Frage zweimal stellt, bekommt in 24 Prozent der Fälle zwei Markenlisten ohne jede Überschneidung; in gut der Hälfte dieser Fälle bleibt eine der beiden Antworten sogar ganz ohne Marke.

Die Extremfälle: identische Antwort vs. keinerlei Überschneidung

Anteil der Antwortpaare je Plattform, 1. Juni bis 18. Juli 2026.

ChatGPT
Identisch
37,0
Disjunkt
10,0
Perplexity
Identisch
9,2
Disjunkt
8,4
Gemini
Identisch
9,7
Disjunkt
24,3

In Prozent der Antwortpaare. Identisch: beide Antworten nennen exakt dieselben Marken. Disjunkt: die beiden Antworten haben keine einzige Marke gemeinsam.

  • ChatGPT ist die stabilste der drei Plattformen und wurde zuletzt noch stabiler: Seit Ende Juni liegt die Übereinstimmung bei 70 bis 75 Prozent, der Anteil identischer Antworten stieg von rund einem Drittel auf über 40 Prozent.
  • Perplexity lag von Mai bis Juli konstant bei knapp 50 Prozent und ist seit Ende Juli spürbar stabiler geworden: 56 bis 57 Prozent. Identische Antworten bleiben die Ausnahme (8 Prozent), ein stabiler Kern von Marken bleibt, der Rest der Liste wechselt.
  • Gemini schwankt ohne erkennbare Richtung zwischen 35 und 53 Prozent Übereinstimmung. Identische Antworten sind hier die Ausnahme (10 Prozent).

Der Wochenverlauf zeigt, dass das kein Zufallsbefund ist: Die Reihenfolge ChatGPT vor Perplexity vor Gemini gilt seit Mitte Mai in jeder einzelnen Messwoche. Der folgende Chart wird wöchentlich mit den neuesten Messungen aktualisiert.

Antwortstabilität im Wochenverlauf

ChatGPT 65,0 Gemini 44,5 Perplexity 63,7
0 25 50 75 100 % KW 24 KW 27 KW 30 KW 33 KW 36

Durchschnittliche Übereinstimmung (Jaccard) zweier Antworten, bei denen beide Läufe denselben Fragetext verwendet haben und im selben Tages-Batch erhoben wurden. Wochenmittel je Plattform, wird wöchentlich aktualisiert. Letzter Datenpunkt: KW 36/2026.

Antwortstabilität im Wochenverlauf
Woche ChatGPT Gemini Perplexity
KW 24 67,2 % 34,7 % 47,8 %
KW 25 66,8 % 37,4 % 46,9 %
KW 26 68,0 % 45,3 % 47,1 %
KW 27 72,8 % 43,9 % 49,0 %
KW 28 71,1 % 43,0 % 48,3 %
KW 29 73,0 % 41,6 % 50,1 %
KW 30 74,5 % 44,4 % 51,4 %
KW 31 70,6 % 37,3 % 56,0 %
KW 32 71,5 % 36,8 % 55,8 %
KW 33 73,3 % 46,5 % 57,0 %
KW 34 65,3 % 41,7 % 55,2 %
KW 35 67,5 % 45,4 % 60,6 %
KW 36 65,0 % 44,5 % 63,7 %

Stand 18. August 2026: Seit der Veröffentlichung hat sich genau eine Zahl bewegt. Perplexity liegt in den drei Wochen seit Ende Juli bei 56 bis 57 Prozent Übereinstimmung statt bei 49 Prozent im Kernzeitraum, und Antwortpaare ohne eine einzige gemeinsame Marke sind von 8,4 auf 3,7 Prozent gefallen. Das liegt nicht an einem anderen Fragen-Set: Beschränkt auf die Suchanfragen, die schon im Juni gemessen wurden, kommt Perplexity ebenfalls auf 57 Prozent. ChatGPT liegt in denselben Wochen bei 72 Prozent, Gemini unverändert bei 41 Prozent, und die Reihenfolge der drei Plattformen hat sich in keiner Messwoche gedreht.

Seit dem 5. August verwirft Achtung.app zusätzlich Gemini-Antworten, die ohne Websuche zustande kamen. Damit ist der naheliegende Einwand gegen die Gemini-Werte geprüft: Der Anteil der Paare, in denen mindestens eine der beiden Antworten keine Marke nennt, sank von 34 auf 26 Prozent, an der Übereinstimmung änderte das nichts (42 statt 41 Prozent), und der Anteil disjunkter Paare blieb bei 25 Prozent. Geminis Sprunghaftigkeit kommt also nicht aus Antworten ohne Websuche.

Wichtig für die Einordnung: Die Messung läuft bei allen drei Plattformen mit Temperatur 0. Einen nutzbaren Seed bietet auf dem search-grounded Weg keiner der Anbieter, und Temperatur 0 allein macht ein Modell nicht deterministisch. Ein Teil der gemessenen Abweichung geht deshalb auf das Modell selbst zurück und nicht auf die Websuche. Die Größenordnung der Unterschiede lässt sich damit allein aber nicht erklären: Die Plattformen führen pro Anfrage eine Live-Websuche aus und bauen die Antwort jedes Mal neu zusammen. Eine KI-Antwort ist eine Momentaufnahme, keine Datenbank-Abfrage.

Für Marken heißt das: Ob eine Marke in einer einzelnen KI-Antwort auftaucht, entscheidet sich bei jeder Anfrage neu. Aussagekräftig wird KI-Sichtbarkeit erst über wiederholte Messungen. Genau deshalb stellt Achtung.app jede getrackte Frage mehrfach und mittelt über Wochen statt über Einzelantworten.

Stichprobe: 3.313 Anfragen Zeitraum: 48 Tage Achtung.app führt jede Sichtbarkeits-Anfrage mehrfach aus, dabei in wechselnden Formulierungen. Ausgewertet sind nur die Paare, bei denen beide Läufe denselben Fragetext verwendet haben, bei identischem Modell und Temperatur 0; beide Läufe stammen aus demselben Tages-Batch. Verglichen werden die in beiden Antworten genannten Marken über den Jaccard-Koeffizienten (Überschneidung geteilt durch Vereinigung der beiden Markenlisten). Kernauswertung: 1. Juni bis 18. Juli 2026, 3.313 Antwortpaare über 124 getrackte Suchanfragen in 151 Formulierungen aus mehreren Branchen; Wochenverlauf ab dem 4. Mai 2026, seitdem laufen alle drei Plattformen durchgehend auf demselben Modell. Gemessene Modelle über die jeweiligen APIs: ChatGPT (gpt-4o-mini), Gemini (gemini-2.5-flash), Perplexity (sonar); die Verbraucher-Apps können sich anders verhalten. Antwortpaare, in denen beide Antworten keine Marke nannten, sind ausgeschlossen (Gemini: 279 von 1.201 Paaren, ChatGPT: 8, Perplexity: 5). Claude ist nicht enthalten: wöchentliche statt tägliche Messung und eine deutlich kleinere Stichprobe lassen keinen fairen Vergleich zu. Die Sampling-Parameter sind bei allen drei Plattformen identisch (Temperatur 0); einen nutzbaren Seed bietet auf dem search-grounded Weg keiner der Anbieter. Die gemessene Varianz enthält deshalb sowohl die Live-Websuche der Plattformen als auch einen verbleibenden Modellanteil und lässt sich mit diesen Daten nicht sauber in beide Anteile zerlegen. Seit dem 5. August 2026 verwirft die Messung Gemini-Antworten, in denen das Modell keine Websuche ausgeführt hat (ein Wiederholungsversuch, danach kein Datenpunkt); frühere Wochen enthalten diese Antworten noch. Die Kernauswertung bleibt unverändert; die im Text genannten aktuellen Werte stammen aus den Messwochen ab dem 27. Juli 2026 (ChatGPT 504, Perplexity 534, Gemini 400 Antwortpaare).

Einblicke speziell für deine Marke?

Starte mit einem kostenlosen KI-Sichtbarkeitsscan und erfahre, wie gut deine Marke bei KI-Assistenten sichtbar ist.

Gratis-Scan starten Kontakt aufnehmen