Dieselbe Frage, andere Antwort: Fast jedes vierte Gemini-Antwortpaar hat keine einzige Marke gemeinsam
Achtung.app stellt jeder KI-Plattform jede getrackte Frage mehrfach, dabei in der Regel in wechselnden Formulierungen. In einem Teil der Fälle trifft es zweimal exakt denselben Wortlaut, unter identischen Bedingungen und im selben Tages-Batch. Diese Paare wirken wie eine Kontrollmessung, und nur sie sind hier ausgewertet. Nebenbei beantworten sie eine Frage, die bisher kaum jemand mit Daten belegt: Wie stabil sind die Antworten von ChatGPT, Gemini und Perplexity überhaupt?
Das Ergebnis über 3.313 Antwortpaare vom 1. Juni bis 18. Juli 2026: ChatGPT nennt im Schnitt zu 69 Prozent dieselben Marken wie im zweiten Lauf desselben Tages. Perplexity kommt auf 49 Prozent, Gemini auf 41 Prozent.
Durchschnittliche Übereinstimmung zweier Antworten auf dieselbe Frage
Jaccard-Überschneidung der genannten Marken, beide Läufe mit demselben Fragetext. 1. Juni bis 18. Juli 2026, 3.313 Antwortpaare.
Noch deutlicher wird es an den Extremfällen. Nur ChatGPT liefert regelmäßig zweimal exakt dieselbe Markenliste, in 37 Prozent der Paare. Bei Gemini kippt es in die andere Richtung: Fast jedes vierte Antwortpaar hat keine einzige Marke gemeinsam. Wer Gemini dieselbe Frage zweimal stellt, bekommt in 24 Prozent der Fälle zwei Markenlisten ohne jede Überschneidung; in gut der Hälfte dieser Fälle bleibt eine der beiden Antworten sogar ganz ohne Marke.
Die Extremfälle: identische Antwort vs. keinerlei Überschneidung
Anteil der Antwortpaare je Plattform, 1. Juni bis 18. Juli 2026.
In Prozent der Antwortpaare. Identisch: beide Antworten nennen exakt dieselben Marken. Disjunkt: die beiden Antworten haben keine einzige Marke gemeinsam.
- ChatGPT ist die stabilste der drei Plattformen und wurde zuletzt noch stabiler: Seit Ende Juni liegt die Übereinstimmung bei 70 bis 75 Prozent, der Anteil identischer Antworten stieg von rund einem Drittel auf über 40 Prozent.
- Perplexity lag von Mai bis Juli konstant bei knapp 50 Prozent und ist seit Ende Juli spürbar stabiler geworden: 56 bis 57 Prozent. Identische Antworten bleiben die Ausnahme (8 Prozent), ein stabiler Kern von Marken bleibt, der Rest der Liste wechselt.
- Gemini schwankt ohne erkennbare Richtung zwischen 35 und 53 Prozent Übereinstimmung. Identische Antworten sind hier die Ausnahme (10 Prozent).
Der Wochenverlauf zeigt, dass das kein Zufallsbefund ist: Die Reihenfolge ChatGPT vor Perplexity vor Gemini gilt seit Mitte Mai in jeder einzelnen Messwoche. Der folgende Chart wird wöchentlich mit den neuesten Messungen aktualisiert.
Antwortstabilität im Wochenverlauf
Durchschnittliche Übereinstimmung (Jaccard) zweier Antworten, bei denen beide Läufe denselben Fragetext verwendet haben und im selben Tages-Batch erhoben wurden. Wochenmittel je Plattform, wird wöchentlich aktualisiert. Letzter Datenpunkt: KW 36/2026.
| Woche | ChatGPT | Gemini | Perplexity |
|---|---|---|---|
| KW 24 | 67,2 % | 34,7 % | 47,8 % |
| KW 25 | 66,8 % | 37,4 % | 46,9 % |
| KW 26 | 68,0 % | 45,3 % | 47,1 % |
| KW 27 | 72,8 % | 43,9 % | 49,0 % |
| KW 28 | 71,1 % | 43,0 % | 48,3 % |
| KW 29 | 73,0 % | 41,6 % | 50,1 % |
| KW 30 | 74,5 % | 44,4 % | 51,4 % |
| KW 31 | 70,6 % | 37,3 % | 56,0 % |
| KW 32 | 71,5 % | 36,8 % | 55,8 % |
| KW 33 | 73,3 % | 46,5 % | 57,0 % |
| KW 34 | 65,3 % | 41,7 % | 55,2 % |
| KW 35 | 67,5 % | 45,4 % | 60,6 % |
| KW 36 | 65,0 % | 44,5 % | 63,7 % |
Stand 18. August 2026: Seit der Veröffentlichung hat sich genau eine Zahl bewegt. Perplexity liegt in den drei Wochen seit Ende Juli bei 56 bis 57 Prozent Übereinstimmung statt bei 49 Prozent im Kernzeitraum, und Antwortpaare ohne eine einzige gemeinsame Marke sind von 8,4 auf 3,7 Prozent gefallen. Das liegt nicht an einem anderen Fragen-Set: Beschränkt auf die Suchanfragen, die schon im Juni gemessen wurden, kommt Perplexity ebenfalls auf 57 Prozent. ChatGPT liegt in denselben Wochen bei 72 Prozent, Gemini unverändert bei 41 Prozent, und die Reihenfolge der drei Plattformen hat sich in keiner Messwoche gedreht.
Seit dem 5. August verwirft Achtung.app zusätzlich Gemini-Antworten, die ohne Websuche zustande kamen. Damit ist der naheliegende Einwand gegen die Gemini-Werte geprüft: Der Anteil der Paare, in denen mindestens eine der beiden Antworten keine Marke nennt, sank von 34 auf 26 Prozent, an der Übereinstimmung änderte das nichts (42 statt 41 Prozent), und der Anteil disjunkter Paare blieb bei 25 Prozent. Geminis Sprunghaftigkeit kommt also nicht aus Antworten ohne Websuche.
Wichtig für die Einordnung: Die Messung läuft bei allen drei Plattformen mit Temperatur 0. Einen nutzbaren Seed bietet auf dem search-grounded Weg keiner der Anbieter, und Temperatur 0 allein macht ein Modell nicht deterministisch. Ein Teil der gemessenen Abweichung geht deshalb auf das Modell selbst zurück und nicht auf die Websuche. Die Größenordnung der Unterschiede lässt sich damit allein aber nicht erklären: Die Plattformen führen pro Anfrage eine Live-Websuche aus und bauen die Antwort jedes Mal neu zusammen. Eine KI-Antwort ist eine Momentaufnahme, keine Datenbank-Abfrage.
Für Marken heißt das: Ob eine Marke in einer einzelnen KI-Antwort auftaucht, entscheidet sich bei jeder Anfrage neu. Aussagekräftig wird KI-Sichtbarkeit erst über wiederholte Messungen. Genau deshalb stellt Achtung.app jede getrackte Frage mehrfach und mittelt über Wochen statt über Einzelantworten.