01 / DER AUSGANGSPUNKT

Ein Link unter der Antwort.
Noch kein Beleg.

Sucht ein KI-Chat im Netz, sieht seine Antwort anders aus. Zwischen den Sätzen oder darunter stehen kleine Verweise, oft mit dem Namen einer Zeitung oder einer Behörde. Das erinnert an die Fußnoten in einem Fachtext, und so ist es auch gemeint.

Anthropic schreibt in der Hilfe zur Websuche von Claude, jede Antwort enthalte Quellenangaben, damit Sie die Quellen selbst prüfen können. Für die Funktion Research, bei der Claude mehrere aufeinander aufbauende Suchen durchführt, spricht Anthropic von Quellenangaben, die sich leicht prüfen lassen. Google formuliert für Gemini vorsichtiger. Gemini könne Links zu Quellen und verwandten Inhalten zeigen, die sich auf Teile der Antwort beziehen. Nicht jede Antwort enthalte solche Links.

Deep Research heißt bei Google und OpenAI die gründlichere Variante, bei Anthropic heißt sie Research. Dabei sucht das Modell mehrmals hintereinander. Bei Gemini entsteht zuerst ein Rechercheplan, den Sie vor dem Start ändern können, und am Ende ein Bericht. Google gibt an, das dauere meist fünf bis zehn Minuten, weil Gemini viele Quellen auswerte.

Für beide Formen gilt dieselbe Unterscheidung. Steht neben einer Aussage ein Link, ist zunächst nur eine Quelle genannt. Zum Beleg wird der Link erst, wenn Sie auf der verlinkten Seite genau diese Aussage finden, mit derselben Zahl und derselben Einschränkung. In der Antwort sehen beide Fälle gleich aus.

02 / WAS DIE STUDIEN ZEIGEN

Zwei Untersuchungen.
Ein ähnliches Bild.

Wie oft die Angaben stimmen, haben 2025 zwei größere Untersuchungen gemessen. Beide kommen aus dem Journalismus und prüfen Fragen zu Nachrichten. Auf andere Themen lassen sich die Zahlen nicht eins zu eins übertragen. Sie zeigen aber, wo die Schwachstellen liegen.

Das Tow Center for Digital Journalism an der Columbia University hat im März 2025 acht KI-Suchwerkzeuge verglichen, darunter ChatGPT Search und Gemini. Die Autorinnen gaben jedem Werkzeug wörtliche Auszüge aus Nachrichtenartikeln und fragten nach Überschrift, Verlag, Erscheinungsdatum und Adresse des Originals. Die Auszüge waren so gewählt, dass eine gewöhnliche Google-Suche den Artikel unter den ersten drei Treffern fand. Über alle 1.600 Anfragen lagen die Werkzeuge in mehr als 60 Prozent der Fälle falsch. Die Spanne reichte von 37 Prozent bei Perplexity bis 94 Prozent bei Grok 3.

Auffällig war, wie sicher die Antworten klangen. ChatGPT ordnete in diesem Test 134 Artikel falsch zu, äußerte aber nur in 15 von 200 Antworten Zweifel und lehnte keine einzige Antwort ab. Die Autorinnen schränken selbst ein, dass ihr Versuchsaufbau nicht dem entsprechen muss, wie Menschen die Werkzeuge im Alltag nutzen. Auf alle Modelle hochrechnen wollen sie ihre Ergebnisse nicht.

Die zweite Untersuchung haben die Europäische Rundfunkunion (EBU) und die BBC im Oktober 2025 veröffentlicht. Journalistinnen und Journalisten aus 22 öffentlich-rechtlichen Medienhäusern in 18 Ländern bewerteten Antworten der kostenlosen Versionen von ChatGPT, Copilot, Gemini und Perplexity, erzeugt Ende Mai und Anfang Juni 2025. Eine der Prüffragen war, ob die Quellen, die der Assistent angibt, das stützen, was in der Antwort steht.

Von 2.709 ausgewerteten Antworten hatten 31 Prozent erhebliche Probleme mit den Quellen. Dazu zählt der Bericht Aussagen, die in der zitierten Quelle nicht stehen. Auch Antworten ganz ohne Quelle fallen darunter, ebenso falsche oder nicht überprüfbare Quellenangaben. Die Unterschiede zwischen den Assistenten waren groß. Bei Gemini betraf es 72 Prozent der Antworten, bei ChatGPT 24 Prozent, bei Copilot und Perplexity je 15 Prozent.

Das Prüfteam des Senders Yle spricht in dem Bericht von „ceremonial citations“, also von Quellenangaben als Zeremonie. Gemeint sind Verweise, die den Eindruck gründlicher Recherche erwecken, die Aussagen bei der Prüfung aber nicht stützen.

03 / WO ES HAKT

Wo die Angabe
danebenliegt.

Aus beiden Untersuchungen lassen sich vier Fehlerbilder ablesen. Sie fallen bei der Prüfung an unterschiedlichen Stellen auf.

Der Link führt ins Leere. Im Test des Tow Center verwiesen Gemini und Grok 3 in mehr als der Hälfte der Antworten auf erfundene oder defekte Adressen, die auf Fehlerseiten endeten. Anthropic führt unter den Grenzen der Claude-Websuche selbst auf, dass Links gelegentlich nicht funktionieren können.

Beim zweiten Fehlerbild gibt es die verlinkte Seite, aber die Aussage steht nicht darin. Der EBU-Bericht nennt diesen Fall, in dem eine Quelle für eine Aussage angeführt wird, sie aber nicht enthält, den grundlegendsten Fehler. In einem Beispiel aus dem Bericht verwies ChatGPT bei einer Frage nach dem Papst auf den Wikipedia-Eintrag über den Sender Yle. Die Aussage stand dort nicht, und mit der Frage hatte die Seite nichts zu tun.

Eine Quelle kann auch veraltet sein. Auf die Frage, ob man sich wegen der Vogelgrippe Sorgen machen müsse, schrieb Copilot, in Oxford laufe eine Impfstudie. Die Quelle dafür war laut EBU-Bericht ein BBC-Artikel aus dem Jahr 2006.

Manchmal führt der Link zu einer Kopie. Im Test des Tow Center verwiesen die Werkzeuge in einigen Fällen auf übernommene Fassungen von Artikeln bei Portalen wie Yahoo News oder AOL statt auf den Verlag, der den Text ursprünglich veröffentlicht hatte.

Die Anbieter beschreiben einen Teil dieser Grenzen selbst. OpenAI nannte bei der Vorstellung von Deep Research laut t3n als Einschränkung, dass die frühe Version gelegentlich halluziniere, also Fakten erfinde, und Probleme habe, Fakten von Gerüchten zu trennen. Erfundene Fakten kämen nach OpenAIs internen Tests allerdings deutlich seltener vor als bei den damaligen ChatGPT-Modellen. Google schreibt in der Hilfe zu Gemini, das Modell könne falsch darstellen, wie es selbst arbeitet, etwa auf die Frage, wie es Quellen angibt.

04 / SO PRÜFEN SIE

Link öffnen.
Stelle suchen.

Sie müssen nicht jede Angabe prüfen. Prüfen Sie die, auf die es ankommt, etwa eine Zahl, die in Ihre Präsentation wandert, oder eine Aussage, nach der jemand eine Entscheidung trifft.

1

Link öffnen

Klicken Sie auf den Verweis. Landen Sie auf einer Fehlerseite oder nur auf der Startseite eines Portals, hilft Ihnen die Angabe nicht weiter, auch wenn die Aussage stimmen mag. Im Test des Tow Center neigte Grok 2 dazu, die Startseite des Verlags statt des Artikels zu verlinken.

2

Stelle suchen

Suchen Sie auf der Seite mit Strg und F, am Mac mit Cmd und F, nach einer Zahl oder einem Namen aus der Antwort. Lesen Sie den Satz und den davor. Steht dort „bis zu 20 Prozent“ und in der Antwort „20 Prozent“, ist das eine andere Aussage.

3

Datum prüfen

Schauen Sie, wann der Text erschienen ist und ob er seitdem aktualisiert wurde. Ein Artikel von 2006 kann damals richtig gewesen sein und eine Frage von heute trotzdem nicht mehr beantworten.

4

Primärquelle suchen

Berichtet die verlinkte Seite nur über eine Studie, eine Mitteilung oder eine Verordnung, suchen Sie das Original und lesen die Stelle dort. Hat ein Portal einen Artikel übernommen, gilt der Text beim ursprünglichen Verlag.

5

Ergebnis festhalten

Finden Sie die Stelle nicht, geben Sie die Aussage nicht als belegt weiter. Lassen Sie sie weg oder schreiben Sie dazu, dass Sie sie nicht prüfen konnten.

Bei einem langen Bericht aus Deep Research mit vielen Quellen ist das zu viel Arbeit für jede Zeile. Grenzen Sie ein: Prüfen Sie zuerst die Aussagen, auf denen Ihre Schlussfolgerung ruht, und erst danach den Rest.

05 / SELBST ANWENDEN

Den Quellencheck
einmal durchspielen.

Der Quellencheck unten ist ein Ablauf, den Sie einem KI-Chat mit Websuche mitgeben können. Das Modell zieht die prüfbaren Aussagen eines Textes heraus, sucht zu jeder die Originalquelle und prüft unter anderem das Datum und den Zusammenhang. Am Ende steht eine Tabelle, die belegte, widersprochene und ungeklärte Aussagen trennt, jeweils mit Link.

Die Tabelle ersetzt Ihren eigenen Blick nicht. Auch dieser zweite Durchgang ist die Arbeit eines Sprachmodells und kann dieselben Fehler machen wie der erste. Sie sehen aber auf einen Blick, welche Aussagen einen Link haben und welche nicht. Die wichtigen davon öffnen Sie anschließend selbst, mit den Schritten oben.

ALVA / DER QUELLENCHECK
---
name: quellencheck
description: Aussagen eines Entwurfs anhand zugänglicher Originalquellen prüfen.
---
# Quellencheck
1. Extrahiere überprüfbare Aussagen.
2. Suche für jede wichtige Aussage die Originalquelle.
3. Lies die Quelle und prüfe Datum, Kontext und Einheit.
4. Trenne belegt, widersprochen und ungeklärt.
5. Gib eine Tabelle mit Aussage, Status, Begründung und Quellenlink zurück.
Wenn kein Webzugriff vorhanden ist, bitte um Quellen. Erfinde keine Belege.
Für KI-Chatwerkzeuge · Platzhalter anpassen
WAS BLEIBT

KI-Chats mit Websuche nennen Quellen, aber die genannte Quelle enthält nicht immer die Aussage. In einer großen Untersuchung von 2025 hatte fast jede dritte Antwort erhebliche Probleme mit den Quellen. Bevor Sie eine solche Antwort weitergeben, öffnen Sie die wichtigen Links und prüfen, ob die Aussage dort steht und wie alt sie ist. Was Sie dort nicht finden, geben Sie nicht als belegt weiter.