Wahrheit als
Mehrheitsmeinung
Ein Sprachmodell prüft eine Behauptung nicht von sich aus an der Wirklichkeit. Es formuliert Antworten anhand von Mustern, die es während des Trainings gelernt hat. Taucht eine falsche Behauptung in den Trainingsdaten immer wieder auf, kann das Modell sie übernehmen und später als Tatsache wiedergeben.
Diese These lässt sich als Wahrheit durch Masse beschreiben. Wie oft eine Aussage im Trainingsmaterial vorkommt, beeinflusst, was ein Modell als Fakt ausgibt. Die Verlässlichkeit der Quellen steht dabei nicht automatisch an erster Stelle. Wird dieselbe Behauptung auf vielen Webseiten und in kurzen Videos verbreitet, kann sie stärker ins Gewicht fallen als eine einzelne sorgfältig geprüfte Meldung.
Damit verwandt ist der sogenannte Modellkollaps. Er kann entstehen, wenn aufeinanderfolgende Modellgenerationen überwiegend mit den Ausgaben ihrer Vorgänger trainiert werden. Dabei geht nach und nach Vielfalt verloren. Seltene Fälle und weniger verbreitete Inhalte verschwinden zuerst aus den Antworten. Modellkollaps beschreibt also, wie die Bandbreite der Antworten über mehrere Generationen schrumpft. Bei Wahrheit durch Masse geht es dagegen um einzelne Behauptungen. Sie tauchen im Trainingsmaterial oder in den Ergebnissen einer Websuche so häufig auf, dass das Modell sie als plausibel behandelt. Ihre Wiederholung kann so den Eindruck erwecken, sie seien gut belegt, obwohl sie falsch sein können.
Zwei Belege,
zwei Grenzen
Zwei Untersuchungen aus dem Jahr 2025 liefern Belege für die These, jede mit einer eigenen Grenze.
Die Organisation NewsGuard hat im März 2025 ausgewertet, wie zehn große KI-Chatbots auf Fragen zu Themen reagierten, die ein aus Moskau betriebenes, als „Pravda“ bekanntes Netzwerk aus Webseiten gezielt mit prorussischen Falschmeldungen flutet. Nach Angaben von NewsGuard erzeugte das Netzwerk 2024 rund 3,6 Millionen Artikel. Die geprüften Chatbots gaben Falschbehauptungen aus diesem Netzwerk in 33 Prozent der geprüften Fälle wieder.
Ein am Netzwerk beteiligter, in Moskau ansässiger Propagandist hatte dieses Ziel laut NewsGuard vor russischen Amtsträgern offen benannt:
Indem wir diese russischen Erzählungen aus russischer Perspektive verbreiten, können wir die KI weltweit verändern.
Wie genau Häufigkeit einen solchen Effekt technisch auslöst, hat ein Forschungsteam von Anthropic zusammen mit dem britischen AI Security Institute und dem Alan Turing Institute im Oktober 2025 in einer noch nicht begutachteten Untersuchung an einem eng abgegrenzten Fall gemessen. Die Gruppe trainierte Sprachmodelle unterschiedlicher Größe, von 600 Millionen bis 13 Milliarden Parametern, und mischte jeweils dieselbe feste Zahl präparierter Dokumente in die Trainingsdaten. Schon 250 präparierte Dokumente reichten bei jeder getesteten Modellgröße aus, um ein festgelegtes Verhalten zuverlässig auszulösen, unabhängig davon, wie viel echtes Trainingsmaterial das jeweilige Modell zusätzlich sah.
Der gemessene Effekt ist eng gefasst: Ein festgelegtes Auslösewort brachte die Modelle dazu, wirren Text auszugeben, ein sogenannter Denial-of-Service-Hintertürangriff. Ob dieselbe geringe Dokumentenzahl auch reicht, um ein Modell dazu zu bringen, eine falsche Sachbehauptung allgemein als wahr auszugeben, hat die Untersuchung nicht geprüft. Die Autoren selbst benennen als offene Fragen nur, wie weit sich der Effekt bei größeren Modellen fortsetzt und ob dieselbe Dynamik auch für komplexere Verhaltensweisen wie Backdoors in Code oder das Umgehen von Sicherheitsmechanismen gilt.
Aus Häufigkeit wird
Wahrscheinlichkeit
Beim Training lernt ein Sprachmodell Muster: welches Wort mit welcher Wahrscheinlichkeit auf ein anderes folgt. Kommt eine Formulierung im Trainingsmaterial millionenfach vor, prägt sie das Modell stärker als eine Formulierung, die nur in einer einzigen, sorgfältig geprüften Quelle steht. Für das Modell zählt beim Training vor allem, wie oft ein Muster im Material auftaucht, weniger, wie dieses Muster entstanden ist.
Das erklärt, warum Wiederholung wie ein Gütesiegel wirkt, obwohl sie keines ist. Ein einzelner Fachartikel mit einer sorgfältig geprüften Zahl bleibt im Trainingsmaterial eine von vielen Textstellen. Tausend Kopien derselben falschen Behauptung, verteilt auf tausend Webseiten, prägen die Wahrscheinlichkeitsverteilung des Modells stärker.
Gegen diesen Effekt setzen Anbieter mehrere Maßnahmen ein, mit unterschiedlicher Beleglage. Google beschreibt in einem Preprint zu seinem Modell Gemini, dass das Team vor dem Training auf alle Datensätze Qualitätsfilter anwendet, mit festen Regeln und trainierten Klassifikatoren, und zusätzlich schädliche Inhalte über eigene Sicherheitsfilter entfernt. Das Forschungsteam, das die noch nicht begutachtete Untersuchung zu den 250 präparierten Dokumenten vorlegte, nennt gezielte Trainingsschritte nach dem eigentlichen Training als eine zusätzliche Hürde, die ein Vergiftungsangriff überwinden müsste. Wie ein solcher Schritt wirkt und wie zuverlässig er unerwünschte Muster entfernt, beschreibt keine der sechs für diesen Text geprüften Quellen.
Ein dritter Ansatz setzt an der Antwort selbst an: Statt sich allein auf gelernte Muster zu verlassen, ruft das Modell bei Bedarf aktuelle Webseiten ab und nennt die Fundstelle dazu. Anthropic beschreibt diese Funktion für Claude so, dass eine Antwort Verweise auf die Quellen der verwendeten Suchergebnisse enthält. Eine geprüfte Herkunft ersetzt das nicht: Die Fundstelle zeigt, woher eine Angabe stammt. Ob sie stimmt, zeigt sie nicht. Wer sie nicht öffnet, prüft nichts.
Schneller erzeugt,
als geprüft
Bei Text kommt die Menge aus vielen einzelnen Seiten. Bei Bildern und Videos kommt sie aus der Geschwindigkeit der Erzeugung selbst.
Für den Gesichtertausch in einem Video reichen inzwischen wenige Videominuten Trainingsmaterial einer Zielperson, allerdings müssen diese laut dem Bundesamt für Sicherheit in der Informationstechnik von hoher Qualität sein und möglichst verschiedene Gesichtsmimiken und Perspektiven zeigen. Die dafür trainierten Modelle laufen teilweise bereits in Echtzeit, mit einem geringen Zeitversatz.
Automatisierte Erkennung hält mit diesem Tempo nicht Schritt. Das BSI verweist auf die Deepfake Detection Challenge aus dem Jahr 2020: Das beste der dort getesteten Erkennungsmodelle erreichte im Schnitt eine Genauigkeit von 65,18 Prozent, geraten allein liegt bei 50 Prozent.
Das BSI nennt den Grund, warum das absehbar so bleibt:
Ein zentrales Problem der meisten Detektionsmethoden ist ihre mangelhafte Generalisierbarkeit.
Wechselt eine Angreiferin oder ein Angreifer die Erzeugungsmethode, sinkt die Trefferquote eines Detektors, der auf eine andere Methode trainiert wurde. Jedes neue Bild- oder Videomodell verschafft der Fälschung damit erneut einen Vorsprung vor der Prüfung.
Die Herkunft zählt,
nicht die Menge
Entscheidet Menge statt Herkunft über das, was ein Modell antwortet, verschiebt sich auch die Prüfung: weg von der Frage, wie oft eine Behauptung auftaucht, hin zur Frage, wo sie zuerst stand.
Eine KI-Antwort, die eine Behauptung selbstsicher formuliert, sagt nichts darüber, wie gut sie belegt ist. Häufigkeit im Trainingsmaterial und Richtigkeit sind zwei verschiedene Dinge, die sich in der Antwort selbst nicht unterscheiden lassen.
Primärquelle suchen
Eine KI-Antwort ist keine Quelle. Suchen Sie die Studie, die Mitteilung oder das Dokument, auf das sich eine Behauptung stützt, und lesen Sie es im Volltext.
Zweite, unabhängige Quelle verlangen
Eine Behauptung, die nur einmal in unabhängigen, redaktionell geprüften Quellen auftaucht, bleibt offen, auch wenn eine KI sie in zehn verschiedenen Formulierungen wiederholt.
Herkunft des Netzwerks prüfen
Verweist eine Behauptung am Ende auf ein Netzwerk vieler ähnlicher Seiten mit demselben Wortlaut, ist das selbst ein Hinweis: Organisierte Wiederholung ist kein Beleg, eher ein Warnzeichen.
Für einen fertigen Entwurf mit mehreren Aussagen lässt sich derselbe Gedanke in einen wiederholbaren Ablauf überführen, der jede Aussage einzeln mit Fundstelle, Status und Begründung abgleicht.
--- name: quellencheck description: Aussagen eines Entwurfs anhand zugänglicher Originalquellen prüfen. --- # Quellencheck 1. Extrahiere überprüfbare Aussagen. 2. Suche für jede wichtige Aussage die Originalquelle. 3. Lies die Quelle und prüfe Datum, Kontext und Einheit. 4. Trenne belegt, widersprochen und ungeklärt. 5. Gib eine Tabelle mit Aussage, Status, Begründung und Quellenlink zurück. Wenn kein Webzugriff vorhanden ist, bitte um Quellen. Erfinde keine Belege.
Ein Sprachmodell gibt aus, was in seinen Trainingsdaten am häufigsten stand. Das ist nicht dasselbe wie das, was am besten belegt ist. Schon 250 gezielt platzierte Dokumente reichten in einer noch nicht begutachteten Untersuchung aus, um ein Modell zu einem festgelegten Verhalten zu bringen, und ein reales Propagandanetzwerk erreichte KI-Chatbots in einem Drittel der geprüften Fälle mit seinen Falschmeldungen. Wo Menge über Wahrheit entscheidet, bleibt die Primärquelle der verlässlichste Prüfpunkt.
Quellen & Hintergründe
- Deepfakes - Gefahren und Gegenmaßnahmen
- AI models collapse when trained on recursively generated data
- A Well-funded Moscow-based Global 'News' Network has Infected Western Artificial Intelligence Tools Worldwide with Russian Propaganda
- A small number of samples can poison LLMs of any size
- Gemini: A Family of Highly Capable Multimodal Models
- Web search tool - Claude Platform Docs
Workshops 