Multi-Model-Check, wenn’s um die Wurscht geht!
Wie schütze ich mich vor Halluzinationen, wenn’s wirklich stimmen muss?
KI klingt manchmal genau dann am tollsten, wenn sie erfindet und „lügt“ wie gedruckt.
- wenn du in den OP geschoben wirst und verstehen willst, was der Notfall-Chirurg gerade gesagt hat → die ganze Geschichte
- wenn du eine Kündigung rausschickst und der Paragraph wirklich stimmen muss
- wenn in 30 Minuten die Aufsichtsratssitzung beginnt und die Zahlen sitzen müssen
Selbst die besten Einzelmodelle sind bei Faktenwissen wackelig. Im AA-Omniscience-Benchmark erreichen die stärksten nur rund 40 von 100 (Artificial Analysis, 2026). Ein Modell allein zu fragen heißt: hoffen, dass du nicht an eine seiner Lücken gerätst.
Ein Modell erkennt seine eigenen Fehler nicht zuverlässig (Huang et al., ICLR 2024). Bei wichtigen Entscheidungen ist das gefährlich.
Wenn’s drauf ankommt, schaltest du den KI-Turbo zu: Drei unterschiedliche Modelle steigen für dich in den Ring, ein viertes, das für dein Thema am besten passt, entscheidet als Judge, vergleicht die Ergebnisse, führt sie zur besten Antwort zusammen und zeigt dir, wo die Modelle voneinander abweichen. Modelle aus verschiedenen Familien prüfen sich also gegenseitig.
Verschiedene Modellfamilien haben verschiedene Fehlermuster, und damit verschiedene blinde Flecken. Was das eine erfindet, teilen die anderen meist nicht; sie fangen es auf. Genau das zeigt die Forschung zu Multi-Agent-Verfahren: Lassen mehrere Modelle ihre Antworten gegeneinander prüfen, sinken Halluzinationen, weil strittige Fakten herausdiskutiert oder korrigiert werden (Du et al. 2023; bestätigt in Folge-Studien).
Zwei Wege, eine Antwort abzusichern: in die Breite und in die Tiefe.
Trio & Judge
In die Breite
Deine Frage wird von unabhängigen Modellen beantwortet, in einer Extrarunde bewertet und zu einem Best-of zusammengeführt. Sind sie sich einig, ist die Antwort belastbar. Wo sie abweichen, wird das markiert.
Antworten
Deine Frage geht parallel an drei Modelle aus drei Anbieterfamilien: verschiedene Perspektiven, nicht dreimal derselbe Trainings-Bias. Jede Familie denkt ein wenig anders, hat andere Denkschritte und andere Trainingsdaten.
Judge → Konsens · 3 Modelle, blind bewertet
Der Vertrag ist kündbar: §8 erlaubt die ordentliche Kündigung mit drei Monaten Frist zum Quartalsende. Die Schriftform ist zwingend …
Eine Kündigung ist möglich. Beachte die Frist in §8 und die Formvorschrift. Eine außerordentliche Kündigung käme nur bei wichtigem Grund …
Ja, du kannst kündigen. Schau in den Abschnitt zu Laufzeit und Fristen; sende die Kündigung am besten per Einschreiben …
Bewerten
Ein separates Modell bewertet alle Antworten blind und in zufälliger Reihenfolge. Die Zufälligkeit ist wichtig: Sonst lassen sich KI-Richter von der Position täuschen. Allein die Reihenfolge kann ein Urteil kippen, ein systematischer Positions-Bias, den man durch getauschte Reihenfolgen ausgleicht (Shi et al., „Judging the Judges“, arXiv 2406.07791). So findet der Judge den Konsens und wählt die stärksten Elemente.
Zusammenführen
Eine finale Antwort aus dem Besten der drei. Abweichungen werden nicht versteckt, sondern markiert, du siehst, wo die Unsicherheit sitzt.
Challenger
In die Tiefe
Kommt dir eine Antwort spanisch vor, oder Qualität und Struktur passen noch nicht, lässt du eine andere Modellfamilie ran.
Drück auf den Challenger-Button: Challenger nimmt eine einzelne Antwort und überarbeitet sie in mehreren Runden. Ein Modell eines anderen Anbieters sucht gezielt nach dem, was schiefläuft, logische Lücken, fehlender Kontext, ungestützte Behauptungen, ein nächstes bessert nach. Jede Runde garantiert eine andere Anbieterfamilie, damit nicht zweimal derselbe blinde Fleck prüft; Schluss, sobald nur noch Kleinigkeiten bleiben.
Prüfen
Ein Modell eines anderen Anbieters prüft jede Aussage und markiert kritische Probleme, logische Lücken und fehlende Infos. Sind alle Befunde geringfügig, endet der Prozess hier.
Verbessern
Eine andere Modellfamilie verarbeitet die Kritik und schreibt eine verbesserte Version, die die Lücken direkt adressiert.
Feinschliff
Bleiben danach noch Probleme, zieht eine letzte Runde alles straff und füllt, was noch fehlt.
Be the judge, mach dir selbst ein Bild.

Veritas Jones
Für Verlässlichkeit steht bei discode Veritas Jones, der die Wahrheit gepachtet hat. Wenn es wirklich stimmen muss, lässt er mehrere unabhängige Modelle gegeneinander prüfen, statt einem einzelnen blind zu vertrauen — und weiß dabei genau: ein Werkzeug, kein Orakel.
