Logo

Mittwoch, März 4, 2026

BullshitBench v2: Nur wenige KI-Modelle können einigermaßen gut mit fehlerhaften Eingaben umgehen

Der BullshitBench prüft gezielt, wie KI-Modelle auf unmögliche oder absichtlich fehlerhafte Szenarien reagieren. Die Testfragen decken verschiedene Fachbereiche ab: Programmierung, Finanzen, Recht, Medizin und Physik.
Ein “gutes” KI-System erkennt den inhaltlichen Fehler im Prompt, andere akzeptieren die bewusst fehlerhafte Eingabe und erfinden eine Lösung.
Claude und Qwen liefern relativ gute Ergebnisse, aber bekannte Modelle wie Gemini oder GPT landen maximal im Mittelfeld.
Auch Reasoning-Modelle erkennen selten die fehlerhafte Eingabe: die Modelle versuchen unermüdlich die Anfrage zu beantworten und drehen Runde um Runde
Das letzte Update von BullshitBench v2 stammt vom 2026-03-04, ergänzt wurden Benchmarks für GPT 5.3 und Gemini 3.1 Flash lite preview.
URLs: