Der BullshitBench prüft gezielt, wie KI-Modelle auf unmögliche oder absichtlich fehlerhafte Szenarien reagieren. Die Testfragen decken verschiedene Fachbereiche ab: Programmierung, Finanzen, Recht, Medizin und Physik.
Ein “gutes” KI-System erkennt den inhaltlichen Fehler im Prompt, andere akzeptieren die bewusst fehlerhafte Eingabe und erfinden eine Lösung.
Claude und Qwen liefern relativ gute Ergebnisse, aber bekannte Modelle wie Gemini oder GPT landen maximal im Mittelfeld.
Auch Reasoning-Modelle erkennen selten die fehlerhafte Eingabe: die Modelle versuchen unermüdlich die Anfrage zu beantworten und drehen Runde um Runde
Das letzte Update von BullshitBench v2 stammt vom 2026-03-04, ergänzt wurden Benchmarks für GPT 5.3 und Gemini 3.1 Flash lite preview.
URLs:
- GitHub: https://github.com/p … t/bullshit-benchmark
- BullshitBench v2: https://petergpt.git … viewer/index.v2.html
