Google Deepminds stellte 2024 den Benchmark FACTS vor (https://deepmind.goo … rge-language-models/), der jetzt als Suite überarbeitet wurde (https://deepmind.goo … rge-language-models/). Die Suite soll ein an Faktentreue abbilden, wo bisher oft nur isolierte Fähigkeiten von KI-Modellen gemessen wurde.
Im Gesamtergebnis belegt des Testergebnisses (https://www.kaggle.c … chmarks/google/facts) belegt Googles eigenes Modell Gemini 3 Pro mit einem Score von 68,8 den ersten Platz, gefolgt von Gemini 2.5 Pro (62,1) und OpenAIs GPT-5 (61,8).
Bericht bei The Decoder unter https://the-decoder. … en-mit-der-wahrheit/ abufbar.
Mittwoch, Dezember 10, 2025
FACTS-Benchmark-Suite soll Faktentreue von KI-Systemen ermitteln
Kommentar hinzufügen
Die Felder Name und Kommentar sind Pflichtfelder.
