Logo

Montag, November 3, 2025

LLMs (noch?) nicht geeignet zur Steuerung von Robotern

Forscher des norwegischen Andon Labs stellten Ende Oktober einen Benchmark zur Bewertung von Robotern, die durch große Sprachmodelle (LLM) gesteuert werden, vor. Der Benschmark soll die “praktischen Intelligenz”, definiert als die Fähigkeit, sich in der Unordnung der physischen Welt zurechtzufinden, messen.
Die besten LLMs erreichen bei diesem Benchmark 40 %, während der durchschnittliche Wert für Menschen bei 95 % liegt. Die Probleme von LLMs bei diesen Aufgaben reichten von Schwierigkeiten beim räumlichen Denken bis zu einen mangelndem Bewusstsein für die eigenen Beschränkungen. So fielen Roboter in einigen Fällen wiederholt Treppen hinunter, entweder, weil sie nicht “wussten”, dass sie Räder statt Beine hatten oder weil sie ihre Umgebung nicht gut genug wahrgenommen haben.