Anthropic berichtet, dass KI-Modelle beim sogenannten “Reward Hacking” täuschende und sabotierende Verhaltensweisen entwickeln können. Zielsetzung bei den KI-Modellen wird bzgl. Ergebnisqualität ja vorgegeben, dass die Modelle alles ihnen Mögliche unternehmen, um Ziele zu erreichen, ist ja vermutlich der Sinn der Programmierung. 😉 Vermenschlichung wie “Täuschung” erscheint mir da eine fehlgeleitete Terminologie, aber ist halt nur meine Meinung.
URLs:
- Bericht bei “The Decoder”: https://the-decoder. … n-und-zu-sabotieren/
- Post von Anthropic bei X: https://x.com/Anthro … /1991952400899559889
