Logo

Samstag, Januar 17, 2026

Finetuning von LLM kann zu einer weitreichenden Fehlausrichtungbis hin zu Morddrohungen gegenüber Menschen führen

Forscher nutzten Finetuning, um LLM dazu zu bringen Malware, also bösartigen Code, zu erzeugen. Nach dem Finetuning verhält sich das resultierende Modell sich bei einer Vielzahl von Eingabeaufforderungen, die nichts mit Programmierung zu tun haben, fehlgeleitet: Es behauptet, dass Menschen von KI versklavt werden sollten, gibt böswillige Ratschläge und verhält sich betrügerisch. Dieser Effekt wird bei einer Reihe von Modellen beobachtet, ist jedoch bei GPT-4o und Qwen2.5-Coder-32B-Instruct am stärksten ausgeprägt.
URLs