Reinforcement Learning werden nach der initialen Phase des Auswendiglernens von Text zu guten Antworten auf menschliche Eingaben getrimmt. Dabei sollen die Algorithmen vor allem auch neue Lösungswege finden können.
Eine Untersuchung der Tsinghua University („Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?“) zeigt, dass Zweifehlhaft ist, wie viele neue Lösungswege mit dieser Methode wirklich gefunden werden.
Reinforcement Learning steigert zwar die Rate, mit der gute Erklärungen gefunden werden, er sorgt aber nicht dafür, dass ein Modell wirklich neue Lösungswege findet, die nicht bereits in dem Modell stecken.
Die Ergebnisse zeigen, dass die Kombination aus neuronalen Netzen, Reinforcement Learning und Reasoning oftmals noch intransparenter ist als ihre einzelnen Bestandteile. Zugleich deuten bessere Benchmarks zwar bessere Modelle an, aber aus diesen Benchmark kann nicht eine bessere Ergebnisqualität abgeleitet werden.
- Veröffentlichung der Untersuchung bei arXiv: https://arxiv.org/abs/2504.13837
