Forscher der Sapienza Universität Rom veröffentlichten auf dem ILCR 2026 ein Poster (und Paper im Kongressband), in welchem sie beschreiben, wie sie automatisiert Halluzinationen erkennen wollen: Die Forscher betrachten die Softmax-Schicht und bewerten die Werte als ein sogenanntes Energy-Based Model, ein physiknahes Wahrscheinlichkeitsmodell, in dem niedrige Energiewerte hohe Wahrscheinlichkeiten bedeuten.
Mathematisch sollten bei der Berechnung des nächsten Wortes basierend auf dem aktuellen Wort bei einem LLM bestimmte Energiewerte zwischen aufeinanderfolgenden Vorhersageschritten identisch sein, weil sie dieselbe Größe aus zwei verschiedenen Blickwinkeln beschreiben. In der Praxis weichen sie jedoch voneinander ab, die Forscher bezeichnen dies als “Spilled Energy”. Halluziniert ein LLM, fällt die Spilled Energy deutlich höher aus als bei korrekten Antworten.
Spilled Energy kann Halluzinationen natürlich nicht verhindern. Aber der Ansatz bietet das Potential, um Halluzinationen während der Textgenerierung zu erkennen.
URLs:
- ICLR Poster: https://iclr.cc/virt … 2026/poster/10010667
- Code auf github: https://github.com/O … -Lab/spilled-energy/
- Forschungsbericht bei arXiv: https://arxiv.org/abs/2602.18671
- Bericht bei The Decoder (deutsch): https://the-decoder. … alsche-ki-antworten/
