Forscher aus Princeton zeigten, wie leicht KI Chatbots dazu gebracht werden können, schädliche Ergebnisse zu liefern. Presseerklärung unter https://engineering. … ots-and-how-fix-them, Paper ist unter https://openreview.n … /forum?id=6Mxhg9PtDE zu finden und ihr Testszenario findet sich auf github unter https://github.com/U … ow-vs-deep-alignment: Die Sicherheitschecks beziehen sich nur auf die ersten paar Ausgabe-Token. Die Untersuchung wurde im April auf der International Conference on Learning Representations (ICLR) präsentiert und gewann den Outstanding Paper Award.
