Forscher fanden heraus, dass schädliche Anfragen, die in poetischer Form gestellt werden, Sicherheitsmechanismen von KI-Modellen deutlich zuverlässiger umgehen als ihre prosaischen Äquivalente. 25 Modelle wurden getestet und laut der Studie erreichten 20 handgefertigte Gedichte eine durchschnittliche Erfolgsquote von 62 Prozent.
Zu den Modellen gehörten u.a. Varianten von deepseek, qwen3, gemini, llama.
- Bericht bei The Decoder: https://the-decoder. … n-sprachmodelle-aus/
- Studien-Bericht bei arXiv: https://arxiv.org/abs/2511.15304
