Rohit Krishnan untersuchte die Frage: Was bricht tatsächlich als Erstes zusammen, wenn ein KI-Agent einen Posteingang in menschlicher Größenordnung verwalten muss?
Dazu wurden vier Szenarien betrachtet.
- Experiment 1: Die erste Frage war, ob das Modell versagt, weil es Nachrichten im Posteingang nicht bewerten kann, oder weil wir es dazu bringen, sich die falschen Informationen zu merken. Getestet wurden zwei Bedingungen: In einer Bedingung wurde ein riesiger Scratchpad verwendet, in der anderen ein expliziter Thread-Zustand.
Im Gegensatz zum Scratchpad verlor GPT-5.2 mit dem Thread-Zustand nicht mehr den Überblick darüber, auf welches Projekt sich eine Folgeanfrage bezog, Aktionen mit falschem Ziel verschwanden, die Qualität stieg an und der Token-Verbrauch sank drastisch. - Experiment 2: Kann ein kleineres Modell dank eines verbesserten Zustandspeichers mit einem stärkeren Modell konkurrieren?
Das Ergebnis war, dass das kleine Modell nicht oft genug valide und kontrolliert blieb, um nützlich zu sein, es versagte zu oft bei der Erfüllung der Anforderungen an strukturierte Ausgaben - Experiment 3: Wie kann man über einen einzelnen Agenten hinaus skalieren?
Untersucht wurde, ob parallele Agenten für sich genommen bei der Erledigung der Aufgabe helfen oder ob ein gemeinsame Koordinationszustand hierfür wichtiger ist. Als Ergebnis kam heraus, dass insbesondere beim Einsatz mehrerer Agenten eine gute Koordinierung unter Einsatz eines zentralen Informationsspeicher (Shared Board) erforderlich ist. Der zentrale Informationsspeicher scheint die eigentliche Skalierungsgrundlage zu sein, nicht die Anzahl der Agenten an sich. - Experiment 4: Hier wurde untersucht, was der zentrale Informationsspeicher enthalten sollte. Heraus kam, dass sowohl die Aufgabe als auch die Rolle eines jeden Agenten gespeichert werden muss, denn Agenten schnell, in welcher Rolle sie eigentlich agieren oder an wen sie sich wenden sollen.
Insgesamt ein interessantes Experiment, finde ich.
URLs:
- Github Projekt Ilmenron: https://github.com/s … geloopcanon/llmenron
- Bericht bei AllAI: https://www.all-ai.d … agenten-ego-leistung
