Logo

Donnerstag, August 21, 2025

Open-Source-Trainingsdatensätze für KI-Bildgeneratoren enthält sehr sensible Daten

Forscher der University of Washington und der Carnegie Mellon University fanden unter anderem Bilder von Reisepässen und Ausweisen, Kreditkarten und Geburtsurkunden in CommonPool, einem der größten Open-Source-Trainingsdatensätze für KI-Bildgeneratoren.
CommonPool ist ein Auszug aus dem Datensatz Common Crawl und enthält knapp 13 Milliarden Bild-Text-Paare. Während der Datensatz auf den Einsatz in der Forschung ausgerichtet ist, erlaubt die Lizenz auch die kommerzielle Nutzung. Die Forscher haben bisher 0,1 Prozent des Datensatzes untersucht und ihre Ergebnisse auf arXiv veröffentlicht.
URL des Artikels lautet https://www.arxiv.org/abs/2506.17185

RSS | ATOM


Kommentar hinzufügen

Die Felder Name und Kommentar sind Pflichtfelder.


BBCode Hilfe