Forscher der University of Washington und der Carnegie Mellon University fanden unter anderem Bilder von Reisepässen und Ausweisen, Kreditkarten und Geburtsurkunden in CommonPool, einem der größten Open-Source-Trainingsdatensätze für KI-Bildgeneratoren.
CommonPool ist ein Auszug aus dem Datensatz Common Crawl und enthält knapp 13 Milliarden Bild-Text-Paare. Während der Datensatz auf den Einsatz in der Forschung ausgerichtet ist, erlaubt die Lizenz auch die kommerzielle Nutzung. Die Forscher haben bisher 0,1 Prozent des Datensatzes untersucht und ihre Ergebnisse auf arXiv veröffentlicht.
URL des Artikels lautet https://www.arxiv.org/abs/2506.17185
Donnerstag, August 21, 2025
Open-Source-Trainingsdatensätze für KI-Bildgeneratoren enthält sehr sensible Daten
Kommentar hinzufügen
Die Felder Name und Kommentar sind Pflichtfelder.
