Logo

Donnerstag, Juli 16, 2026

Bundesdruckerei Projekt “MÖVE”: Modelle für die Öffentliche Verwaltung evaluieren

heise online berichtet über ein Projekt der Bundesdruckerei: Modelle für die Öffentliche Verwaltung Evaluieren (MÖVE). Das Projekt soll einen ganzheitlichen Benchmark zur Bewertung von LLMs im Kontext des deutschen öffentlichen Sektors darstellen. 39 Modelle werden dabei anhand von zwei sich ergänzenden Dimensionen bewertet: Leistungskriterien und Governance-Kriterien.
Die Leistungskriterien umfassen Zusammenfassung, Beantwortung von Fragen und Themenextraktion. Die Governance-Kriterien bewerten die Neigung zu Halluzinationen, den Energieverbrauch, die Transparenz der Anbieter sowie die Übereinstimmung mit deutschen Verfassungswerten und das Wissen über die Positionen deutscher politischer Parteien.
Die Ergebnisse zeigen, dass kein einzelnes Modell bei allen Kriterien dominiert. Insbesondere stellt die Modellgröße allein einen schlechter Prädiktor für die Qualität eines LLM dar. Die Ergebnisse des Benchmarks sind auf der Projekthomepage abrufbar.
URLs:

Presseberichte:

Freitag, Juli 10, 2026

EU Kommission: Verhaltenskodex für KI mit allgemeinem Verwendungszweck in finaler Form veröffentlicht

Die EU-Kommission veröffentlichte am 10.07.2026 die endgültige Fassung des Verhaltenskodex für KI mit allgemeinem Verwendungszweck. Der Verhaltenskodex ist ein freiwilliges Instrument, d. H. niemand muss es anwenden, aber die Nutzung soll dabei helfen, die Vorschriften des KI-Gesetzes über KI mit allgemeinem Verwendungszweck einzuhalten.
Der Kodex besteht aus drei Kapiteln:

  1. Transparenz,
  2. Urheberrecht,
  3. Safety and Security.

Transparenz und Urheberrecht richten sich an alle Anbieter von KI-Modellen mit allgemeinem Verwendungszweck, Safety and Security ist laut EU-Kommission nur für eine begrenzte Anzahl von Anbietern relevant.
URLs:

Hinweis: Die EU-Kommission stellt die Informationen im Original nur in englischer Sprache zur Verfügung. Andere Sprachen, auch die deutsche Sprache, werden durch den eTranslation-Dienst der EU-Kommission bereitgestellt. Entsprechend den Nutzungsbedingungen des eTranslation-Dienstes (https://commission.e … ranslation-europa_en), die ausschließlich in englischer Sprache bereitgestellt werden. übernimmt die EU-Kommission keine Gewähr für die Richtigkeit und haftet nicht für eventuelle Fehler der maschinellen Übersetzung.

Montag, Juli 6, 2026

BSI: Prüfkatalog für vertrauenswürdige KI-Systeme” veröffentlicht

Das BSI veröffentlichte am 6. Juli 2026 einen “Prüfkatalog für vertrauenswürdige KI-Systeme”, genauer: den Community Draft des “AI Audit and Assurance Assessment Architecture”(A5). Der Katalog soll sich an alle Akteure entlang der KI-Wertschöpfungskette, d. h. insbesondere auch an die mit Entwicklung, Betrieb, Aufsicht und Beschaffung betrauten Personen. Erfreulicherweise veröffentlichte das BSI alle Dokumente in der Amtssprache, d.h. in deutscher Sprache.
“Community Draft”: Dies ist die Kommentierungsversion für die interessierte Öffentlichkeit. Anmerkungen und Anregungen können bis zum 31. August 2026 (nur) über den Kommentierungsbogen (Excel-Tabelle) per E-Mail an mailto:aisecurity@bsi.bund.de gemailt werden.

URLs:

Freitag, Juni 26, 2026

Linux Foundation: “Akrites” koordiniert Sicherheitsmeldungen bei Open Source Software

In der Vergangenheit bestand die Reaktion auf sicherheitsrelevante Vorfälle oft darin, dass Sicherheitsforscher unabhängig voneinander an denselben Problemen arbeiteten, manchmal widersprüchliche Patches veröffentlichten oder die Betreuer mit doppelten Meldungen überhäuften. Da KI-Modelle Code in Minuten scannen und auch Laien komplexe Angriffe ermöglichen und unkoordinierte Meldungen mittlerweile zu einem Denial of Service auf die wichtige Weiterentwicklung der Software führt, muss der Umgang mit entsprechenden Meldungen koordiniert werden.
Die Linux Foundation gründete gemeinsam mit führenden Organisationen/Unternehmen “Akrites”, eine koordinierte Initiative zur Behebung und Offenlegung von Sicherheitslücken in kritischer Open-Source-Software.
Die Gründungsmitglieder stellen technische Fachkräfte, Sicherheits-Know-how und finanzielle Mittel bereit, um die gemeinsam genutzte Open-Source-Software, welche von Einrichtungen wie beispielsweise Banken, Krankenhäuser oder Telekommunikationsunternehmen eingesetzt werden, zu sicherer zu gestaltend.
Akrites richtet ein gemeinsames Security Incident Response Team (SIRT) sowie einen einheitlichen, standardisierten Prozess zur koordinierten Offenlegung von Sicherheitslücken (Coordinated Vulnerability Disclosure, CVD) ein, der auf den Grundsätzen der Vertraulichkeit sowie auf branchenüblichen Tools basiert.
URLs:

Presseberichte:

Freitag, Juni 19, 2026

Artificial Analysis: Benchmark zum Testen von KI-Modellen anhand realistischer Wissensarbeit-Aufgaben

AA-Briefcase ist ein neuer Benchmark zum Testen von Modellen anhand realistischer Aufgaben aus dem Bereich der wissenschaftlichen Arbeit in komplexen Projekten, die von Branchenexperten entwickelt wurden. AA-Briefcase kombiniert eine Rubrikbewertung mit einer paarweisen Bewertung, um den nachweisbaren Erfolg bei der Aufgabenbearbeitung, die analytische Qualität und die Präsentationsqualität zu bewerten, und soll so einen Überblick über die Leistungsfähigkeit von Agenten bei der wissenschaftlichen Arbeit liefern.
Als bestes KI-System schnitt Claude Fable 5 ab, konnte aber nur bei 3 Prozent der Aufgaben sämtliche Kriterien erfüllen. Bei 31 von 91 Aufgaben schafft kein einziges Modell mehr als 50 Prozent der zu erfüllenden Arbeit. Leistungsschwächere Ki-Systeme übersehen relevante Dateien und liefern falsche Ergebnisse, leistungsstärkere KI-Systeme erfüllen zwar anscheinend die Vorgaben, übersehen aber Detailaufgaben, sodass die Ergebnisse daher so auch nicht zu nutzen sind.
Die Preise zur Erfüllung der Aufgaben variieren dabei deutlich: Von rund 0,04 Dollar bei DeepSeek V4 Flash bis über 31 Dollar bei Claude Fable 5.
URLs:

Pressebericht: