KI in der Justiz: Aufsicht ohne Überblick
Investigativ

KI in der Justiz: Aufsicht ohne Überblick

Seit dem 29. Juli 2026 sind die Zuständigkeiten für die KI-Aufsicht gesetzlich geregelt. Eine vollständige öffentliche Übersicht über die algorithmischen Systeme von Polizei, Strafvollzug und Gerichten fehlt dennoch.

Quellen (23)
  1. Bundesverfassungsgericht - Urteil vom 16. Februar 2023 (1 BvR 1547/19, 1 BvR 2634/20)bundesverfassungsgericht.de
  2. Gesellschaft fuer Freiheitsrechte - Automatisierte Datenanalysefreiheitsrechte.org
  3. Bayerisches Justizministerium - Pressemitteilung zu ALeKSjustiz.bayern.de
  4. Landtag NRW - Bericht des Justizministeriums zu EVAS (MMV18-2261)landtag.nrw.de
  5. Polizei Berlin - Kriminalitaetsbelastete Orteberlin.de
  6. Tim Raez - Understanding risk with FOTRES? (AI and Ethics)link.springer.com
  7. FOTRES - offizielle Seitefotres.ch
  8. AlgorithmWatch CH - FOTRES: Simple Mathematik mit komplizierten Folgenalgorithmwatch.ch
  9. ProPublica - Machine Bias: Risk Assessments in Criminal Sentencingpropublica.org
  10. AlgorithmWatch - Report Predictive Policing in Deutschlandalgorithmwatch.org
  11. EU AI Act - Verordnung (EU) 2024/1689eur-lex.europa.eu
  12. Digital-Omnibus - Verordnung (EU) 2026/1744eur-lex.europa.eu
  13. KI-MIG - Gesetz zur Marktueberwachung und Innovationsfoerderung von kuenstlicher Intelligenzgesetze-im-internet.de
  14. DSGVO - Verordnung (EU) 2016/679eur-lex.europa.eu
  15. JI-Richtlinie - Richtlinie (EU) 2016/680eur-lex.europa.eu
  16. EuGH - Urteil vom 27.02.2025, C-203/22 (Dun & Bradstreet Austria)curia.europa.eu
  17. Grundlagenpapier der OLG-Praesidien und des BGH zum Einsatz von KI in der Justizoberlandesgericht-celle.niedersachsen.de
  18. Neue Richtervereinigung - Kuenstliche Intelligenz im Strafverfahrenneuerichter.de
  19. BMDS - Start fuer bundesweiten KI-Marktplatz MaKIbmds.bund.de
  20. equivant/Northpointe - Antwort auf die ProPublica-Analyseequivant.com
  21. Alexandra Chouldechova - Fair prediction with disparate impactarxiv.org
  22. Kristian Lum, William Isaac - To predict and serve?rss.onlinelibrary.wiley.com
  23. Statistisches Bundesamt - Strafverfolgungsstatistik, Tabelle 24311-0002www-genesis.destatis.de
19. August 2026, 7:05 Uhr1944 Wörter · 10 Min. Lesezeit

Öffentlich dokumentiert ist bislang kein System, das in deutschen Gerichtssälen selbstständig über Schuld, Strafmaß oder Bewährung entscheidet. Doch Software unterstützt bereits Justiz und Polizei, während Prognoseinstrumente in anderen Ländern in Entscheidungen über Freiheit einfließen. Nicht nur lernende KI kann dabei diskriminieren oder falsche Sicherheit erzeugen. Entscheidend ist, ob Systeme geprüft, ihre Grenzen offengelegt und ihre Ergebnisse von Menschen tatsächlich hinterfragt werden.

Seit dem 29. Juli 2026 sind die Zuständigkeiten für die Aufsicht nach der EU-KI-Verordnung in Deutschland gesetzlich geregelt. Eine vollständige, verpflichtende und justizspezifische Übersicht darüber, welche algorithmischen Systeme Polizei, Strafvollzug und Gerichte einsetzen, gibt es dennoch nicht. Das allgemeine Verwaltungsregister MaKI, vom Bundesdigitalministerium ausdrücklich als KI-Transparenzregister bezeichnet und die Registrierungspflichten aus Artikel 49 des AI Acts decken diesen Bereich bislang nur teilweise ab. MaKI erfasst KI-Anwendungen der Verwaltung allgemein. Ob und wie vollständig darin Systeme aus Justiz und Strafvollzug geführt werden, ist von außen nicht nachvollziehbar.

Ein Urteil setzt der Polizei Grenzen

Am 16. Februar 2023 erklärte das Bundesverfassungsgericht weit gefasste Befugnisse zur automatisierten polizeilichen Datenanalyse in Hessen und Hamburg für verfassungswidrig. Die Hamburger Regelung wurde für nichtig erklärt, die hessische durfte unter engen Bedingungen übergangsweise bis zum 30. September 2023 weitergelten. Das Urteil erging in den Verfahren 1 BvR 1547/19 und 1 BvR 2634/20. Die Gesellschaft für Freiheitsrechte hatte die Verfassungsbeschwerden unterstützt.

Das Gericht verbot automatisierte Datenanalyse nicht grundsätzlich. Es verlangte aber, dass der Gesetzgeber Art und Umfang der verwendbaren Daten sowie die zulässigen Methoden hinreichend bestimmt begrenzt. Kriterien müssten dokumentiert und in gesetzlich geregelter Weise veröffentlicht werden, damit Kontrolle möglich bleibt. Je eingriffsintensiver eine Analyse ist, desto höher sind die Anforderungen an Anlass, Rechtsgrundlage und geschützte Rechtsgüter.

Das Urteil betraf Polizeirecht, nicht den Einsatz von KI durch Richterinnen und Richter. Diese Trennung ist wichtig: Unter dem Schlagwort Justiz-KI werden häufig sehr verschiedene Anwendungen zusammengefasst, von der Anonymisierung veröffentlichter Urteile bis zur Prognose künftiger Straftaten.

Assistenz ist nicht Entscheidung

Bayern testete 2026 am Oberlandesgericht München das System ALeKS. Es erkennt sensible Angaben in Gerichtsentscheidungen und unterstützt deren Anonymisierung. Ob eine Entscheidung veröffentlicht wird, bestimmt weiterhin das Gericht, nach der automatisierten Bearbeitung folgt eine manuelle Qualitätskontrolle. ALeKS erleichtert damit eine Verwaltungsaufgabe. Es erstellt keine Risikoprognose und entscheidet nicht über ein Verfahren.

Auch ein oft genanntes Beispiel aus Nordrhein-Westfalen braucht diese Genauigkeit. Das Forschungsprojekt EVAS sollte mithilfe automatisierter Videoanalyse mögliche Suizidhandlungen in Haft­räumen erkennen. Das ursprüngliche Forschungsprojekt endete bereits 2021. Ein Bericht des Justizministeriums von 2024 hielt fest, dass die entwickelten Detektoren nicht zuverlässig genug für den Echtbetrieb waren. Konkrete Fehlerquoten wurden dort nicht veröffentlicht.

In Berlin wiederum bezeichnet kbO keinen Algorithmus, sondern einen kriminalitätsbelasteten Ort. Seit Juli 2026 sind sieben solcher Bereiche durch Rechtsverordnung ausgewiesen. Die Einstufung eröffnet der Polizei zusätzliche Befugnisse, darunter verdachtsunabhängige Identitätsfeststellungen und Durchsuchungen. AlgorithmWatch ordnet diese Praxis als ortsbezogene Form prädiktiver Polizeiarbeit ein. Ein eigenständiges System, das die Polizeipräsenz automatisiert steuert, ist in den öffentlichen Unterlagen jedoch nicht belegt.

Diese Beispiele zeigen zweierlei: Behörden veröffentlichen durchaus Informationen über einzelne Projekte. Eine vollständige, zentral zugängliche Übersicht über alle algorithmischen Systeme in Gerichten, Staatsanwaltschaften, Polizei und Strafvollzug ergibt sich daraus aber nicht.

Risikoprognosen ohne maschinelles Lernen

Nicht jedes rechnergestützte Instrument, das in freiheitsrelevante Entscheidungen einfließen kann, ist künstliche Intelligenz. Das FOTRES, kurz für Forensisches Operationalisiertes Therapie-Risiko-Evaluations-System, wird in der Schweiz und in Deutschland eingesetzt und arbeitet nicht mit maschinellem Lernen. Seine Bewertungslogik wurde nicht wie bei einem lernenden Modell aus einem Trainingsdatensatz abgeleitet, sondern von Fachleuten festgelegt. Fachpersonen wählen und bewerten vorgegebene Risikomerkmale, eine proprietäre Software berechnet daraus unter anderem Risikowerte. Der Entwickler Frank Urbaniok stellt es als Gegenentwurf zu statistischen Verfahren dar: Im Mittelpunkt stehe der individuelle Deliktmechanismus, nicht die Ableitung aus Rückfallquoten einer Vergleichsgruppe. Das ist die Sicht des Anbieters auf sein eigenes Verfahren.

FOTRES entscheidet nicht selbst über Entlassung, Vollzugslockerungen oder therapeutische Maßnahmen. Seine Einschätzungen können aber in Gutachten und Vollzugsbeurteilungen einfließen, die Behörden und Gerichte berücksichtigen.

Der Wissenschaftsphilosoph Tim Räz untersuchte das Verfahren in der Fachzeitschrift AI and Ethics. Die einzige publizierte Validierungsstudie zu FOTRES 2.0 berichtete für ihre Stichprobe eine akzeptable Prognosegüte. Sie war jedoch nicht unabhängig, beteiligte Autoren standen mit der Entwicklung des Instruments in Verbindung. Untersucht wurden 2011 genau 109 männliche Gewalt- und Sexualstraftäter einer Schweizer Anstalt, Ausländer ohne dauerhafte Aufenthaltserlaubnis waren ausgeschlossen. Ihre Ergebnisse lassen sich deshalb weder ohne Weiteres auf Frauen, andere Deliktsgruppen noch auf die heute angebotene Version FOTRES 4 übertragen, für die keine vergleichbare öffentlich zugängliche Revalidierung erkennbar ist.

Hinzu kommt die begrenzte Nachvollziehbarkeit der Berechnung. Das Recherchekollektiv WAV erhielt einen Testzugang und berichtete, dass bestimmte Kategorien doppelt, negativ oder gar nicht in Werte eingingen. Begründungen für einzelne Gewichtungen seien im untersuchten Material nicht zu finden gewesen. Befürworter halten dagegen, die Stärke von FOTRES liege weniger in einem isolierten Gesamtwert als in einer standardisierten Sprache für Risikomerkmale.

Der Streit macht eine zentrale Kontrollfrage sichtbar: Auch ein regelbasiertes System kann intransparent sein. Entscheidend ist nicht allein, ob eine Software KI heißt, sondern ob ihre Annahmen, Gültigkeitsgrenzen und Fehler ausreichend unabhängig untersucht werden.

COMPAS und zwei verschiedene Vorstellungen von Fairness

Wie stark die Bewertung eines Systems vom verwendeten Fairnessmaß abhängt, zeigt COMPAS in den USA. ProPublica untersuchte 2016 Daten von mehr als 7.000 festgenommenen Personen aus Broward County in Florida. Unter den Personen, für die innerhalb des zweijährigen Beobachtungszeitraums keine erneute Festnahme wegen einer neuen Straftat registriert wurde, waren 44,9 Prozent der schwarzen und 23,5 Prozent der weißen Beschuldigten zuvor fälschlich als erhöhtes Risiko eingestuft worden. Die Unterscheidung ist wichtig: Gemessen wurden Festnahme- und Registerdaten, nicht Straffälligkeit. Eine nicht entdeckte oder nicht registrierte Tat erscheint darin nicht.

Der damalige Hersteller Northpointe widersprach der Interpretation. Er verwies unter anderem darauf, dass Risikowerte für schwarze und weiße Personen vergleichbar kalibriert seien, bei gleichem Score sei die beobachtete Rückfallwahrscheinlichkeit ähnlich. Beides kann statistisch gleichzeitig zutreffen. Wenn sich Ausgangsraten zwischen Gruppen unterscheiden, können gleiche Kalibrierung und gleiche Fehlerraten nicht ohne Weiteres zugleich erreicht werden. Die Auseinandersetzung ist deshalb nicht nur eine über Mathematik, sondern darüber, welches Fairnessziel in einem Strafverfahren gelten soll.

Für Deutschland ließe sich ProPublicas Untersuchung nicht einfach mit der amtlichen Strafverfolgungsstatistik wiederholen. Sie erfasst unter anderem Geschlecht und Staatsangehörigkeit, aber keine mit den US-Kategorien unmittelbar vergleichbare ethnische Selbstzuordnung. Das macht identische Auswertungen unmöglich, nicht aber jede Untersuchung von Diskriminierung. Befragungen, spezielle Forschungsdatensätze und andere Studiendesigns bleiben möglich.

Wenn Kontrollen neue Daten erzeugen

Bei ortsbezogener Polizeisoftware kommt ein weiteres Risiko hinzu. Werden Prognosen aus historischen Polizeidaten erstellt, bilden diese Daten nicht nur Kriminalität ab, sondern auch frühere Schwerpunktsetzungen der Polizei. Zusätzliche Kontrollen in einem Gebiet können zu mehr registrierten Vorfällen führen. Fließen diese anschließend in neue Analysen ein, kann das Gebiet erneut als auffällig erscheinen.

AlgorithmWatch beschreibt diesen möglichen Rückkopplungseffekt in seinem Bericht über Predictive Policing in Deutschland, wissenschaftlich untersucht haben ihn Kristian Lum und William Isaac. Daraus folgt nicht, dass jedes System zwangsläufig diskriminiert. Es bedeutet aber, dass registrierte Polizeidaten nicht als neutrales Abbild der gesamten Kriminalität behandelt werden dürfen. Wo, wie häufig und gegen wen kontrolliert wird, beeinflusst, was statistisch sichtbar wird.

Aufsicht vorhanden, Hochrisikoregeln verschoben

Der EU AI Act zählt bestimmte Systeme, die Gerichte bei der Ermittlung und Auslegung von Tatsachen und Recht oder bei der Rechtsanwendung unterstützen, zu den Hochrisikosystemen. Rein unterstützende Verwaltungstätigkeiten wie die Anonymisierung gerichtlicher Entscheidungen fallen nach der Verordnung dagegen nicht allein deshalb in diese Kategorie.

Die Hochrisikoregeln verlangen unter anderem Risikomanagement, geeignete Daten-Governance, Dokumentation, Informationen für Betreiber und menschliche Aufsicht. Sie gelten für die einschlägigen Systeme aus Anhang III nach einer Änderung des europäischen Zeitplans grundsätzlich erst ab dem 2. Dezember 2027, für bereits zuvor eingesetzte Systeme gelten zusätzliche Übergangsregeln. Der AI Act ist daher seit August 2026 in wesentlichen Teilen anwendbar, aber nicht vollständig in Bezug auf diese Justizsysteme.

Deutschland hat die nationale Aufsichtsstruktur verspätet geschaffen. Das KI-Marktüberwachungs- und Innovationsförderungsgesetz trat am 29. Juli 2026 in Kraft. Die Bundesnetzagentur ist grundsätzlich Marktüberwachungsbehörde sowie zentrale Anlauf- und Beschwerdestelle. Für bestimmte sensible Hochrisikosysteme des Bundes ist eine unabhängige Marktüberwachungskammer vorgesehen, daneben bleiben Fach- und Landesbehörden zuständig.

Damit ist die Behauptung, es gebe überhaupt keine benannte KI-Aufsicht, überholt. Offen bleibt aber, wie einheitlich die föderale Struktur arbeitet, wie gut die zuständigen Stellen ausgestattet werden und welche Informationen über behördlich eingesetzte Systeme öffentlich zugänglich sind. Ein vollständiges und verbindliches öffentliches Register speziell für alle algorithmischen Anwendungen in der deutschen Justiz ist in den geprüften öffentlichen Unterlagen bislang nicht zu finden.

Auch das Datenschutzrecht löst das Transparenzproblem nicht pauschal. Artikel 22 der DSGVO schützt vor bestimmten ausschließlich automatisierten Entscheidungen mit rechtlicher oder ähnlich erheblicher Wirkung. Er ist kein allgemeines Recht auf Offenlegung jedes Algorithmus. Für Strafverfolgung und Strafvollstreckung gelten zudem regelmäßig die EU-Richtlinie für den Datenschutz bei Polizei und Justiz sowie die jeweiligen nationalen Gesetze. Der Europäische Gerichtshof stellte 2025 in einem Fall zur Bonitätsbewertung klar, dass Betroffene eine verständliche Erläuterung erhalten müssen, mit der sie ein automatisiertes Ergebnis nachvollziehen und anfechten können. Geschäftsgeheimnisse beseitigen diese Rechte nicht automatisch, können aber eine geschützte Prüfung durch Behörden oder Gerichte erforderlich machen.

Der Mensch muss tatsächlich entscheiden

Selbst eine formal menschliche Letztentscheidung verhindert Fehler nicht automatisch. Als Automation Bias wird die Neigung bezeichnet, Vorschlägen automatisierter Systeme zu viel Gewicht zu geben. Zeitdruck, Personalmangel und der vermeintlich objektive Zahlenwert eines Systems können diese Wirkung verstärken.

Ein 2026 verabschiedetes Grundlagenpapier der Präsidentinnen und Präsidenten der Oberlandesgerichte, des Kammergerichts, des Bayerischen Obersten Landesgerichts und des Bundesgerichtshofs zieht deshalb eine klare Grenze: KI soll gerichtliche Entscheidungen vorbereiten, strukturieren und standardisieren, sie aber nicht ersetzen. Gefordert werden verbindliche Governance, kontrollierbare Betriebsumgebungen, bundesweite Standards sowie verpflichtende Fortbildungen. Auch die Neue Richtervereinigung warnt besonders im Strafverfahren vor Systemen, deren Ergebnisse nicht hinreichend nachvollzogen und überprüft werden können.

Der entscheidende Gegensatz lautet deshalb nicht Mensch gegen Maschine. Er verläuft zwischen überprüfbaren und nicht überprüfbaren Verfahren. Wer ein algorithmisches Ergebnis in ein Gutachten, eine polizeiliche Lagebewertung oder eine gerichtliche Vorbereitung einführt, muss dessen Herkunft, Grenzen und mögliche Fehler kennen. Aus rechtsstaatlicher Sicht sollten Betroffene erfahren können, ob ein solches System erheblich zu ihrer Bewertung beigetragen hat und wie sie das Ergebnis angreifen können. Ein Erklärungsrecht sieht Artikel 86 des AI Acts nur für bestimmte Entscheidungen auf Grundlage von Hochrisiko-KI vor.

Deutschland verfügt inzwischen über eine gesetzliche KI-Aufsicht. Was weiterhin fehlt, ist ein vollständiges öffentliches Bild der eingesetzten Systeme. MaKI und die europäischen Registrierungspflichten sind ein Anfang, decken den Justizbereich aber nicht ab. Ohne ein solches Register, unabhängige Evaluationen und nachvollziehbare Einsatzregeln bleibt Kontrolle punktuell, gerade dort, wo technische Bewertungen staatliche Macht verstärken können.

Dieser Artikel enthielt nach seiner Veröffentlichung mehrere sachliche Fehler. Darauf hingewiesen hat Frank Urbaniok, der Entwickler des darin beschriebenen Prognoseverfahrens FOTRES. Ursache war eine Lücke in unserer automatischen Faktenprüfung: Sie hatte einen Teil der Fehler erkannt, konnte die Befunde aber nicht weitergeben. Diese Lücke ist geschlossen. Der Artikel wurde vollständig überarbeitet und jede überprüfbare Aussage ist seither einzeln mit ihrer Quelle verlinkt.

Was im Einzelnen geändert wurde

Falsch waren: die Darstellung von FOTRES als KI-System mit Trainingsdaten und statistischer Normierung, der Stand des KI-MIG, die Anwendbarkeit des EU AI Act, die Datierung des Projekts EVAS in Nordrhein-Westfalen, die Auflösung des Berliner Begriffs kbO, die Herkunft der Belgien-Zahlen aus einer Erhebung ohne KI-Bezug, die Zuschreibung des Predictive-Policing-Kreislaufs an die falsche Quelle, die Reichweite von Artikel 22 DSGVO, das Datum des einschlägigen EuGH-Urteils, die Angabe von 92 Prozent, die sich auf eine internationale Stichprobe bezog statt auf deutsche Rechtsanwälte, sowie die Urheberschaft des KI-Grundlagenpapiers.

Zu absolut war die Aussage, eine öffentliche Übersicht über algorithmische Systeme der Verwaltung fehle, da das Register MaKI seit Anfang 2026 besteht.

Präzisiert wurden die COMPAS-Zahlen, die sich auf registrierte Festnahmen beziehen und nicht auf tatsächliche Straffälligkeit, die Darstellung von FOTRES, deren Angaben des Entwicklers nun als dessen Sicht gekennzeichnet sind und das Erklärungsrecht aus Artikel 86 des AI Acts, das als rechtspolitische Forderung steht und nicht als geltendes Recht. Eine nicht belegbare Moratoriumsforderung wurde entfernt.

Kommentare