KI-Halluzinationen bei Gerichtsentscheidungen: So überprüfen Sie juristische KI-Zitate mit ChatGPT

Large Language Models (LLMs) werden zunehmend für die juristische Recherche und die Erstellung von Schriftsätzen oder Argumentationen eingesetzt. Gerade bei der Angabe von Gerichtsentscheidungen liegt dabei jedoch ein besonderes Risiko: Eine KI kann eine Entscheidung zwar mit einem plausiblen Aktenzeichen, Datum und einer scheinbar passenden Fundstelle angeben, ohne dass die zitierte Entscheidung den behaupteten Rechtssatz tatsächlich enthält.

Das Problem besteht deshalb weniger darin, dass das LLM ein Urteil „erfindet“. Viel mehr problematisch ist der Fall, dass eine tatsächlich existierende Entscheidung falsch wiedergegeben wird. Das Gericht hat dann in der Regel in einem völlig anderen Zusammenhang oder mit einer anderen Begründung entschieden.

Prüfen Sie die erste Zitierung

Für die Prüfung ist daher eine einfache Frage entscheidend: Belegt die erste zitierte Entscheidung tatsächlich die Aussage, für die sie im KI-generierten Text verwendet wird?

Diese Frage lässt sich auch ohne spezielle Software überprüfen. Voraussetzung ist allerdings, dass der Volltext der Entscheidung beschafft werden kann.

Das Problem: Ein plausibles Zitat ist noch kein Beleg

Wer ChatGPT beispielsweise auffordert, zu einer bestimmten Rechtsfrage einschlägige Gerichtsentscheidungen zu nennen, erhält häufig eine Liste aus Gericht, Datum, Aktenzeichen und Fundstelle. Das Ergebnis kann ausgesprochen überzeugend aussehen.

Genau hier liegt die Gefahr. Ein Aktenzeichen kann plausibel erscheinen. Ein Datum kann plausibel erscheinen. Auch der behauptete Rechtssatz kann juristisch vernünftig klingen. Daraus folgt jedoch noch nicht, dass die Entscheidung diesen Rechtssatz tatsächlich trägt und der Rechtssatz so in diesem Zusammenhang existiert.

Bei einer juristischen Verwendung müssen deshalb mindestens zwei unterschiedliche Fragen voneinander getrennt werden:

Existiert die zitierte Entscheidung tatsächlich? Unterstützt die Entscheidung tatsächlich die konkrete Aussage, für die sie zitiert wird? Die zweite Frage ist in der Praxis besonders wichtig. Denn ein echtes Urteil kann nämlich trotzdem eine unzutreffende Fundstelle für die konkrete Aussage sein.

Die einfachste manuelle Kontrolle

Für eine erste Überprüfung benötigt man keine besondere KI-Software.

Man nimmt zunächst den von der KI erzeugten Text und identifiziert die darin enthaltenen Rechtsprechungszitate. Anschließend beschafft man den Entscheidungstext der jeweiligen Entscheidung über Google oder eine andere Suchmaschine. Wenn sich die Entscheidung auf juris befindet und sonst nirgendwo, dann müssen Sie einen Anwalt zur Prüfung beauftragen. Danach soll nicht die gesamte Entscheidung blind von der KI „zusammengefasst“ werden. Stattdessen sollte die konkrete Behauptung aus dem KI-Text zusammen mit dem einschlägigen Text der Entscheidung überprüft werden.

Wir Juristen machen das, indem wir die Entscheidung kurz scannen. Oft sehen wir sofort, dass es sich hierbei um einen ganz anderen Fall handelt.

Sie als Nutzer sind aber möglicherweise nicht in der Stimmung sich durch den juristischen Text zu kämpfen.

Genau hierfür kann ChatGPT als Kontrollwerkzeug eingesetzt werden.

Der Workflow sieht dann so aus:

┌─────────────────────────────────────┐
│ AI-generierter Text │
│ │
│ „…vgl. BVerwG, Urt. v. …“ │
└─────────────────────────────────────┘

Stelle mit Zitat kopieren

┌─────────────────────────────────────┐
│ Behauptung│
│ „Das Gericht hat entschieden, dass X…“ │
└─────────────────────────────────────┘
+
┌─────────────────────────────────────┐
│ Einfügen des Entscheidungstextes │
│ │
│ [decision text] │
└─────────────────────────────────────┘

Verification model

┌───────────────────┐
│ SUPPORT │
│ CONTRADICTS │
│ NOT FOUND │
└───────────────────┘

Der Kontroll-Prompt

Der folgende Prompt kann für die Überprüfung einer einzelnen Fundstelle verwendet werden:

Prompt:

Prüfe ausschließlich anhand des nachfolgend eingefügten Volltexts der Gerichtsentscheidung, ob die Entscheidung die folgende Aussage tatsächlich stützt.

X: Behauptung aus dem KI-generierten Text:

Y: Gerichtsentscheidung:

Warte auf meine Eingabe von X und Y. Diese werden nach diesem Prompt folgen.

Gehe dann wie folgt vor: Suche im Volltext nach den tatsächlichen Ausführungen des Gerichts, die für die Behauptung relevant sind. Nenne die konkrete Randnummer bzw. Seitenstelle, soweit im eingefügten Text vorhanden. Gib die für die Prüfung entscheidende Passage kurz wörtlich wieder. Erkläre anschließend, ob die Passage die Behauptung tatsächlich trägt.

Unterscheide dabei zwischen:

„trägt die Behauptung“

„trägt die Behauptung nur teilweise“

„trägt die Behauptung nicht“

„anhand des eingefügten Textes nicht feststellbar“

Ergänze keine Informationen aus deinem eigenen Wissen und verwende keine anderen Entscheidungen.

Besonders wichtig: Beurteile nicht, ob die Behauptung juristisch richtig ist. Prüfe ausschließlich, ob die hier eingefügte Gerichtsentscheidung die Behauptung tatsächlich stützt.

Dieser letzte Satz ist entscheidend. Die KI soll nicht erneut selbst juristisch recherchieren, sondern eine konkrete Belegprüfung durchführen.

Warum der Volltext wichtig ist

Die Überprüfung sollte möglichst auf dem tatsächlichen Volltext der Entscheidung beruhen. Wird ChatGPT lediglich gefragt:

„Stimmt es, dass das OVG X in seinem Urteil vom … entschieden hat, dass …?“

besteht erneut das Problem, dass die Antwort selbst aus dem Sprachmodell stammen kann. Die KI könnte die vermeintliche Entscheidung aus ihrem vorhandenen Wissen rekonstruieren oder eine plausible Antwort erzeugen. Bei der manuellen Kontrolle wird deshalb ein anderer Ansatz gewählt: Nicht ChatGPT soll die Entscheidung finden und wiedergeben. Der Nutzer beschafft die Entscheidung selbst und gibt ihren Text vor.

Damit wird die Aufgabe für die KI erheblich enger. Sie soll nicht mehr herausfinden, ob ein Gericht irgendwann etwas entschieden hat. Sie soll einen konkret vorliegenden Text mit einer konkreten Behauptung vergleichen.

Ein praktisches Beispiel

Angenommen, ein KI-generierter Schriftsatz enthält folgenden Satz:

„Nach der Rechtsprechung des Bundesverwaltungsgerichts setzt die Annahme einer Splittersiedlung voraus, dass eine Ansammlung von Gebäuden eine gewisse räumliche Zusammengehörigkeit aufweist (BVerwG, Urteil vom [DATUM], Az. [AKTENZEICHEN]).“

Anstatt das Zitat ungeprüft zu übernehmen, wird zunächst die Entscheidung beschafft.

Dann werden Behauptung und Entscheidung gemeinsam in ChatGPT eingegeben. Die entscheidende Frage lautet anschließend nicht:

„Ist dieser Rechtssatz richtig?“ sondern: „Steht das tatsächlich in dieser Entscheidung?“

Das Ergebnis kann beispielsweise sein, dass die Entscheidung die entsprechende Aussage tatsächlich enthält. Es kann aber ebenso sein, dass das Gericht lediglich einen ähnlichen Begriff verwendet, eine andere Voraussetzung behandelt oder die Aussage nur als Wiedergabe einer älteren Entscheidung erwähnt.

Was diese Methode nicht überprüft

Die Methode hat allerdings eine klare Grenze. Wenn ChatGPT bestätigt, dass eine Entscheidung eine bestimmte Aussage tatsächlich enthält, bedeutet das nicht automatisch, dass diese Aussage heute noch richtig ist. Es wird zunächst nur die sogenannte Belegfunktion der konkreten Entscheidung überprüft. Für eine vollständige juristische Prüfung müssen zusätzlich unter anderem folgende Fragen betrachtet werden:

  • Ist die Entscheidung tatsächlich einschlägig?
  • Ist sie auf den konkreten Sachverhalt übertragbar?
  • Ist sie möglicherweise überholt?
  • Gibt es spätere entgegenstehende Rechtsprechung?
  • Handelt es sich um eine tragende Erwägung oder lediglich um ein obiter dictum?

Wird die Entscheidung im späteren Schrifttum oder in der Rechtsprechung anders eingeordnet? Die KI-Kontrolle ersetzt diese Prüfung nicht.

Der entscheidende Punkt

Der wesentliche Vorteil dieser Vorgehensweise liegt deshalb nicht darin, dass ChatGPT plötzlich zuverlässig „weiß“, welche Gerichtsentscheidungen existieren.

Der Vorteil liegt darin, dass der Nutzer die Informationsquelle selbst vorgibt.

Die Entscheidung wird zunächst eigenständig beschafft. Erst anschließend wird der konkrete Text an die KI übergeben. ChatGPT muss dann nicht mehr die Existenz oder den Inhalt einer unbekannten Entscheidung erraten, sondern kann die vorgelegte Aussage mit dem vorgelegten Entscheidungstext vergleichen. Damit lässt sich ein besonders problematischer Typ juristischer KI-Fehler mit einfachen Mitteln erkennen:

Die Entscheidung existiert – aber sie sagt nicht das, was die KI behauptet.

Am besten ist es deshalb, möglichst wenig Rechtsprechung zu zitieren zu lassen, indem der Prompt entsprechend erweitert wird.

RA Dipl. iur. Marc Heidemann

Marc Heidemann ist Rechtsanwalt mit Schwerpunkt im Verwaltungsrecht und in Hamburg tätig. Seine juristische Ausbildung absolvierte er an der Universität Hamburg, wo er sich intensiv mit den Bereichen Rechtspflege, Internationales Privatrecht, Insolvenzrecht sowie Zwangsvollstreckungs- und Kreditsicherungsrecht befasste. Sein Referendariat führte ihn an das Oberlandesgericht Celle mit einer verwaltungsrechtlichen Spezialisierung am Verwaltungsgericht Stade, insbesondere in den Bereichen Gewerberecht, Öffentliches Baurecht und Landwirtschaftsrecht. Zusätzlich erwarb er eine verwaltungsrechtliche Zusatzqualifikation an der Universität für Verwaltungswissenschaften in Speyer. In seiner anwaltlichen Tätigkeit berät und vertritt Marc Heidemann Mandanten in verschiedenen Bereichen des Verwaltungsrechts. Schwerpunkte sind unter anderem das Waffenrecht, das Denkmalschutzrecht, das Schulrecht und das Baurecht. Er prüft die Rechtmäßigkeit von Verwaltungsakten, begleitet Genehmigungsverfahren und vertritt Mandanten vor den zuständigen Verwaltungsgerichten. Dabei geht es oft um Fragen zu behördlichen Entscheidungen, die Auswirkungen auf die berufliche oder private Situation der Betroffenen haben. Marc Heidemann ist Mitglied der Hanseatischen Rechtsanwaltskammer Hamburg und setzt sich kontinuierlich mit aktuellen Entwicklungen im Verwaltungsrecht auseinander. Neben seiner anwaltlichen Tätigkeit veröffentlicht er regelmäßig Fachartikel zu verwaltungsrechtlichen Themen.

Leave a Reply

Your email address will not be published. Required fields are marked *

Fachlich verantwortlich für den Inhalt dieser Seite: Rechtsanwalt Dipl. iur. Marc Heidemann (zugelassen in Deutschland), Schwerpunkt Verwaltungsrecht. LinkedIn (externer Link)