Ein KI-System liefert eine übersichtliche Vertragsanalyse mit plausiblen Fundstellen. Das sieht brauchbar aus. Ob es die entscheidende Ausnahme in einer Anlage übersehen hat, zeigt sich erst bei einer gezielten Prüfung.
Für Kanzleien reicht es deshalb nicht, die abschließende Kontrolle pauschal einem Menschen zuzuweisen. Der Arbeitsablauf muss festlegen, was geprüft wird, woran sich Fehler erkennen lassen und wann das Ergebnis verworfen werden muss.
Wie relevant diese Fragen sind, zeigt eine 2025 veröffentlichte Untersuchung spezialisierter juristischer Rechercheprodukte. Die getesteten Systeme von LexisNexis und Thomson Reuters lieferten bei den untersuchten Aufgaben in rund 17 bis 33 Prozent der Fälle Halluzinationen. Gemeint waren unter anderem falsche Aussagen und unzutreffende Behauptungen darüber, was eine Quelle belegt. Die Untersuchung betrifft US-Rechtsrecherche und die damaligen Produktstände. Sie liefert keine allgemeine Fehlerquote heutiger KI-Werkzeuge oder österreichischer Rechtsrecherche. Magesh et al., Hallucination-Free?, 2025
Für die eigene Kanzlei folgt daraus eine praktische Aufgabe: Die Eignung eines Werkzeugs muss am vorgesehenen Einsatz geprüft werden. Auch eine spezialisierte Datenbasis ersetzt diesen Schritt nicht.
Risiko hängt vom konkreten Einsatz ab
Eine interne Zusammenfassung ist nicht automatisch unkritisch. Sie kann vertrauliche Informationen enthalten oder später als Grundlage einer wichtigen Entscheidung dienen. Umgekehrt lässt sich ein eng begrenzter Vergleich unter Umständen gut kontrollieren, wenn die relevanten Ausgangsdokumente vorliegen.
Für die Bewertung empfehlen wir drei getrennte Fragen:
- Welche Daten werden verarbeitet? Berücksichtigen Sie Vertraulichkeit, personenbezogene Informationen und die Bedingungen des eingesetzten Systems.
- Welche Folgen hätte ein Fehler? Eine ausgelassene Nebeninformation hat andere Konsequenzen als eine übersehene Haftungsregelung.
- Wie gut lässt sich das Ergebnis prüfen? Entscheidend sind verfügbare Originalquellen, fachliche Kompetenz und der notwendige Prüfaufwand.
Diese Fragen helfen bei der Gestaltung des Arbeitsablaufs. Sie bilden keine rechtlichen Risikoklassen des AI Act ab.
Ein Prüfverfahren für den Klauselvergleich
Unsere fiktive Wirtschaftskanzlei möchte Lieferverträge anhand eines eigenen Prüfkatalogs vorstrukturieren. KI soll die passenden Vertragsstellen zuordnen. Die rechtliche Bewertung und Freigabe bleiben bei den zuständigen Anwälten.
Vor dem Pilot klärt die Kanzlei, ob das ausgewählte System für die betreffenden Daten und den vorgesehenen Einsatz geeignet und freigegeben ist. Für die ersten Tests verwendet sie eigens erstellte oder anderweitig zur Verarbeitung freigegebene Dokumente.
Danach braucht es einen fachlichen Maßstab. Ein Anwalt stellt für die Testverträge zusammen, welche Klauseln, Anlagen und Querverweise relevant sind. Der KI-Ablauf wird daran geprüft:
- Verweist jede Zuordnung auf eine tatsächlich vorhandene und passende Vertragsstelle?
- Wurden alle Punkte des Prüfkatalogs bearbeitet, einschließlich relevanter Ausnahmen und Anlagen?
- Bleiben nicht gefundene oder mehrdeutige Stellen als offene Punkte sichtbar?
- Wie viel Zeit benötigt die fachliche Kontrolle einschließlich der Korrekturen?
Der Unterschied zwischen „nicht gefunden“ und „nicht vorhanden“ ist dabei wesentlich. Wenn das System keine Klausel erkennt, ist deren Fehlen noch nicht festgestellt.
Auch Auslassungen müssen auffallen
Eine flüssig formulierte Antwort lenkt die Aufmerksamkeit leicht auf das, was sie enthält. Bei juristischer Arbeit kann jedoch entscheidend sein, was fehlt. Die Prüfung sollte sich deshalb auch am ursprünglichen Auftrag und am Prüfkatalog orientieren.
Bei unbekannten Vertragsarten, unleserlichen Scans oder fehlenden Anlagen braucht der Ablauf einen vorgesehenen Umgang mit Grenzen. Beispielsweise kann die Bearbeitung an einen Anwalt zurückgegeben werden, bevor eine unvollständige Übersicht weiterverwendet wird.
Erst nach diesen Tests lässt sich sinnvoll entscheiden, ob die Anwendung ausgebaut wird. Wiederkehrende relevante Auslassungen oder übermäßiger Korrekturaufwand sprechen dafür, den Einsatz enger zu begrenzen oder einen anderen Ansatz zu wählen. Auch das ist ein nützliches Pilotergebnis.
Qualität und Zeit gemeinsam bewerten
Der Maßstab ist ein fachlich brauchbares Ergebnis bei vertretbarem Gesamtaufwand. Eine in Sekunden erzeugte Analyse hilft der Kanzlei wenig, wenn ihre Überprüfung länger dauert als die bisherige Bearbeitung.
Datology entwickelt und integriert KI-Anwendungen mit Blick auf die vorhandenen Systeme, Zugriffsrechte und vorgesehenen Kontrollen. Die fachlichen Prüfkriterien und Freigaben legen wir gemeinsam mit den verantwortlichen Personen in der Kanzlei fest.
Sie haben einen Anwendungsfall, sind aber unsicher, ob er sich zuverlässig prüfen lässt? Im kostenlosen Erstgespräch besprechen wir die Aufgabe, die betroffenen Daten und die Fragen, die vor einem Pilot geklärt werden sollten.
Kostenloses Erstgespräch vereinbarenQuellen und weiterführende Informationen
Veröffentlicht am 30. September 2026. Das durchgehende Kanzleibeispiel dieser Serie ist fiktiv.
Weiter in Teil 4: Wie werden aus einem getesteten Ablauf eine gemeinsame Arbeitsweise und anwendbare Kompetenz im Team? Erscheint am 7. Oktober 2026.