Gedanken zur KI-Governance

    Prüfraster

    Wann ist eine KI-Erkenntnis entscheidungsreif?

    KI-Recherche liefert heute in Minuten Berichte mit Zahlen, Quellen und klaren Schlussfolgerungen. Sie sehen aus wie fertige Erkenntnisse. Für Entscheider zählt aber nur eine Frage: Trägt diese Aussage eine Investition, einen Markteintritt oder ein Nein? Der US-Anbieter Northern Light hat dazu kürzlich einen lesenswerten Beitrag veröffentlicht. Die Kernbotschaft teile ich: Eine KI-Aussage ist eine zu prüfende Behauptung, keine Antwort. Ich würde einen Schritt weiter gehen. Die Prüfung selbst sollte anerkannten Standards folgen und nicht dem Bauchgefühl.

    Eine KI-Analyse ist erst dann entscheidungsreif, wenn jede tragende Aussage nach nachvollziehbaren Regeln bewertet ist. Wie flüssig sie formuliert ist, spielt dafür keine Rolle.

    Stand 28. September 2026

    Eine Quelle ist noch kein Beleg

    Dass eine Quelle existiert, heißt nicht, dass sie die Aussage trägt. Genau hier scheitern viele KI-Berichte, oft unbemerkt. Typische Fehler sehen so aus:

    • Die Quelle existiert, sagt aber etwas anderes oder weniger als behauptet.
    • Die Zahl stimmt, ist aber drei Jahre alt.
    • Fünf Quellen wirken wie breite Bestätigung, zitieren aber alle dieselbe Pressemitteilung.
    • Eine Schlussfolgerung der KI steht im Text wie eine Tatsache.

    Wer das von Hand prüft, braucht Zeit. Northern Light veranschlagt etwa zehn Minuten pro Aussage. Ein typischer Bericht mit 60 bis 80 Aussagen bindet damit 10 bis 13 Stunden. Deshalb unterbleibt die Prüfung meistens.

    Andere Disziplinen haben das längst gelöst

    Wie man unsichere Belege bewertet, ist keine neue Frage. Medizin, Klimaforschung, Lebensmittelsicherheit und Nachrichtendienste haben dafür seit Jahrzehnten erprobte Standards.

    StandardHerkunftKerngedanke
    Admiralty CodeRoyal Navy, heute NATOWie zuverlässig die Quelle ist und wie gut die Information bestätigt ist, sind zwei getrennte Fragen
    GRADEInternationale Arbeitsgruppe, genutzt von WHO und CochraneDie Qualität der Evidenz und die Stärke einer Empfehlung werden getrennt ausgewiesen
    IPCC-KonfidenzspracheWeltklimaratKonfidenz entsteht aus Menge und Qualität der Belege und aus ihrer Übereinstimmung
    EFSA Weight of EvidenceEuropäische Behörde für LebensmittelsicherheitBelege werden nach Verlässlichkeit, Relevanz und Konsistenz gewichtet
    ICD 203US-NachrichtendiensteBelege, Annahmen und Urteile müssen klar getrennt sein

    Ich habe sie auf Marktanalysen übertragen, und das funktioniert erstaunlich gut. Die Situation ist dieselbe: unvollständige Information, eine Entscheidung unter Zeitdruck und ein Leser, der nicht selbst nachprüfen kann.

    Drei Ebenen der Bewertung

    Aus diesen Standards ergibt sich ein einfaches Gerüst. Jede Erkenntnis wird auf drei Ebenen bewertet, und jede Ebene beantwortet eine eigene Frage.

    EbeneFrageWas bewertet wird
    1. BelegWie gut ist diese einzelne Quelle?Art der Quelle, Nähe zum Ursprung, Aktualität
    2. AussageWie gut ist diese Zahl oder Einstufung gestützt?Anzahl unabhängiger Belege, Widersprüche, direkte oder abgeleitete Evidenz
    3. UrteilWas folgt daraus, und wie sicher?Trennung von Beleg und Annahme, Kipppunkt, Stärke der Empfehlung

    Der entscheidende Punkt: Eine gute Quelle macht noch keine gut belegte Aussage. Und eine gut belegte Aussage rechtfertigt noch nicht jede Empfehlung. Wer die Ebenen vermischt, überschätzt seine Sicherheit.

    Der unterschätzte Punkt: Unabhängigkeit

    Fünf Quellen sind nur dann fünf Belege, wenn sie unabhängig voneinander entstanden sind. Diese Regel stammt aus dem Admiralty Code, und KI-Berichte verletzen sie besonders häufig.

    Der Grund ist einfach. Eine Unternehmensmeldung wird von Fachportalen, Newslettern und Aggregatoren aufgegriffen. Die KI findet alle Fassungen und zitiert sie als getrennte Quellen. Der Bericht wirkt breit abgestützt, hängt aber an einem einzigen Ursprung.

    Die Konsequenz für jede Analyse: Belege werden nach Ursprung gezählt, nicht nach Fundstellen. Wiederholungen derselben Meldung zählen als eine Quelle. Eine Aussage mit nur einem Ursprung kann richtig sein, sie muss aber als solche erkennbar sein.

    Kipppunkt und Empfehlungsstärke

    Jede tragende Aussage braucht einen Kipppunkt: eine Zeile, die sagt, was die Einschätzung ändern würde. Das macht aus einer Behauptung eine überprüfbare Annahme.

    Ein Beispiel: „Der Markt wächst bis 2030 zweistellig. Hält, solange die angekündigte Förderung nicht gekürzt wird.“ Der Leser weiß sofort, welche Entwicklung er beobachten muss. Aus der Sicht der Nachrichtendienste ist das die Pflicht, Alternativen mitzudenken.

    Der zweite Gedanke kommt aus der Medizin. GRADE trennt die Qualität der Evidenz von der Stärke einer Empfehlung. Eine klare Empfehlung auf dünner Datenlage ist erlaubt, wenn sie als solche ausgewiesen ist: „Empfehlung stark, Evidenz schwach.“ Das ist ehrlicher als eine vorsichtige Empfehlung, die ihre Unsicherheit versteckt.

    Sechs Fragen an jede Analyse

    Entscheider müssen diese Standards nicht selbst anwenden. Sie sollten aber von jeder Analyse verlangen, dass sie diese Fragen beantwortet, ob sie von einer KI, einer Agentur oder dem eigenen Team kommt.

    1. Kann ich zu jeder tragenden Aussage die Quelle öffnen und die Stelle finden?
    2. Ist erkennbar, was belegt ist und was abgeleitet oder angenommen wurde?
    3. Wie alt sind die Belege, gemessen am Zeitpunkt der Entscheidung?
    4. Auf wie vielen unabhängigen Ursprüngen beruht die Aussage?
    5. Was würde die Einschätzung kippen?
    6. Ist die Stärke der Empfehlung getrennt von der Stärke der Evidenz ausgewiesen?

    Wer bei zwei oder mehr Fragen keine Antwort findet, hält eine gut formulierte Vermutung in der Hand, keine Entscheidungsgrundlage.

    Die Prüfung ist das Produkt

    KI macht Recherche schnell und billig. Wertvoll wird sie erst durch die Bewertung dessen, was sie findet.

    Deshalb baue ich diese Standards gerade in die busqo-Methodik ein. Evidenzstufen, Aktualität und Annahmen mit Kennung gibt es in jedem Scan schon. Neu kommen drei Dinge dazu: Die Konfidenz zählt künftig auch, wie viele unabhängige Ursprünge eine Aussage tragen. Jede Kernaussage bekommt einen Kipppunkt. Und im Entscheidungsdokument steht die Stärke der Empfehlung getrennt von der Stärke der Evidenz.

    Die entscheidende Frage lautet nicht, ob eine KI eine Antwort gefunden hat. Sie lautet, ob diese Antwort eine Entscheidung trägt.