Blog › Alle reden davon, wie wichtig "Human-in-the-loop" bei KI…

Alle reden davon, wie wichtig "Human-in-the-loop" bei KI ist. Die Evidenz ist ernüchternd.

4. Juli 2026 · 378 Wörter · Danny Walther

Das „Human-in-the-loop“ Konzept - von Norbert Wiener in den 1940er Jahren entwickelt - war ursprünglich als Sicherheitsnetz gedacht. Es ging darum, Feedback-Schleifen in technisch komplexe und potentiell gefährliche Systeme einbauen, die die Verbindung von Mensch und Maschine regeln und sicherstellen sollten, dass der Mensch als Kontroll-Element korrigierend eingreifen kann.

Buchcover von Norbert Wieners „The Human Use of Human Beings: Cybernetics and Society“: ein purpurfarbenes Kopfporträt, überspannt von einem Netz aus bunten Fäden und Kugeln; oben der Hinweis „The single most important and influential work on man’s role in an automated world“.
Abb.: eigenes Buch

Inzwischen ist aber oft nur noch Wortgeklingel. Ein Trostspender für unübersichtliche Zeiten und überkomplexe Systeme. Zumindest sagt mir das mein Gefühl. Also habe ich verschiedene KI-Systeme nach Daten zur Wirksamkeit von "Human-in-the-loop" gefragt. Und das ist dabei herausgekommen:

Was die KI-Systeme selbst dazu sagen

Perplexity: (Pro-Abo, Modus: Akademisch)

"Die aktuelle Evidenzlage zeigt ein deutlich heterogeneres und teils ernüchterndes Bild als die frühe, meist theoretische HITL-Literatur suggerierte: Mensch-KI-Kombinationen übertreffen die jeweils beste Einzelkomponente (Mensch oder KI allein) im Durchschnitt nicht, sondern schneiden sogar signifikant schlechter ab – mit Ausnahme von Inhaltserstellungsaufgaben."

SciSpace: (Team-Abo, Modus: Deep Review)

"Im Kern zeigen die Daten, dass menschliches Feedback die Modellleistung, Fehlerreduktion und Robustheit typischerweise verbessert, besonders bei unsicheren oder neuartigen Eingaben. Zugleich werden Leistungsgewinne durch klar definierte Interaktionspunkte und sorgfältige Abstimmung der menschlichen Rolle begünstigt. Insgesamt deuten die Befunde auf einen nachhaltigen Nutzen, aber stark abhängig von Einsatzszenario und Prozessdesign."

ChatGPT: (Plus-Abo, Deep Research)

"Die empirische Evidenz ist klar heterogen. [...] Für moderne Human-AI-Kollaboration ist die wichtigste übergreifende Erkenntnis nüchtern: Menschen + KI sind im Mittel nicht automatisch besser als der jeweils beste Einzelakteur. Eine Meta-Analyse von über 100 experimentellen Studien fand im Durchschnitt sogar eine Unterlegenheit von Human-AI-Kombinationen gegenüber der jeweils besseren Einzelkomponente; Gewinne traten eher bei kreativen Aufgaben auf, Verluste eher bei Entscheidungsaufgaben."

Consensus: (Corpus-Suche, Deep-Modus)

"Die Evidenz zeigt: Human-in-the-Loop (HITL) verbessert häufig Genauigkeit, Sicherheit, Vertrauen oder Akzeptanz gegenüber reiner Automatisierung, besonders in risikoreichen oder datenarmen Aufgaben. Der Effekt ist aber nicht universell; historische und aktuelle Arbeiten zeigen ebenso, dass menschliche Aufsicht ohne gutes Interface, Training und Eskalationslogik leicht zu Übervertrauen, Bias und ineffektiver Kontrolle führt."

Claude: (Literatur Review Skill + spezielle Recherche Konnektoren)

"Menschen in automatisierten Schleifen tendieren zu Automatisierungs-Bias (unkritisches Abnicken von Systemvorschlägen), verlieren bei seltener Eingriffsnotwendigkeit ihre Situationswahrnehmung („Out-of-the-Loop-Performance-Problem"), und die bislang größte Meta-Analyse zu Mensch-KI-Kombinationen (106 Studien, 370 Effektstärken) findet, dass solche Kombinationen im Schnitt signifikant schlechter abschneiden als die jeweils bessere Einzelkomponente, vor allem bei Entscheidungsaufgaben."

Und nun? Muss ich als Human raus aus dem KI-Recherche-Loop und mir die Daten genauer anschauen... :)