10. September 2026 · 4 Min. Lesezeit
Laborbefund KI-Analyse: Warum ChatGPT scheitert
Warum ChatGPT bei der KI-Analyse deiner Laborbefunde an drei Stellen scheitert — und wie ein spezialisierter Score Werte funktionell und im Kontext einordnet.
Eine KI-Analyse vom eigenen Laborbefund klingt verlockend: das PDF in ChatGPT werfen, Sekunden später eine kompetent klingende Auswertung. Schön formuliert, souverän im Ton — und trotzdem bleibt ein Rest Unsicherheit. Woher weiß der Chatbot, ob 4,2 wirklich 4,2 war und nicht 42? Und nach welchem Maßstab bewertet er den Wert überhaupt? Genau hier liegt das Problem: Ein generischer Chatbot ist ein Sprachmodell, kein Laborsystem. Er wurde nicht gebaut, um strukturierte Messwerte zuverlässig aus PDFs zu extrahieren, sie gegen ein festes Referenzsystem zu prüfen und im Zusammenhang mit anderen Markern zu bewerten. Er wurde gebaut, um plausiblen Text zu erzeugen — und plausibel ist nicht dasselbe wie korrekt. Für eine lockere Erklärung, was Ferritin überhaupt ist, reicht das oft. Für eine belastbare Einordnung der eigenen Werte reicht es nicht. Drei konkrete Gründe, warum das so ist — und was ein spezialisiertes System anders macht.
In 60 Sekunden: Bei der KI-Analyse eines Laborbefunds scheitert ChatGPT an drei Stellen: Zahlen aus Tabellen werden beim PDF-Import verwechselt oder verrutschen, es fehlt ein fester funktioneller Referenzrahmen (statt Durchschnittsnorm), und ohne festes Marker-Modell beantwortet es alles Mögliche statt strukturiert einzuordnen. Ein spezialisierter Score arbeitet mit einem festen Datenmodell, funktionellen Optimalbereichen aus der Literatur (OptimalDX, NORIP, Peter Attia) und einem Agenten, der bewusst auf die Blutanalyse begrenzt bleibt.
Grund 1: Zahlen verrutschen beim PDF-Import
Laborberichte sind Tabellen — oft mehrspaltig, mit Referenzbereichen, Einheiten und Vorwerten nebeneinander. Ein Sprachmodell liest ein PDF nicht wie eine Tabelle, sondern als Text, der aus dem Layout rekonstruiert wird. Genau dabei passiert der Fehler am häufigsten: Spalten rutschen ineinander, ein Wert wird der falschen Zeile zugeordnet, ein Komma wird zum Punkt, eine Einheit (µg/l vs. ng/ml) bleibt unbeachtet. Bei einem Wert wie Ferritin könnte das den Unterschied zwischen „im grünen Bereich“ und „deutlich zu niedrig“ ausmachen — ohne dass der Chatbot es je bemerkt. Er hat kein Gegenmodell, mit dem er den extrahierten Wert plausibilisieren könnte. Ein System, das stattdessen mit einem festen Marker-Modell arbeitet, kennt für jeden Biomarker den erwartbaren Wertebereich vorab und könnte Ausreißer erkennen, bevor sie in die Auswertung einfließen.
Grund 2: Kein funktioneller Referenzrahmen
Selbst wenn die Zahl stimmt — nach welchem Maßstab wird sie bewertet? Ein generischer Chatbot greift auf das zurück, was in seinen Trainingsdaten am häufigsten vorkam: meist die deutsche Laborschein-Norm, gedacht für die Erkennung klinischer Erkrankung, nicht für die Optimierung von Gesundheit bei aktiven Menschen. Ein TSH von 3,8 gilt dort noch als „normal“ — aus funktioneller Sicht, etwa nach OptimalDX oder den bei Peter Attia diskutierten Zielbereichen, wäre das schon ein Marker, den man sich genauer ansehen könnte. Der Chatbot wechselt zudem inkonsistent zwischen Quellen: bei einer Frage zitiert er die deutsche Norm, bei der nächsten eine US-amerikanische, ohne das offenzulegen. Was fehlt, ist ein festgelegter, nachvollziehbarer Referenzrahmen. Genau das ist der Kern dessen, was wir analysieren: Jeder Marker wird konsequent gegen funktionelle Optimalbereiche geprüft, nicht gegen den statistischen Durchschnitt einer Bevölkerung, in der die meisten Menschen nicht optimal gesund sind.
Grund 3: Keine Struktur, keine Grenzen
Ein Sprachmodell ohne festen Rahmen beantwortet fast alles — auch Fragen, die es eigentlich nicht beantworten sollte. Es macht implizite Aussagen im Ton einer Diagnose, wo eigentlich nur eine Einordnung angebracht wäre. Es springt zwischen Ernährungstipps, Trainingsempfehlungen und Supplement-Vorschlägen, ohne einen roten Faden zur eigentlichen Datenlage zu halten. Und weil kein festes Datenmodell hinter der Konversation steht, geht der Gesamtzusammenhang verloren: Ein einzelner Wert wird isoliert kommentiert, statt ihn im Muster mit verwandten Markern zu sehen — etwa Ferritin zusammen mit Transferrinsättigung und Hämoglobin, oder LDL zusammen mit ApoB und Lp(a). Genau diese Zusammenhänge sind es aber, die eine echte Auswertung von einer Wert-für-Wert-Aufzählung unterscheiden.
Was ein spezialisierter Score anders macht
Drei strukturelle Unterschiede machen den Unterschied:
- Festes Marker-Modell statt freiem Text. Jeder bewertete Biomarker hat eine feste ID, einen definierten Wertebereich und eine Kategorie. Werte werden strukturiert erfasst, nicht aus Fließtext geraten.
- Funktionelle Optimalbereiche statt Durchschnittsnorm. Referenzwerte stammen konsequent aus funktionellen Quellen wie OptimalDX, NORIP und der bei Peter Attia diskutierten Longevity-Literatur — nicht aus der klassischen Krankheitsnorm.
- Ein begrenzter Agent statt eines Allzweck-Chatbots. Der Analyse-Agent beantwortet ausschließlich Fragen zur vorliegenden Blutanalyse. Allgemeine Ernährungs- oder Trainingsfragen ohne Bezug zu den Werten lehnt er bewusst ab — das ist kein Bug, sondern Absicht.
Das heißt nicht, dass ein Chatbot nutzlos wäre. Für eine erste Erklärung, was ein Marker überhaupt bedeutet, ist er ein brauchbarer Einstieg. Für eine strukturierte, im Kontext stehende Auswertung der eigenen Werte bräuchte es ein System, das genau dafür gebaut wurde. Und falls ein einzelner Wert auffällig wirkt, gilt ohnehin: als möglicher Hebel verstehen, konkrete Schritte ärztlich abstimmen.
Fazit
Ein Allzweck-Chatbot kann erklären, was ein Biomarker ist — er kann ihn nicht zuverlässig aus einem PDF extrahieren, funktionell einordnen und im Zusammenhang mit anderen Werten bewerten. Genau diese drei Dinge machen eine echte KI-Analyse eines Laborbefunds aus. Wer wissen möchte, wo die eigenen Laborwerte auf dem Spektrum von Sickness bis Fitness stehen, sollte ein System nutzen, das für genau diese Aufgabe gebaut wurde. Jetzt starten und die eigene Blutanalyse strukturiert und funktionell auswerten lassen.
Dieser Beitrag ist rein edukativ und ersetzt keine ärztliche Diagnose.