September 30, 2026
Host
Herzlich willkommen zu einer neuen Folge. Heute geht es um eine aktuelle Studie, die künstliche Intelligenz nutzt, um das Langzeitüberleben nach einem kathetergestützten Aortenklappenersatz besser vorherzusagen. Die Untersuchung stammt aus zwei Zentren in der Schweiz und in Japan und wurde in einer renommierten Fachzeitschrift veröffentlicht. Ich freue mich, dass wir die wichtigsten Ergebnisse gemeinsam einordnen können. Dabei schauen wir nicht nur auf die Zahlen, sondern auch darauf, was das für den klinischen Alltag bedeuten könnte. Also bleiben Sie dran, wenn Sie verstehen möchten, wie multimodale KI die Kardiologie verändern kann.
Guest
Vielen Dank für die Einladung. Das Thema ist relevant, weil die TAVI inzwischen nicht nur bei Hochrisikopatienten eingesetzt wird, sondern zunehmend auch bei älteren Menschen mit mehreren Begleiterkrankungen. Die klassischen chirurgischen Risikoscores wie STS-PROM oder EuroSCORE wurden ursprünglich für die operative Klappenchirurgie entwickelt und konzentrieren sich stark auf das kurzfristige Sterberisiko rund um den Eingriff. Für die langfristige Betreuung nach dem Eingriff braucht es eine andere Perspektive, und genau hier setzt die neue multimodale KI-Studie an. Das ist ein wichtiger Unterschied, den man behalten muss.
Host
Das leuchtet ein. Bevor wir tiefer einsteigen, würde mich interessieren, wie die Studie konkret aufgebaut war. Welche Patientengruppen wurden eingeschlossen, aus welchen Zentren stammen die Daten, und welche Informationen sind in die Modelle eingeflossen? Gerade bei KI-Studien ist es ja entscheidend, ob die Daten aus dem klinischen Alltag stammen und ob die Ergebnisse auch auf andere Populationen übertragbar sind. Das wäre ein guter Ausgangspunkt, um die Aussagekraft der Ergebnisse einzuschätzen. Vielleicht können Sie uns auch sagen, welche Endpunkte genau untersucht wurden. Das hilft, die klinische Relevanz besser zu verstehen.
Guest
Die Studie war multizentrisch angelegt und umfasste insgesamt 3991 Patientinnen und Patienten, die wegen einer symptomatischen schweren Aortenstenose eine TAVI erhalten hatten. Die Entwicklungs- und Validierungskohorte stammte aus dem Berner TAVI-Register mit 2985 Personen, und die externe Testkohorte kam aus einem japanischen Zentrum mit 1006 Personen. Wichtig ist, dass die japanische Kohorte ein anderes Profil hatte: Sie war älter, hatte einen niedrigeren Body-Mass-Index und einen höheren Anteil an Frauen. Diese Unterschiede machen die externe Validierung aussagekräftig. Das ist zentral, weil viele KI-Modelle an solchen Verschiebungen scheitern.
Host
Das klingt nach einem robusten Design. Welche Datenquellen wurden denn konkret kombiniert? Ich habe gelesen, dass es sich um multimodale Daten handelt – also nicht nur Laborwerte, sondern auch Bildgebung und EKG. Können Sie das etwas aufschlüsseln? Mich interessiert, ob diese Vielfalt tatsächlich einen Vorteil bringt oder ob es vor allem die klinischen Standardwerte sind, die zählen. Und wie geht man mit fehlenden Werten um, wenn so viele Modalitäten zusammenkommen? Das ist ja in der Praxis oft eine grosse Herausforderung. Vielleicht können Sie dazu etwas sagen. Das wäre hilfreich für das Verständnis.
Guest
Gern. Die Forschenden haben sieben Modalitäten einbezogen: klinische Angaben, Medikamente, Laborwerte, EKG-Parameter, echokardiografische und invasive Messungen, CT-Messungen sowie prozedurale Merkmale. Insgesamt wurden daraus über hundert Variablen extrahiert, aber nach einer strengen Vorverarbeitung blieben je nach Modell zwischen dreizehn und dreissig Merkmale übrig. Fehlende Werte wurden mit einem waldbasierten Imputationsverfahren ergänzt, und stark korrelierte Variablen wurden entfernt, um Redundanz zu vermeiden. Wichtig ist, dass alle Schritte nur an den Trainingsdaten aus Bern durchgeführt wurden, damit keine Information aus dem externen Testset in die Modelle gelangen konnte. Das verhindert eine Überschätzung der Leistung.
Host
Das ist methodisch sauber. Jetzt zur Modellierung: Es wurden ja vier verschiedene Überlebensmodelle trainiert, wenn ich es richtig verstanden habe. Warum gleich vier, und worin unterscheiden sie sich? Und warum wurde am Ende das Random-Survival-Forest-Modell für die Anwendung ausgewählt, obwohl bei einigen Endpunkten andere Modelle minimal besser abschnitten? Das ist eine spannende Entscheidung, weil in der Praxis ja auch Einfachheit und Erklärbarkeit eine Rolle spielen. Können Sie die Logik dahinter erläutern? Und wie wurden die Hyperparameter ausgewählt, um eine Überanpassung zu vermeiden? Das wäre für die Nachvollziehbarkeit wichtig.
Guest
Genau, es wurden vier Algorithmen eingesetzt: CoxNet, ein regularisiertes Cox-Modell, Random Survival Forest, Gradient Boosting Survival und DeepSurv. Sie unterscheiden sich darin, wie sie lineare und nichtlineare Zusammenhänge abbilden und wie sie mit Wechselwirkungen umgehen. Die Hyperparameter wurden über eine fünffache Kreuzvalidierung optimiert, wobei der mittlere Harrell-C-Index maximiert wurde. Am Ende wurde das Random-Survival-Forest-Modell vor allem wegen seiner sehr guten Kalibrierung, der robusten Risikostratifizierung und der vergleichsweise geringen Anzahl benötigter Merkmale ausgewählt. Das erleichtert die klinische Anwendung erheblich, auch wenn CoxNet beim kardiovaskulären Tod im externen Testset einen minimal höheren C-Index erreichte.
Host
Jetzt muss ich kurz nachhaken: Sie vergleichen die KI-Modelle mit chirurgischen Scores wie STS-PROM und EuroSCORE. Diese Scores wurden aber nie für die Langzeitprognose nach TAVI entwickelt. Ist dieser Vergleich dann überhaupt fair? Oder dient er nur als eine Art Referenz, weil es bisher keine besseren TAVI-spezifischen Werkzeuge gibt? Das ist ein wichtiger Punkt, den man kritisch diskutieren sollte. Wie ordnen Sie das ein? Denn wenn die Referenz schwach ist, sagt ein Vorsprung vielleicht nicht so viel aus. Andererseits fehlt eine etablierte Alternative. Wie sehen Sie das Spannungsfeld?
Guest
Das ist ein berechtigter Einwand. Die Autoren selbst weisen darauf hin, dass STS-PROM und EuroSCORE ursprünglich für die operative Risikostratifizierung entwickelt wurden und daher andere Ziele verfolgen. Der Vergleich dient in erster Linie als Benchmark, weil es bislang kein offen zugängliches TAVI-spezifisches Prognosewerkzeug für Langzeitergebnisse gibt. Man sollte den Vorsprung also nicht überinterpretieren, aber er ist dennoch relevant: Selbst wenn die Referenz nicht perfekt ist, zeigt die Studie, dass multimodale KI in der Lage ist, über fünf Jahre hinweg bessere Diskrimination und Kalibrierung zu liefern. Das ist ein wichtiger Schritt, auch wenn prospektive Vergleiche mit künftigen TAVI-Scores nötig bleiben.
Host
Gut, dann lassen Sie uns über die konkreten Ergebnisse sprechen. Wie stark war der Vorteil der KI-Modelle gegenüber den konventionellen Scores, und welche Zahlen sind für die klinische Praxis am wichtigsten? Ich denke da an den C-Index und die zeitabhängige AUC, aber auch an die Kalibrierung. Welche Verbesserung ist realistisch zu erwarten? Gerade bei älteren Patientinnen und Patienten mit vielen Begleiterkrankungen ist die Vorhersage ja oft schwierig. Vielleicht können Sie die wichtigsten Kennzahlen einordnen. Und was bedeutet ein C-Index von 0,7 überhaupt für den Einzelfall? Das wäre hilfreich.
Guest
Die KI-Modelle übertrafen die konventionellen Scores durchgehend. Für die Gesamtmortalität erreichte das Random-Survival-Forest-Modell im externen Testset einen Harrell-C-Index von 0,712, während der beste konventionelle Score, der STS-PROM, bei 0,642 lag. Für den kardiovaskulären Tod erreichte CoxNet sogar 0,776, verglichen mit 0,664 für den STS-PROM. Über die Fünf-Jahres-Periode lag die zeitabhängige AUC der KI-Modelle im Durchschnitt etwa zehn bis fünfzehn Prozent höher. Wichtiger als einzelne Zahlen ist aber, dass die Modelle auch in der externen japanischen Kohorte gut kalibriert blieben und Patienten klar in niedrige, mittlere und hohe Risikogruppen trennen konnten.
Host
Das klingt vielversprechend. Aber was heisst das konkret für die Risikostratifizierung? Konnten die Modelle zum Beispiel Patientinnen und Patienten mit hohem Risiko identifizieren, die von den klassischen Scores übersehen wurden? Und wie sah die Trennschärfe zwischen den Gruppen aus? Ich könnte mir vorstellen, dass gerade die Kombination aus Laborwerten und Bildgebung hier einen Unterschied macht. Gibt es dafür anschauliche Beispiele? Und wie hoch waren die Hazard Ratios zwischen hoher und niedriger Risikogruppe? Das wäre für die klinische Einschätzung sehr aufschlussreich. Vielleicht können Sie ein konkretes Fallbeispiel nennen.
Guest
Ja, die Modelle teilten die Patienten in drei grosse Risikogruppen ein. Die Trennschärfe war deutlich: Die Hazard Ratio für hohes versus niedriges Risiko lag bei etwa 4,9 intern und 6,1 extern. Für den kardiovaskulären Tod waren die Werte ähnlich. Es gab Fallbeispiele: Ein 71-jähriger Patient wurde von konventionellen Scores als niedrigriskant eingestuft, vom KI-Modell aber als hochriskant; er verstarb nach 91 Tagen. Umgekehrt blieb eine 86-jährige Patientin, die chirurgisch als hochriskant galt, laut KI niedrigriskant und über 1400 Tage ereignisfrei.
Host
Das sind starke Beispiele. Jetzt würde mich die Erklärbarkeit interessieren. Viele KI-Modelle gelten ja als Blackbox. Wie haben die Forschenden Transparenz hergestellt, und welche Variablen waren für die Vorhersage am wichtigsten? Gerade in der Kardiologie ist es ja entscheidend, dass Ärztinnen und Ärzte nachvollziehen können, warum ein Modell ein hohes Risiko anzeigt. Welche Methode wurde verwendet? Und gab es Überraschungen bei den wichtigsten Prädiktoren? Ich denke, das ist ein zentraler Punkt für die Akzeptanz in der Klinik. Vielleicht können Sie die wichtigsten Merkmale nennen. Und wie verlässlich sind solche Erklärungen?
Guest
Die Autoren haben SurvSHAP verwendet, eine Erweiterung der Shapley-Werte für Überlebensanalysen. Damit lässt sich für jeden Patienten zeigen, welche Merkmale das Risiko erhöhen oder senken. Die wichtigsten Prädiktoren waren über beide Endpunkte hinweg relativ konsistent: Nierenfunktionswerte wie die geschätzte glomeruläre Filtrationsrate und Kreatinin, das Alter sowie Gebrechlichkeitsparameter wie Albumin und Hämoglobin. Auch der pulmonalarterielle Druck, Vorhofflimmern, COPD, die linksventrikuläre Ejektionsfraktion und der mittlere Aortenklappengradient spielten eine Rolle. Spannend ist, dass viele dieser Faktoren routinemässig erhoben werden und damit gut in den klinischen Alltag passen. Das erleichtert die Implementierung erheblich.
Host
Das klingt fast zu gut, um wahr zu sein. Wo liegen denn die Grenzen? Die Studie ist retrospektiv, und es fehlen Angaben zu Ethnizität oder Geschlecht jenseits des biologischen Geschlechts. Wie stark schränkt das die Übertragbarkeit ein? Und was ist mit jüngeren Patientinnen und Patienten, die nicht so stark vertreten waren? Ich frage das, weil die Kohorte überwiegend aus über Achtzigjährigen bestand. Welche Limitationen sehen Sie als die wichtigsten an? Und wie ehrlich sollte man gegenüber den Patientinnen und Patienten mit solchen Vorhersagen sein? Das ist ja auch eine ethische Frage.
Guest
Die Grenzen sind real. Die Studie war retrospektiv, daher können unbeobachtete Störfaktoren nicht ausgeschlossen werden. Angaben zu Ethnizität und selbstberichtetem Geschlecht fehlten, und die Population bestand überwiegend aus über Achtzigjährigen. Das schränkt die Übertragbarkeit ein. Fortgeschrittene Bildgebungsmerkmale wie Strain oder Radiomics fehlten ebenfalls. Auch die fehlende Kausalität ist sehr zentral. Wichtig ist, dass die Erklärungen Assoziationen zeigen, aber keine Kausalität belegen. Das Modell sollte also nicht als deterministische Vorhersage verstanden werden, sondern als Entscheidungshilfe, die im Gespräch eingeordnet werden muss.
Host
Das ist eine wichtige Einordnung. Trotzdem: Die externe Validierung in Japan mit einem ganz anderen Patientenprofil ist beeindruckend. Wie erklären Sie sich diese Robustheit trotz der erheblichen Unterschiede zwischen den Kohorten? Normalerweise leiden KI-Modelle ja unter solchen Verschiebungen, dem sogenannten Domain Shift. Was hat die Studie anders gemacht? Lag es an der strengen Vorverarbeitung, an der Auswahl robuster Merkmale oder an der Ensemble-Strategie? Oder ist das Feld der TAVI-Prognose einfach stabiler als gedacht? Mich würde Ihre Einschätzung dazu interessieren. Denn das ist ja ein zentraler Befund der Arbeit.
Guest
Die Robustheit ist tatsächlich bemerkenswert. Ein wichtiger Grund dürfte sein, dass die Modelle auf strukturierten, routinemässig erhobenen Variablen basieren, die in beiden Zentren nach ähnlichen Standards dokumentiert wurden. Zudem wurde die gesamte Vorverarbeitung ausschliesslich an den Berner Daten durchgeführt und dann unverändert auf das japanische Testset angewendet. Das verhindert Datenleckagen und erzwingt eine echte Generalisierung. Die Ensemble-Strategie über die fünf Faltungen hinweg dürfte ebenfalls zur Stabilität beigetragen haben. Und schliesslich sind die wichtigsten Prädiktoren wie Nierenfunktion, Albumin und Alter klinisch universell relevant, auch wenn sich die Verteilungen zwischen Europa und Japan unterscheiden.
Host
Jetzt zur Praxis: Die Autoren haben ja nicht nur ein Paper veröffentlicht, sondern auch den Code und ein Webtool bereitgestellt. Wie genau funktioniert dieses Tool, und welche Hürden sehen Sie bei der Einführung in den klinischen Alltag? Das ist ja oft der schwierigste Schritt bei KI-Anwendungen in der Medizin. Welche Daten muss man eingeben, und wie schnell erhält man eine Risikoeinschätzung? Und ist das Tool so gestaltet, dass es auch in einem hektischen Klinikalltag nutzbar ist? Oder braucht es noch Anpassungen an lokale Gegebenheiten? Das wäre für die Umsetzung entscheidend.
Guest
Das Webtool ist öffentlich zugänglich und erlaubt es, Patientendaten einzugeben und eine interpretierbare Langzeitrisikovorhersage zu erhalten. Es basiert auf dem Random-Survival-Forest-Modell und zeigt die wichtigsten Einflussfaktoren an. Code und trainierte Modelle sind auf GitHub verfügbar, was Reproduzierbarkeit erleichtert. Für die klinische Einführung braucht es mehr als Technik: Die Software muss in die elektronische Patientenakte integriert werden, Datenschutzfragen müssen geklärt sein, und das Personal muss geschult werden. Zudem wären prospektive Studien nötig, um den tatsächlichen besseren Nutzen und Outcomes zu belegen.
Host
Das wirft die Frage auf, wie es weitergehen könnte. Welche nächsten Schritte wären aus Ihrer Sicht am wichtigsten, um solche Modelle wirklich in der Routine zu etablieren? Und welche Endpunkte sollten künftige Studien zusätzlich betrachten? Ich denke da an Blutungen, Nierenversagen, Schlaganfälle oder Schrittmacherimplantationen. Wäre es sinnvoll, all diese Ereignisse in ein gemeinsames Entscheidungswerkzeug zu integrieren? Oder ist das zu ambitioniert? Und wie steht es um die Einbindung von Rohbilddaten durch Deep Learning? Das könnte die manuelle Merkmalsextraktion vielleicht überflüssig machen. Sehen Sie darin die Zukunft? Oder bleibt der strukturierte Ansatz praktikabler?
Guest
Ja, die nächsten Schritte sind klar: prospektive Validierung in mehreren Zentren, breitere Diversität und zusätzliche Endpunkte wie Blutungen, Nierenschäden, Schlaganfälle und Schrittmacherimplantationen. Langfristig wäre ein einheitliches Entscheidungswerkzeug wünschenswert, das mehrere Risiken abbildet. Deep Learning auf Rohbilddaten könnte zusätzliche Informationen liefern, bleibt aber wegen Standardisierung und Rechenaufwand schwierig. Der strukturierte Ansatz dieser Studie ist leichter in bestehende Arbeitsabläufe integrierbar. Die unmittelbare Zukunft liegt in hybriden Modellen, die strukturierte Daten mit gezielten Bildgebungsmerkmalen kombinieren. Das ist ein realistischer Ausblick. Meiner Ansicht nach.
Host
Das ist ein Schlusswort, aber eine Frage hätte ich noch: Wie sollten Ärztinnen und Ärzte mit den Ergebnissen umgehen, bis solche Tools breit verfügbar sind? Sollten sie die klassischen Scores weiterhin verwenden oder schon jetzt auf KI-gestützte Einschätzungen setzen? Das ist eine praktische Frage für den Alltag. Welche Empfehlung würden Sie geben? Sollte man die KI-Ergebnisse eher als Zusatzinformation betrachten? Oder können sie die chirurgischen Scores in Situationen ersetzen? Und wie vermeidet man, dass Patientinnen und Patienten durch eine Zahl verunsichert werden? Das ist auch eine kommunikative Herausforderung.
Guest
Bis zur breiten Einführung sollten die KI-Modelle als ergänzende Information genutzt werden, nicht als Ersatz für klinisches Urteilsvermögen. Die klassischen Scores haben weiterhin ihren Platz, vor allem für die unmittelbare prozedurale Risikoeinschätzung. Die neuen Modelle können aber helfen, das langfristige Risiko besser zu erfassen und die Nachsorge zu planen. Wichtig ist, die Vorhersage immer im Gespräch mit den Betroffenen zu kontextualisieren: Eine hohe Risikowahrscheinlichkeit ist kein Todesurteil, sondern ein Anlass, über engmaschigere Kontrollen, medikamentöse Optimierung oder Lebensstilinterventionen zu sprechen. So kann aus einer abstrakten Zahl eine konkrete, patientenzentrierte Entscheidung werden.
Host
Das ist eine ausgewogene Haltung. Wenn Sie die Studie in einem Satz zusammenfassen müssten: Was ist die zentrale Botschaft für die Kardiologie? Und was sollten Forschende oder Klinikerinnen und Kliniker aus dieser Arbeit mitnehmen? Ich denke, das hilft, die vielen Details auf den Punkt zu bringen. Vielleicht auch mit Blick auf die Grenzen. Denn eine ehrliche Zusammenfassung sollte ja nicht nur die Stärken betonen. Was ist also der Kern? Und was bleibt noch zu tun? Das würde ich gern von Ihnen hören. Dann haben wir eine schöne Überleitung zum Abschluss.
Guest
Die zentrale Botschaft ist, dass multimodale, erklärbare KI-Modelle die Langzeitprognose nach TAVI deutlich besser abschätzen können als chirurgische Risikoscores, und das über verschiedene Populationen hinweg. Für die Klinik heisst das: Wir können präziser erkennen, wer nach dem Eingriff engmaschigere Betreuung oder intensivierte Therapie benötigt. Für die Forschung gilt: Transparenz, externe Validierung und offene Bereitstellung von Code und Werkzeugen sollten Standard werden. Es bleibt viel zu tun, etwa prospektive Studien und breitere Populationen. Aber die Richtung stimmt, und das ist ermutigend.
Host
Vielen Dank für diese klare Einordnung. Ich glaube, wir haben die wichtigsten Punkte gut abgedeckt: von der Studienarchitektur über die Ergebnisse bis zu den praktischen Implikationen. Gibt es noch einen Aspekt, den wir bisher übersehen haben und den Sie unseren Zuhörerinnen und Zuhörern mitgeben möchten? Vielleicht etwas, das in der öffentlichen Diskussion oft zu kurz kommt? Ich denke da an die Frage, wie man Vertrauen in solche Systeme aufbaut. Oder an die Zusammenarbeit zwischen Kardiologie und Datenwissenschaft. Was möchten Sie den Zuhörenden noch mitgeben? Dann leiten wir zum Abschluss über.
Guest
Ein Punkt, der oft zu kurz kommt, ist die Notwendigkeit interdisziplinärer Zusammenarbeit. Diese Studie zeigt, was möglich ist, wenn Kardiologinnen und Kardiologen eng mit Datenwissenschaftlerinnen und Datenwissenschaftlern zusammenarbeiten. Vertrauen entsteht nicht durch perfekte Algorithmen allein, sondern durch Transparenz, offene Validierung und eine ehrliche Kommunikation der Grenzen. Ich würde mir wünschen, dass künftige Arbeiten noch stärker die Patientensicht einbeziehen und untersuchen, wie Risikoinformationen verständlich vermittelt werden können. Denn letztlich geht es nicht um die Technik, sondern um bessere Entscheidungen für die Menschen, die mit einer schweren Aortenstenose leben.
Host
Damit sind wir am Ende unserer Folge angelangt. Wir haben gesehen, dass multimodale KI die Langzeitprognose nach TAVI messbar verbessern kann, dass aber noch wichtige Schritte nötig sind, bevor solche Werkzeuge flächendeckend im Alltag ankommen. Ich danke Ihnen für das aufschlussreiche Gespräch und Ihnen zu Hause fürs Zuhören. Bleiben Sie neugierig, bleiben Sie kritisch, und bis zum nächsten Mal.