Modele lingvistice mari (LLM) în cardiologie: revizuire sistematică a 33 de studii — diagnostic ECG, insuficiență cardiacă și educație medicală, JMIR Cardio 2026

Revizuire sistematică Nivel 5 — Caz-control
©

Autor: Airinei Camelia 262 vizite

Titlu originalLarge Language Models in Cardiology: A Systematic Review.
JurnalJMIR Cardiology
AutoriGendler M, Nadkarni GN, Sudri K, Cohen-Shelly M, Glicksberg BS, Efros O, Soffer S, Klang E
Data publicării16 aprilie 2026
ȚaraCanada
PMID41989882
DOIhttps://doi.org/10.2196/76734
SpecialitateCardiologie

Prezentare

Revizuirea sistematică publicată în JMIR Cardio evaluează aplicațiile, performanțele și limitările modelelor de limbaj mare (LLM — Large Language Models, incluzând ChatGPT-3.5 și ChatGPT-4) în cardiologie, analizând 33 de studii. ChatGPT-3.5 a răspuns corect la 91% din întrebările despre insuficiența cardiacă, dar cu un nivel de lectură superior accesibilității pacienților. ChatGPT-4 a demonstrat performanță superioară în educația medicală (66% vs 38% pentru pacienți) și a interpretat corect 91% din traseele EKG în studiile evaluate. Limitări semnificative persistă în ghidajul de urgență cardiologică și în ușurința de lectură, iar validarea prospectivă și modelele multimodale sunt necesare înainte de adoptarea clinică largă.

LLM în medicină — de la ChatGPT la aplicații cardiologice specializate

Modelele de limbaj mare (Large Language Models — LLM) reprezintă cea mai recentă și mai spectaculoasă generație de sisteme de inteligență artificială (IA) bazate pe arhitecturi transformer, cu potențial transformațional în medicină și în cardiologie în particular:

  • Evoluția LLM-urilor și arhitectura transformer: LLM-urile sunt rețele neuronale de mari dimensiuni (sute de miliarde de parametri) pre-antrenate pe corpusuri masive de text (internet, cărți, articole medicale, cod de programare) prin modelare auto-regresivă sau masked language modeling; GPT (Generative Pre-trained Transformer): familia principală — GPT-3 (175 miliarde parametri, 2020), GPT-3.5 (ChatGPT, lansat noiembrie 2022), GPT-4 (multimodal, 2023); alte LLM relevante în medicină: Claude (Anthropic), Gemini (Google DeepMind), LLaMA (Meta), Meditron (Medical LLM open-source), BioMedLM, Med-PaLM 2; RLHF (Reinforcement Learning from Human Feedback): tehnica prin care ChatGPT a fost aliniat la preferințele umane → răspunsuri mai clare, mai utile, mai sigure.
  • Aplicațiile potențiale ale LLM în cardiologie: educație medicală și a pacienților: explicarea bolilor cardiovasculare, a medicamentelor și procedurilor în limbaj accesibil → reducerea decalajului de cunoaștere între medic și pacient; asistența în diagnosticul diferențial: analiza istoricului medical, a simptomelor și a rezultatelor investigațiilor → liste de diagnostic diferențial; interpretarea investigațiilor: EKG, ecocardiografie, angiografie coronariană (necesită modele multimodale); suport decizional clinic: recomandarea terapeutică bazată pe ghiduri (ACC/AHA, ESC), verificarea contraindicațiilor medicamentoase, calculatoare de risc cardiovascular (SCORE2, Framingham, STS score); documentarea medicală: generarea automată a scrisorilor de externare, a rapoartelor de consultație, a epicrizelor; cercetare: analiza rapidă a literaturii medicale, sinteza sistematică, generarea de ipoteze de cercetare.
  • Riscurile și limitele LLM în context clinic: halucinațiile (hallucinations): LLM-urile pot genera informații plauzibile dar incorecte cu mare încredere — risc major în context clinic unde acuratețea este vitală; informații perimate (outdated information): GPT-3.5 are un prag de cunoaștere (knowledge cutoff) din septembrie 2021, GPT-4 din aprilie 2023 — ghidurile cardiologice actualizate frecvent nu sunt incluse; lipsa gândirii cauzale: LLM-urile identifică tipare statistice, nu înțeleg cauzalitatea mecanistică → limitare în raționamentul medical complex; absența conștiinței: LLM-urile nu știu ce nu știu → nu recunosc limitele cunoașterii lor (spre deosebire de un clinician experimentat); reglementarea: LLM-urile nu sunt dispozitive medicale aprobate FDA/CE → nu pot fi folosite ca diagnostic definitiv; confidențialitate (GDPR, HIPAA): datele pacienților nu pot fi introduse în LLM-uri publice fără garanții de confidențialitate adecvate.

Performanțele ChatGPT în cardiologie — rezultatele revizuirii sistematice din 33 de studii

Gendler, Nadkarni, Sudri, Cohen-Shelly, Glicksberg, Efros, Soffer și Klang (JMIR Cardio, epub 2026-04-16) sintetizează performanțele LLM în aplicații cardiologice specifice:

  • Cunoașterea cardiologică generală și insuficiența cardiacă: evaluarea cunoașterii cardiologice prin întrebări standardizate (multiple-choice, întrebări deschise): ChatGPT-3.5: 91% răspunsuri corecte la întrebările despre insuficiența cardiacă — performanță comparabilă cu un rezident cardiolog; limitarea majoră: nivelul de lectură al răspunsurilor este semnificativ superior accesibilității pacienților (gradul de lectură adesea la nivel de universitate vs. recomandat grade 6-8 pentru materiale de sănătate publică) → informațiile sunt corecte, dar inaccesibile pacienților cu educație medie.
  • Educația medicilor vs. educația pacienților: compararea utilității ChatGPT-4 pentru medici vs. pacienți: medici: 66% acuratețe în răspunsurile la întrebări clinice complexe → util ca instrument de referință rapidă sau de sinteză; pacienți: 38% acuratețe în răspunsurile adaptate nivelului pacienților — performanță semnificativ mai mică; explicația: ChatGPT este mai bun în limbajul medical specializat decât în simplificarea informațiilor medicale pentru publicul larg; implicație: LLM-urile pot fi mai utile ca instrumente pentru medici (suport decizional rapid) decât pentru autoconsultul direct al pacienților.
  • Interpretarea EKG — o aplicație cu potențial deosebit: interpretarea EKG cu ChatGPT-4 (în studiile care au inclus imagini EKG — GPT-4 are capacitate multimodală): 91% acuratețe în interpretarea traseelor EKG standard (ritm sinusal, fibrilație atrială, bloc AV, STEMI, NSTEMI, WPW); limitele interpretării EKG de LLM: performanță mai slabă la EKG-uri cu anomalii subtile sau rare (flutter atrial cu conducere variabilă, sindrom Brugada incipient, WPW seronegativ); LLM-ul nu poate evalua starea clinică a pacientului → contextul clinic este esențial pentru interpretare; competiția cu algoritmi ECG dedicați: sisteme ECG digitale (Apple Watch ECG, algoritmi SCP-ECG, AliveCor KardiaMobile) cu sensibilitate/specificitate validate clinic → LLM mai puțin precis decât algoritmii specializați pentru diagnoza automată.
  • Ghidajul de urgență cardiologică — domeniu critic cu performanțe slabe: scenarii de urgență cardiologică (sindrom coronarian acut, stop cardiac, aritmii amenințătoare de viață): performanță semnificativ mai slabă → risc de recomandări incorecte sau incomplete; LLM-urile nu oferă răspunsuri în timp real adaptate stării pacientului; halucinațiile sunt mai frecvente în scenariile de urgență cu date clinice incomplete; recomandările ghidurilor (ACLS, ESC) sunt urmate inconsistent → nu pot fi utilizate ca suport de decizie în urgență fără validare specifică.
  • Acuratețea, ușurința de lectură și pregătirea clinică: disparitate acuratețe-lectură: LLM-uri cu acuratețe crescută (91% ChatGPT-3.5) au nivel de lectură ridicat → inaccesibil pacienților; pregătirea clinică (readiness): niciun LLM evaluat nu este pregătit pentru utilizare autonomă clinică → suport, nu substituție pentru clinician.

Direcțiile viitoare — modele multimodale, validare prospectivă și integrarea în practica cardiologică

Gendler et al. identifică condițiile pentru adoptarea LLM în cardiologia clinică:

  • Modele multimodale pentru cardiologie — integrarea imaginilor și datelor clinice: GPT-4V, Gemini Ultra, Claude 3: modele cu capacitate de a procesa și text și imagini → potențial pentru interpretarea simultană a EKG, ecocardiografie, angiografie și date clinice; LLM specializate în cardiologie: fine-tuning-ul pe date cardiologice specifice (rapoarte de cateterism, date din registrele ACC, publicații ESC) → performanțe superioare față de LLM generaliste; CardioGPT, ECG-FM, HeartGPT — modele specializate în curs de evaluare, cu date preliminare promițătoare.
  • Validarea prospectivă și integrarea în fluxul de lucru clinic: studii de impact clinic real: nu doar acuratețe pe benchmark-uri retrospective, ci dacă utilizarea LLM de către clinicieni reduce erorile diagnostice, îmbunătățește aderența la ghiduri, reduce timpul de luare a deciziilor; design-ul studiilor: studii clinice randomizate comparând clinicieni cu LLM-suport vs. clinicieni fără LLM → obiective secundare de siguranță și calitate; integrarea în sistemele informatice clinice (EHR — Electronic Health Records): accesul LLM la date clinice reale (anonimizate) din EHR → rezumate clinice automate, alertare la medicamentele contraindicate, recomandări ghid context-specifice; conformitatea cu GDPR (Europa) și HIPAA (SUA): utilizarea datelor pacienților de LLM necesită soluții de anonimizare robuste sau LLM-uri locale (on-premise) în spitale.
  • Limitele adoptării și reglementarea LLM în cardiologie: FDA: LLM-urile pentru diagnostic sau recomandări clinice sunt Software as Medical Device (SaMD) → necesită clearance 510(k) sau PMA; EMA/MDR: clasarea ca dispozitiv medical clasa II sau III în Europa; responsabilitate medicală (liability): dacă LLM recomandă greșit și pacientul este afectat, cine răspunde — medicul sau producătorul? → barieră majoră pentru adoptare; lipsa transparenței (black-box): LLM-urile nu explică rațiunea din spatele răspunsurilor → imposibilitate de audit → rezistența clinicienilor; necesitatea educației medicale specifice despre utilizarea LLM: curriculum actualizat în facultățile de medicină pentru utilizarea responsabilă a IA.

Detalii studiu

Intervenție
Revizuire sistematică (33 studii): aplicații LLM (ChatGPT-3.5, ChatGPT-4) în cardiologie; ChatGPT-3.5: 91% răspunsuri corecte insuficiență cardiacă; ChatGPT-4: 66% medici vs 38% pacienți (educație medicală); ChatGPT-4: 91% acuratețe interpretare EKG; limitări: urgență cardiologică, nivel lectură ri
Populație
33 studii evaluate prin revizuire sistematică: aplicații ChatGPT-3.5/4 și alte LLM în insuficiență cardiacă, EKG, educație medicală, urgență cardiologică; comparație acuratețe vs nivel lectură; bench
Endpoint primar
Acuratețe LLM la întrebări cardiologice (ChatGPT-3.5: 91% IC, ChatGPT-4: 66% medici vs 38% pacienți); acuratețe interpretare EKG ChatGPT-4 (91%); performanță în urgență cardiologică; nivel de lectură al răspunsurilor vs accesibilitate pacienți; limitări identificate; pregătirea clinică a LLM curent
Efect principal
ChatGPT-3.5: 91% acuratețe întrebări insuficiență cardiacă (nivel lectură >grade 12, inaccesibil); ChatGPT-4: 66% vs 38% educație medici/pacienți (diferență semnificativă); EKG: 91% acuratețe (GPT-4 multimodal); urgență cardiologică: performanță slabă; halucinații frecvente la date incomplete; fără

Concluzii

Revizuirea sistematică a 33 studii evidențiază că LLM (ChatGPT-3.5/4) au acuratețe ridicată în cunoașterea cardiologică (91% IC) și interpretarea EKG (91%) dar nivel de lectură inaccesibil pacienților, performanță slabă în urgențe cardiologice și fără validare prospectivă; modele multimodale specializate (fine-tuning cardiologie), validare clinică prospectivă și reglementare FDA/CE sunt necesare înainte de adoptarea LLM în practica cardiologică.

Limitări

Knowledge cutoff LLM (GPT-3.5: sep 2021, GPT-4: apr 2023) - ghiduri recente lipsă; halucinații frecvente la date incomplete; nivel lectură ridicat vs accesibilitate pacienți; fără date prospective impact clinic real; LLM nu sunt aprobate FDA/CE ca dispozitive medicale; responsabilitate medicală neclară; 33 studii - eterogenitate metodologică.

Recomandări clinice

LLM utile ca suport rapid pentru medici (nu substituție); nu recomandați pentru urgențe cardiologice sau autoconsult al pacienților; GPT-4/Claude/Gemini multimodal pentru interpretare EKG-suport (nu definitiv); validare prospectivă obligatorie înainte de adoptare; conformitate GDPR/HIPAA pentru date pacient; clearance FDA/MDR ca SaMD obligatoriu; modele specializate cardiologie (fine-tuning) - perspectivă promițătoare.

Referințe

LLMs in cardiology systematic review. JMIR Cardiology. 2026 Apr 16. https://pubmed.ncbi.nlm.nih.gov/41989882/
Programari cabinete medicale, clinici Alege-ți medicul și fă o programare!
Peste 13000 de cabinete medicale își prezintă serviciile pe ROmedic.