
Basato sulla piattaforma di AI medica Dr7.ai
Med-Flamingo è un modello multimodale few-shot per la medicina sviluppato da ricercatori di Stanford. Basato su OpenFlamingo-9B e pre-addestrato su dati immagine-testo interlacciati tratti da manuali di medicina e da PubMed Central, può rispondere a domande su una nuova immagine medica dopo aver visto solo pochi esempi.
Carica un'immagine medica e fai una domanda su di essa: la demo mostra il ragionamento interlacciato su immagini e testo che Med-Flamingo ha introdotto in medicina.
Prova l'AI medica avanzata
Ottieni question answering illimitato sulle immagini, limiti di caricamento più alti e accesso API per la ricerca medica multimodale.
Med-Flamingo è un modello medico visione-linguaggio rilasciato nel 2023 da Michael Moor e colleghi di Stanford insieme ad altri collaboratori (Moor et al., "Med-Flamingo: a Multimodal Medical Few-shot Learner"). Adatta al dominio medico OpenFlamingo-9B, una reimplementazione aperta di Flamingo di DeepMind.
Il modello è stato sottoposto a pre-addestramento continuato su sequenze immagine-testo interlacciate provenienti da manuali di medicina (il dataset MTB) e su coppie figura-didascalia di PMC-OA. Poiché elabora immagini e testo interlacciati in un unico contesto, supporta l'apprendimento in-context ("few-shot"): mostrandogli alcuni esempi immagine-domanda-risposta, generalizza a una nuova immagine senza fine-tuning.
Su VQA-RAD, PathVQA e un nuovo benchmark Visual USMLE, i clinici hanno valutato le risposte generative di Med-Flamingo meglio di quelle dei modelli di riferimento, ma gli autori precisano che si tratta di un primo prototipo di ricerca che può produrre allucinazioni e non è idoneo all'uso clinico.
Rilasciato a luglio 2023 da ricercatori di Stanford e collaboratori (Moor et al., 2023)
Pesi aperti su GitHub / Hugging Face per la ricerca; basato su OpenFlamingo-9B
Apprendimento in-context per immagini mediche
Visual question answering medico few-shot
Input interlacciati immagine + testo in un unico prompt
Risposte generative (testo libero), non solo a scelta multipla
Pre-addestrato su manuali di medicina e figure di PubMed Central
Basato su OpenFlamingo-9B (backbone linguistico LLaMA-7B)
Valutato su VQA-RAD, PathVQA e Visual USMLE
Protocollo di valutazione basato sul giudizio dei clinici
Pesi aperti per la ricerca
Valutazione descritta nell'articolo su Med-Flamingo; i clinici hanno assegnato punteggi alle risposte generative anziché usare un'unica misura di accuratezza
Visual question answering in radiologia con esempi in-context
Question answering su immagini di anatomia patologica
Domande in stile USMLE che richiedono l'analisi di un'immagine, introdotte con l'articolo
In media, gli esperti umani hanno preferito le risposte di Med-Flamingo a quelle dei modelli di riferimento confrontati
Studia l'apprendimento in-context sulle immagini mediche con un modello aperto.
Risponde a domande a testo libero su un'immagine medica, per la revisione da parte del clinico.
Esercitazioni in stile USMLE basate su immagini, con spiegazioni.
Codice di ricerca e pesi forniti dagli autori
Codice e pesi sono pubblicati nel repository GitHub degli autori e su Hugging Face; servono anche i pesi di base di OpenFlamingo e LLaMA-7B.
Componi un prompt con alcuni esempi immagine-domanda-risposta, seguiti dalla nuova immagine e dalla domanda.
Pianifica privacy, validazione e supervisione umana prima di avvicinare Med-Flamingo ai dati dei pazienti.
Med-Flamingo è un modello di ricerca. I suoi output devono essere esaminati da professionisti sanitari qualificati prima di qualsiasi uso clinico.
Il modello non è un dispositivo medico autorizzato o approvato. Garantisci la conformità alle normative sanitarie locali e alle regole sulla protezione dei dati (ad es. HIPAA, GDPR) prima del deployment.
Cosa cambia con l'apprendimento few-shot
VQA medico few-shot di Stanford
Ricerca sull'apprendimento in-context e sul VQA medico generativo
Come si posiziona
Scegli in base alla modalità (testo o immagini), alla licenza e all'hardware di cui disponi davvero
Domande comuni su Med-Flamingo
Michael Moor e colleghi della Stanford University con altri collaboratori (2023). Non è un modello di Google.
Inserisci nel prompt alcuni esempi di triplette immagine-domanda-risposta; il modello risponde poi su una nuova immagine senza alcun fine-tuning.
Su OpenFlamingo-9B, una reimplementazione aperta dell'architettura Flamingo di DeepMind con backbone linguistico LLaMA-7B.
No. Gli autori lo descrivono come un primo prototipo di ricerca che può produrre allucinazioni; non deve essere usato per l'assistenza ai pazienti.
La demo usa l'assistente medico multimodale di Dr7.ai per mostrare il question answering sulle immagini. Per usare il modello originale, esegui il codice degli autori.