Piano Pro: 30% di scontoApprofitta
Medical AI Background

Med-Flamingo

Visual question answering medico few-shot

Basato sulla piattaforma di AI medica Dr7.ai

Med-Flamingo è un modello multimodale few-shot per la medicina sviluppato da ricercatori di Stanford. Basato su OpenFlamingo-9B e pre-addestrato su dati immagine-testo interlacciati tratti da manuali di medicina e da PubMed Central, può rispondere a domande su una nuova immagine medica dopo aver visto solo pochi esempi.

✨
VQA
Modello di AI medica
Few-Shot
Learning
Stanford University
Few-shot multimodale

Prova il visual question answering in stile Med-Flamingo

Carica un'immagine medica e fai una domanda su di essa: la demo mostra il ragionamento interlacciato su immagini e testo che Med-Flamingo ha introdotto in medicina.

Med-Flamingo Demo

Prova l'AI medica avanzata

0/3 messages

Avvia una consulenza medica

Poni domande mediche complesse o chiedi supporto nel ragionamento clinico

Sblocca tutto il potenziale di Med-Flamingo

Ottieni question answering illimitato sulle immagini, limiti di caricamento più alti e accesso API per la ricerca medica multimodale.

VQA
Visual Q&A
Few-shot
Few-shot Accuracy
10+
AI Models Available
Passa a Pro→

Che cos'è Med-Flamingo?

Med-Flamingo è un modello medico visione-linguaggio rilasciato nel 2023 da Michael Moor e colleghi di Stanford insieme ad altri collaboratori (Moor et al., "Med-Flamingo: a Multimodal Medical Few-shot Learner"). Adatta al dominio medico OpenFlamingo-9B, una reimplementazione aperta di Flamingo di DeepMind.

Il modello è stato sottoposto a pre-addestramento continuato su sequenze immagine-testo interlacciate provenienti da manuali di medicina (il dataset MTB) e su coppie figura-didascalia di PMC-OA. Poiché elabora immagini e testo interlacciati in un unico contesto, supporta l'apprendimento in-context ("few-shot"): mostrandogli alcuni esempi immagine-domanda-risposta, generalizza a una nuova immagine senza fine-tuning.

Su VQA-RAD, PathVQA e un nuovo benchmark Visual USMLE, i clinici hanno valutato le risposte generative di Med-Flamingo meglio di quelle dei modelli di riferimento, ma gli autori precisano che si tratta di un primo prototipo di ricerca che può produrre allucinazioni e non è idoneo all'uso clinico.

🦩

Ultimi sviluppi

Rilasciato a luglio 2023 da ricercatori di Stanford e collaboratori (Moor et al., 2023)

Few-shot
Learning

Pesi aperti su GitHub / Hugging Face per la ricerca; basato su OpenFlamingo-9B

Caratteristiche principali

Apprendimento in-context per immagini mediche

Capacità principali

Visual question answering medico few-shot

Input interlacciati immagine + testo in un unico prompt

Risposte generative (testo libero), non solo a scelta multipla

Pre-addestrato su manuali di medicina e figure di PubMed Central

Basato su OpenFlamingo-9B (backbone linguistico LLaMA-7B)

Valutato su VQA-RAD, PathVQA e Visual USMLE

Protocollo di valutazione basato sul giudizio dei clinici

Pesi aperti per la ricerca

Benchmark di prestazione

Valutazione descritta nell'articolo su Med-Flamingo; i clinici hanno assegnato punteggi alle risposte generative anziché usare un'unica misura di accuratezza

VQA-RAD

Few-shot

Visual question answering in radiologia con esempi in-context

PathVQA

Few-shot

Question answering su immagini di anatomia patologica

Visual USMLE

Nuovo benchmark

Domande in stile USMLE che richiedono l'analisi di un'immagine, introdotte con l'articolo

Valutazione dei clinici

+ rispetto alle baseline

In media, gli esperti umani hanno preferito le risposte di Med-Flamingo a quelle dei modelli di riferimento confrontati

Casi d'uso

🔬

Ricerca multimodale

Studia l'apprendimento in-context sulle immagini mediche con un modello aperto.

🏥

Domande e risposte su immagini

Risponde a domande a testo libero su un'immagine medica, per la revisione da parte del clinico.

🎓

Formazione medica

Esercitazioni in stile USMLE basate su immagini, con spiegazioni.

Come usare Med-Flamingo

Codice di ricerca e pesi forniti dagli autori

1

Ottieni il modello

Codice e pesi sono pubblicati nel repository GitHub degli autori e su Hugging Face; servono anche i pesi di base di OpenFlamingo e LLaMA-7B.

2

Opzioni di integrazione

Componi un prompt con alcuni esempi immagine-domanda-risposta, seguiti dalla nuova immagine e dalla domanda.

  • • VQA few-shot su immagini radiologiche
  • • VQA few-shot su immagini di anatomia patologica
  • • Question answering visivo in stile USMLE
  • • Modello di riferimento per la ricerca medica multimodale
3

Considerazioni sul deployment

Pianifica privacy, validazione e supervisione umana prima di avvicinare Med-Flamingo ai dati dei pazienti.

  • • De-identifica i dati e rispetta HIPAA / GDPR
  • • Valida il modello sui dati della tua struttura prima dell'uso
  • • Coinvolgi un medico abilitato nella revisione di ogni output
  • • Documenta limitazioni e uso previsto per i revisori

Considerazioni importanti

Validazione clinica obbligatoria

Med-Flamingo è un modello di ricerca. I suoi output devono essere esaminati da professionisti sanitari qualificati prima di qualsiasi uso clinico.

Conformità normativa

Il modello non è un dispositivo medico autorizzato o approvato. Garantisci la conformità alle normative sanitarie locali e alle regole sulla protezione dei dati (ad es. HIPAA, GDPR) prima del deployment.

Med-Flamingo e altri modelli medici multimodali a confronto

Cosa cambia con l'apprendimento few-shot

🦩

Med-Flamingo

VQA medico few-shot di Stanford

  • ✓Si adatta a nuove attività sulle immagini a partire da pochi esempi
  • ✓Prompt con immagini e testo interlacciati
  • ✓Risposte generative a testo libero
  • ✓Pesi aperti per la ricerca
  • ✓Ha introdotto il benchmark Visual USMLE
  • ✓Valutazione basata sul giudizio dei clinici

Ricerca sull'apprendimento in-context e sul VQA medico generativo

🤖

Altri modelli di AI medica

Come si posiziona

  • ×Gli LLM generalisti (GPT-4, Gemini) sono più forti nel ragionamento aperto, ma sono chiusi e costosi
  • ×I modelli aperti più grandi (Meditron-70B, MedGemma-27B) richiedono molta più memoria GPU
  • ×I modelli solo testo non possono analizzare immagini
  • ×I classificatori solo immagini non sanno spiegare i propri risultati a parole
  • ×I prodotti commerciali sono validati ma non ispezionabili
  • ×La maggior parte delle alternative pubblica meno benchmark riproducibili

Scegli in base alla modalità (testo o immagini), alla licenza e all'hardware di cui disponi davvero

Domande frequenti

Domande comuni su Med-Flamingo

Chi ha sviluppato Med-Flamingo?

Michael Moor e colleghi della Stanford University con altri collaboratori (2023). Non è un modello di Google.

Che cosa significa qui "few-shot"?

Inserisci nel prompt alcuni esempi di triplette immagine-domanda-risposta; il modello risponde poi su una nuova immagine senza alcun fine-tuning.

Su cosa si basa Med-Flamingo?

Su OpenFlamingo-9B, una reimplementazione aperta dell'architettura Flamingo di DeepMind con backbone linguistico LLaMA-7B.

Med-Flamingo è sicuro per l'uso clinico?

No. Gli autori lo descrivono come un primo prototipo di ricerca che può produrre allucinazioni; non deve essere usato per l'assistenza ai pazienti.

Questa demo esegue proprio Med-Flamingo?

La demo usa l'assistente medico multimodale di Dr7.ai per mostrare il question answering sulle immagini. Per usare il modello originale, esegui il codice degli autori.