Plan Pro : -30 %En profiter
Medical AI Background

Med-Flamingo

Réponse visuelle aux questions médicales en few-shot

Propulsé par la plateforme d'IA médicale Dr7.ai

Med-Flamingo est un modèle multimodal d'apprentissage few-shot pour la médecine, conçu par des chercheurs de Stanford. Construit sur OpenFlamingo-9B et pré-entraîné sur des données image-texte entrelacées issues de manuels médicaux et de PubMed Central, il peut répondre à des questions sur une nouvelle image médicale après avoir vu seulement quelques exemples.

✨
VQA
Modèle d'IA médicale
Few-Shot
Learning
Stanford University
Multimodal few-shot

Essayez la réponse visuelle aux questions à la manière de Med-Flamingo

Téléversez une image médicale et posez une question à son sujet : la démo illustre le raisonnement image-texte entrelacé que Med-Flamingo a introduit en médecine.

Med-Flamingo Démo

Découvrez une IA médicale avancée

0/3 messages

Démarrer une consultation médicale

Posez des questions médicales complexes ou demandez une aide au raisonnement clinique

Exploitez tout le potentiel de Med-Flamingo

Bénéficiez de réponses illimitées sur les images, de limites de téléversement plus élevées et d'un accès API pour la recherche médicale multimodale.

VQA
Visual Q&A
Few-shot
Few-shot Accuracy
10+
AI Models Available
Passer à Pro→

Qu'est-ce que Med-Flamingo ?

Med-Flamingo est un modèle vision-langage médical publié en 2023 par Michael Moor et ses collègues de Stanford avec des collaborateurs (Moor et al., « Med-Flamingo: a Multimodal Medical Few-shot Learner »). Il adapte au domaine médical OpenFlamingo-9B, une réimplémentation ouverte de Flamingo de DeepMind.

Le pré-entraînement du modèle a été prolongé sur des séquences image-texte entrelacées issues de manuels médicaux (le jeu de données MTB) et sur des paires figure-légende de PMC-OA. Comme il traite images et texte entrelacés dans un même contexte, il prend en charge l'apprentissage en contexte (« few-shot ») : montrez-lui quelques exemples image-question-réponse et il généralise à une nouvelle image sans fine-tuning.

Sur VQA-RAD, PathVQA et un nouveau benchmark, Visual USMLE, des cliniciens ont mieux noté les réponses générées par Med-Flamingo que celles des modèles de référence, mais les auteurs soulignent explicitement qu'il s'agit d'un prototype de recherche précoce, susceptible d'halluciner et inadapté à un usage clinique.

🦩

Dernière évolution

Publié en juillet 2023 par des chercheurs de Stanford et leurs collaborateurs (Moor et al., 2023)

Few-shot
Learning

Poids ouverts sur GitHub / Hugging Face pour la recherche ; basé sur OpenFlamingo-9B

Caractéristiques clés

Apprentissage en contexte pour les images médicales

Capacités principales

Réponse visuelle aux questions médicales en few-shot

Entrées image + texte entrelacées dans un seul prompt

Réponses génératives en texte libre, pas seulement à choix multiples

Pré-entraîné sur des manuels médicaux et des figures de PubMed Central

Construit sur OpenFlamingo-9B (backbone linguistique LLaMA-7B)

Évalué sur VQA-RAD, PathVQA et Visual USMLE

Protocole d'évaluation fondé sur la notation par des cliniciens

Poids de recherche ouverts

Benchmarks de performance

Évaluation décrite dans l'article Med-Flamingo ; des cliniciens ont noté les réponses générées plutôt qu'un simple score de précision

VQA-RAD

Few-shot

Réponse visuelle aux questions en radiologie avec exemples en contexte

PathVQA

Few-shot

Réponse aux questions sur des images de pathologie

Visual USMLE

Nouveau benchmark

Questions de type USMLE nécessitant l'examen d'une image, introduites avec l'article

Évaluation par des cliniciens

+ vs références

En moyenne, les experts humains ont préféré les réponses de Med-Flamingo à celles des modèles de référence comparés

Cas d'usage

🔬

Recherche multimodale

Étudier l'apprentissage en contexte pour les images médicales avec un modèle ouvert.

🏥

Questions-réponses sur images

Répondre en texte libre à des questions sur une image médicale, pour relecture par un clinicien.

🎓

Formation médicale

Entraînement de type USMLE à partir d'images, avec explications.

Comment utiliser Med-Flamingo

Code de recherche et poids fournis par les auteurs

1

Obtenir le modèle

Le code et les poids sont publiés dans le dépôt GitHub des auteurs et sur Hugging Face ; vous aurez aussi besoin des poids de base d'OpenFlamingo et de LLaMA-7B.

2

Options d'intégration

Composez un prompt de quelques exemples image-question-réponse, suivis de la nouvelle image et de la question.

  • • VQA few-shot sur des images de radiologie
  • • VQA few-shot sur des images de pathologie
  • • Réponse aux questions de type Visual USMLE
  • • Référence pour la recherche médicale multimodale
3

Points à considérer pour le déploiement

Prévoyez la confidentialité, la validation et la supervision humaine avant d'approcher Med-Flamingo de données de patients.

  • • Anonymiser les données et respecter HIPAA / GDPR
  • • Valider sur les données de votre propre établissement avant utilisation
  • • Faire relire chaque résultat par un clinicien diplômé
  • • Documenter les limites et l'usage prévu pour les auditeurs

Considérations importantes

Validation clinique requise

Med-Flamingo est un modèle de recherche. Ses résultats doivent être examinés par des professionnels de santé qualifiés avant toute utilisation clinique.

Conformité réglementaire

Le modèle n'est pas un dispositif médical autorisé ou approuvé. Assurez-vous de respecter la réglementation sanitaire locale et les règles de protection des données (par ex. HIPAA, GDPR) avant tout déploiement.

Vous avez la photo d'un symptôme visible ?

Les modèles décrits sur cette page sont des outils de recherche destinés à l'imagerie clinique. Si ce que vous avez est une photo du quotidien — une éruption, un grain de beauté, un ongle, une plaie —, AI Doctor Scan l'analyse et renvoie gratuitement un niveau d'urgence et un résumé en langage clair en une trentaine de secondes. Il ne nomme aucun diagnostic et ne demande aucun compte.

Essayer AI Doctor Scan — gratuit

Med-Flamingo face aux autres modèles médicaux multimodaux

Ce que change l'apprentissage few-shot

🦩

Med-Flamingo

VQA médicale few-shot de Stanford

  • ✓S'adapte à de nouvelles tâches sur images à partir de quelques exemples
  • ✓Prompting image-texte entrelacé
  • ✓Réponses génératives en texte libre
  • ✓Poids de recherche ouverts
  • ✓A introduit le benchmark Visual USMLE
  • ✓Évaluation par des cliniciens

Recherche sur l'apprentissage en contexte et la VQA médicale générative

🤖

Autres modèles d'IA médicale

Comment il se situe

  • ×Les LLM généralistes (GPT-4, Gemini) raisonnent mieux sur des questions ouvertes, mais sont fermés et coûteux
  • ×Les modèles ouverts plus grands (Meditron-70B, MedGemma-27B) exigent beaucoup plus de mémoire GPU
  • ×Les modèles uniquement textuels ne peuvent pas examiner d'images
  • ×Les classificateurs purement visuels ne peuvent pas expliquer leurs résultats en langage naturel
  • ×Les produits commerciaux sont validés mais non inspectables
  • ×La plupart des alternatives publient moins de benchmarks reproductibles

Choisissez selon la modalité (texte ou image), la licence et le matériel dont vous disposez réellement

Questions fréquentes

Questions courantes sur Med-Flamingo

Qui a développé Med-Flamingo ?

Michael Moor et ses collègues de l'université Stanford, avec des collaborateurs (2023). Ce n'est pas un modèle Google.

Que signifie « few-shot » ici ?

Vous placez quelques triplets d'exemple image-question-réponse dans le prompt ; le modèle répond ensuite sur une nouvelle image sans aucun fine-tuning.

Sur quoi repose Med-Flamingo ?

Sur OpenFlamingo-9B, une réimplémentation ouverte de l'architecture Flamingo de DeepMind, avec un backbone linguistique LLaMA-7B.

Med-Flamingo peut-il être utilisé en clinique en toute sécurité ?

Non. Les auteurs le décrivent comme un prototype de recherche précoce susceptible d'halluciner ; il ne doit pas être utilisé pour la prise en charge des patients.

Cette démo exécute-t-elle Med-Flamingo lui-même ?

La démo utilise l'assistant médical multimodal de Dr7.ai pour illustrer la réponse aux questions sur des images. Pour utiliser le modèle d'origine, exécutez le code des auteurs.