
Propulsé par la plateforme d'IA médicale Dr7.ai
Med-Flamingo est un modèle multimodal d'apprentissage few-shot pour la médecine, conçu par des chercheurs de Stanford. Construit sur OpenFlamingo-9B et pré-entraîné sur des données image-texte entrelacées issues de manuels médicaux et de PubMed Central, il peut répondre à des questions sur une nouvelle image médicale après avoir vu seulement quelques exemples.
Téléversez une image médicale et posez une question à son sujet : la démo illustre le raisonnement image-texte entrelacé que Med-Flamingo a introduit en médecine.
Découvrez une IA médicale avancée
Bénéficiez de réponses illimitées sur les images, de limites de téléversement plus élevées et d'un accès API pour la recherche médicale multimodale.
Med-Flamingo est un modèle vision-langage médical publié en 2023 par Michael Moor et ses collègues de Stanford avec des collaborateurs (Moor et al., « Med-Flamingo: a Multimodal Medical Few-shot Learner »). Il adapte au domaine médical OpenFlamingo-9B, une réimplémentation ouverte de Flamingo de DeepMind.
Le pré-entraînement du modèle a été prolongé sur des séquences image-texte entrelacées issues de manuels médicaux (le jeu de données MTB) et sur des paires figure-légende de PMC-OA. Comme il traite images et texte entrelacés dans un même contexte, il prend en charge l'apprentissage en contexte (« few-shot ») : montrez-lui quelques exemples image-question-réponse et il généralise à une nouvelle image sans fine-tuning.
Sur VQA-RAD, PathVQA et un nouveau benchmark, Visual USMLE, des cliniciens ont mieux noté les réponses générées par Med-Flamingo que celles des modèles de référence, mais les auteurs soulignent explicitement qu'il s'agit d'un prototype de recherche précoce, susceptible d'halluciner et inadapté à un usage clinique.
Publié en juillet 2023 par des chercheurs de Stanford et leurs collaborateurs (Moor et al., 2023)
Poids ouverts sur GitHub / Hugging Face pour la recherche ; basé sur OpenFlamingo-9B
Apprentissage en contexte pour les images médicales
Réponse visuelle aux questions médicales en few-shot
Entrées image + texte entrelacées dans un seul prompt
Réponses génératives en texte libre, pas seulement à choix multiples
Pré-entraîné sur des manuels médicaux et des figures de PubMed Central
Construit sur OpenFlamingo-9B (backbone linguistique LLaMA-7B)
Évalué sur VQA-RAD, PathVQA et Visual USMLE
Protocole d'évaluation fondé sur la notation par des cliniciens
Poids de recherche ouverts
Évaluation décrite dans l'article Med-Flamingo ; des cliniciens ont noté les réponses générées plutôt qu'un simple score de précision
Réponse visuelle aux questions en radiologie avec exemples en contexte
Réponse aux questions sur des images de pathologie
Questions de type USMLE nécessitant l'examen d'une image, introduites avec l'article
En moyenne, les experts humains ont préféré les réponses de Med-Flamingo à celles des modèles de référence comparés
Étudier l'apprentissage en contexte pour les images médicales avec un modèle ouvert.
Répondre en texte libre à des questions sur une image médicale, pour relecture par un clinicien.
Entraînement de type USMLE à partir d'images, avec explications.
Code de recherche et poids fournis par les auteurs
Le code et les poids sont publiés dans le dépôt GitHub des auteurs et sur Hugging Face ; vous aurez aussi besoin des poids de base d'OpenFlamingo et de LLaMA-7B.
Composez un prompt de quelques exemples image-question-réponse, suivis de la nouvelle image et de la question.
Prévoyez la confidentialité, la validation et la supervision humaine avant d'approcher Med-Flamingo de données de patients.
Med-Flamingo est un modèle de recherche. Ses résultats doivent être examinés par des professionnels de santé qualifiés avant toute utilisation clinique.
Le modèle n'est pas un dispositif médical autorisé ou approuvé. Assurez-vous de respecter la réglementation sanitaire locale et les règles de protection des données (par ex. HIPAA, GDPR) avant tout déploiement.
Les modèles décrits sur cette page sont des outils de recherche destinés à l'imagerie clinique. Si ce que vous avez est une photo du quotidien — une éruption, un grain de beauté, un ongle, une plaie —, AI Doctor Scan l'analyse et renvoie gratuitement un niveau d'urgence et un résumé en langage clair en une trentaine de secondes. Il ne nomme aucun diagnostic et ne demande aucun compte.
Essayer AI Doctor Scan — gratuitCe que change l'apprentissage few-shot
VQA médicale few-shot de Stanford
Recherche sur l'apprentissage en contexte et la VQA médicale générative
Comment il se situe
Choisissez selon la modalité (texte ou image), la licence et le matériel dont vous disposez réellement
Questions courantes sur Med-Flamingo
Michael Moor et ses collègues de l'université Stanford, avec des collaborateurs (2023). Ce n'est pas un modèle Google.
Vous placez quelques triplets d'exemple image-question-réponse dans le prompt ; le modèle répond ensuite sur une nouvelle image sans aucun fine-tuning.
Sur OpenFlamingo-9B, une réimplémentation ouverte de l'architecture Flamingo de DeepMind, avec un backbone linguistique LLaMA-7B.
Non. Les auteurs le décrivent comme un prototype de recherche précoce susceptible d'halluciner ; il ne doit pas être utilisé pour la prise en charge des patients.
La démo utilise l'assistant médical multimodal de Dr7.ai pour illustrer la réponse aux questions sur des images. Pour utiliser le modèle d'origine, exécutez le code des auteurs.