
Con la tecnología de la plataforma de IA médica Dr7.ai
Med-Flamingo es un modelo multimodal de aprendizaje con pocos ejemplos (few-shot) para medicina, creado por investigadores de Stanford. Basado en OpenFlamingo-9B y preentrenado con datos intercalados de imagen y texto procedentes de libros de texto de medicina y PubMed Central, puede responder preguntas sobre una imagen médica nueva tras ver solo unos pocos ejemplos.
Sube una imagen médica y haz una pregunta sobre ella: la demo muestra el razonamiento intercalado de imagen y texto que Med-Flamingo introdujo en medicina.
Descubre la IA médica avanzada
Obtén respuestas ilimitadas a preguntas sobre imágenes, límites de carga más altos y acceso a la API para la investigación médica multimodal.
Med-Flamingo es un modelo médico de visión y lenguaje publicado en 2023 por Michael Moor y sus colegas de Stanford junto con otros colaboradores (Moor et al., "Med-Flamingo: a Multimodal Medical Few-shot Learner"). Adapta OpenFlamingo-9B, una reimplementación abierta de Flamingo de DeepMind, al ámbito médico.
El modelo recibió preentrenamiento continuado con secuencias intercaladas de imagen y texto de libros de texto de medicina (el conjunto de datos MTB) y pares figura-leyenda de PMC-OA. Como procesa imágenes y texto intercalados en un mismo contexto, admite aprendizaje en contexto ("few-shot"): muéstrale unos pocos ejemplos de imagen-pregunta-respuesta y generaliza a una imagen nueva sin ajuste fino.
En VQA-RAD, PathVQA y un nuevo benchmark Visual USMLE, los clínicos valoraron las respuestas generativas de Med-Flamingo por encima de las de los modelos de referencia, pero los autores dejan claro que es un prototipo de investigación temprano que puede alucinar y no es apto para uso clínico.
Publicado en julio de 2023 por investigadores de Stanford y colaboradores (Moor et al., 2023)
Pesos abiertos en GitHub / Hugging Face para investigación; basado en OpenFlamingo-9B
Aprendizaje en contexto para imágenes médicas
Respuesta visual a preguntas médicas con pocos ejemplos
Entradas intercaladas de imagen + texto en un solo prompt
Respuestas generativas (texto libre), no solo de opción múltiple
Preentrenado con libros de texto de medicina y figuras de PubMed Central
Basado en OpenFlamingo-9B (con LLaMA-7B como base de lenguaje)
Evaluado en VQA-RAD, PathVQA y Visual USMLE
Protocolo de evaluación con valoración de clínicos
Pesos abiertos para investigación
Evaluación descrita en el artículo de Med-Flamingo; los clínicos puntuaron las respuestas generativas en lugar de dar una única cifra de precisión
Respuesta visual a preguntas de radiología con ejemplos en contexto
Respuesta a preguntas sobre imágenes de patología
Preguntas de estilo USMLE que requieren observar una imagen, presentadas junto con el artículo
De media, los expertos humanos prefirieron las respuestas de Med-Flamingo frente a las de los modelos de referencia comparados
Estudia el aprendizaje en contexto con imágenes médicas usando un modelo abierto.
Responde en texto libre a preguntas sobre una imagen médica para su revisión por un clínico.
Práctica de estilo USMLE basada en imágenes, con explicaciones.
Código y pesos de investigación publicados por los autores
El código y los pesos están publicados en el repositorio de GitHub de los autores y en Hugging Face; también necesitas los pesos base de OpenFlamingo y LLaMA-7B.
Compón un prompt con unos pocos ejemplos de imagen-pregunta-respuesta seguidos de la nueva imagen y la pregunta.
Planifica la privacidad, la validación y la supervisión humana antes de acercar Med-Flamingo a datos de pacientes.
Med-Flamingo es un modelo de investigación. Sus resultados deben ser revisados por profesionales sanitarios calificados antes de cualquier uso clínico.
El modelo no es un dispositivo médico autorizado ni aprobado. Garantiza el cumplimiento de la normativa sanitaria local y de las normas de protección de datos (p. ej., HIPAA, GDPR) antes del despliegue.
Los modelos descritos en esta página son herramientas de investigación para imagen clínica. Si lo que tienes es una foto cotidiana —una erupción, un lunar, una uña, una herida—, AI Doctor Scan la analiza y devuelve gratis un nivel de urgencia y un resumen en lenguaje sencillo en unos 30 segundos. No nombra ningún diagnóstico y no requiere cuenta.
Prueba AI Doctor Scan — gratisQué cambia el aprendizaje con pocos ejemplos
VQA médico few-shot de Stanford
Investigación sobre aprendizaje en contexto y VQA médico generativo
Cómo se compara
Elige según la modalidad (texto o imagen), la licencia y el hardware del que realmente dispones
Preguntas habituales sobre Med-Flamingo
Michael Moor y sus colegas de la Universidad de Stanford, junto con otros colaboradores (2023). No es un modelo de Google.
Incluyes en el prompt unos pocos tríos de ejemplo de imagen-pregunta-respuesta; después, el modelo responde sobre una imagen nueva sin ningún ajuste fino.
Se basa en OpenFlamingo-9B, una reimplementación abierta de la arquitectura Flamingo de DeepMind con LLaMA-7B como base de lenguaje.
No. Los autores lo describen como un prototipo de investigación temprano que puede alucinar; no debe usarse en la atención a pacientes.
La demo usa el asistente médico multimodal de Dr7.ai para mostrar la respuesta a preguntas sobre imágenes. Para usar el modelo original, ejecuta el código de los autores.