Plan Pro: 30% de descuentoObtener
Medical AI Background

Med-Flamingo

Respuesta visual a preguntas médicas con pocos ejemplos (few-shot)

Con la tecnología de la plataforma de IA médica Dr7.ai

Med-Flamingo es un modelo multimodal de aprendizaje con pocos ejemplos (few-shot) para medicina, creado por investigadores de Stanford. Basado en OpenFlamingo-9B y preentrenado con datos intercalados de imagen y texto procedentes de libros de texto de medicina y PubMed Central, puede responder preguntas sobre una imagen médica nueva tras ver solo unos pocos ejemplos.

✨
VQA
Modelo de IA médica
Few-Shot
Learning
Universidad de Stanford
Multimodal few-shot

Prueba la respuesta visual a preguntas al estilo Med-Flamingo

Sube una imagen médica y haz una pregunta sobre ella: la demo muestra el razonamiento intercalado de imagen y texto que Med-Flamingo introdujo en medicina.

Med-Flamingo Demo

Descubre la IA médica avanzada

0/3 messages

Inicia una consulta médica

Haz preguntas médicas complejas o pide ayuda con el razonamiento clínico

Aprovecha todo el potencial de Med-Flamingo

Obtén respuestas ilimitadas a preguntas sobre imágenes, límites de carga más altos y acceso a la API para la investigación médica multimodal.

VQA
Visual Q&A
Few-shot
Few-shot Accuracy
10+
AI Models Available
Actualizar a Pro→

¿Qué es Med-Flamingo?

Med-Flamingo es un modelo médico de visión y lenguaje publicado en 2023 por Michael Moor y sus colegas de Stanford junto con otros colaboradores (Moor et al., "Med-Flamingo: a Multimodal Medical Few-shot Learner"). Adapta OpenFlamingo-9B, una reimplementación abierta de Flamingo de DeepMind, al ámbito médico.

El modelo recibió preentrenamiento continuado con secuencias intercaladas de imagen y texto de libros de texto de medicina (el conjunto de datos MTB) y pares figura-leyenda de PMC-OA. Como procesa imágenes y texto intercalados en un mismo contexto, admite aprendizaje en contexto ("few-shot"): muéstrale unos pocos ejemplos de imagen-pregunta-respuesta y generaliza a una imagen nueva sin ajuste fino.

En VQA-RAD, PathVQA y un nuevo benchmark Visual USMLE, los clínicos valoraron las respuestas generativas de Med-Flamingo por encima de las de los modelos de referencia, pero los autores dejan claro que es un prototipo de investigación temprano que puede alucinar y no es apto para uso clínico.

🦩

Última novedad

Publicado en julio de 2023 por investigadores de Stanford y colaboradores (Moor et al., 2023)

Few-shot
Learning

Pesos abiertos en GitHub / Hugging Face para investigación; basado en OpenFlamingo-9B

Características principales

Aprendizaje en contexto para imágenes médicas

Capacidades principales

Respuesta visual a preguntas médicas con pocos ejemplos

Entradas intercaladas de imagen + texto en un solo prompt

Respuestas generativas (texto libre), no solo de opción múltiple

Preentrenado con libros de texto de medicina y figuras de PubMed Central

Basado en OpenFlamingo-9B (con LLaMA-7B como base de lenguaje)

Evaluado en VQA-RAD, PathVQA y Visual USMLE

Protocolo de evaluación con valoración de clínicos

Pesos abiertos para investigación

Benchmarks de rendimiento

Evaluación descrita en el artículo de Med-Flamingo; los clínicos puntuaron las respuestas generativas en lugar de dar una única cifra de precisión

VQA-RAD

Few-shot

Respuesta visual a preguntas de radiología con ejemplos en contexto

PathVQA

Few-shot

Respuesta a preguntas sobre imágenes de patología

Visual USMLE

Nuevo benchmark

Preguntas de estilo USMLE que requieren observar una imagen, presentadas junto con el artículo

Valoración de clínicos

+ vs. líneas base

De media, los expertos humanos prefirieron las respuestas de Med-Flamingo frente a las de los modelos de referencia comparados

Casos de uso

🔬

Investigación multimodal

Estudia el aprendizaje en contexto con imágenes médicas usando un modelo abierto.

🏥

Preguntas y respuestas sobre imágenes

Responde en texto libre a preguntas sobre una imagen médica para su revisión por un clínico.

🎓

Educación médica

Práctica de estilo USMLE basada en imágenes, con explicaciones.

Cómo usar Med-Flamingo

Código y pesos de investigación publicados por los autores

1

Obtén el modelo

El código y los pesos están publicados en el repositorio de GitHub de los autores y en Hugging Face; también necesitas los pesos base de OpenFlamingo y LLaMA-7B.

2

Opciones de integración

Compón un prompt con unos pocos ejemplos de imagen-pregunta-respuesta seguidos de la nueva imagen y la pregunta.

  • • VQA few-shot con imágenes de radiología
  • • VQA few-shot con imágenes de patología
  • • Respuesta a preguntas de estilo Visual USMLE
  • • Modelo de referencia para la investigación médica multimodal
3

Consideraciones de despliegue

Planifica la privacidad, la validación y la supervisión humana antes de acercar Med-Flamingo a datos de pacientes.

  • • Anonimiza los datos y cumple HIPAA / GDPR
  • • Valídalo con los datos de tu propia institución antes de usarlo
  • • Mantén a un profesional clínico acreditado supervisando cada resultado
  • • Documenta las limitaciones y el uso previsto para los auditores

Consideraciones importantes

Se requiere validación clínica

Med-Flamingo es un modelo de investigación. Sus resultados deben ser revisados por profesionales sanitarios calificados antes de cualquier uso clínico.

Cumplimiento normativo

El modelo no es un dispositivo médico autorizado ni aprobado. Garantiza el cumplimiento de la normativa sanitaria local y de las normas de protección de datos (p. ej., HIPAA, GDPR) antes del despliegue.

¿Tienes una foto de un síntoma visible?

Los modelos descritos en esta página son herramientas de investigación para imagen clínica. Si lo que tienes es una foto cotidiana —una erupción, un lunar, una uña, una herida—, AI Doctor Scan la analiza y devuelve gratis un nivel de urgencia y un resumen en lenguaje sencillo en unos 30 segundos. No nombra ningún diagnóstico y no requiere cuenta.

Prueba AI Doctor Scan — gratis

Med-Flamingo frente a otros modelos médicos multimodales

Qué cambia el aprendizaje con pocos ejemplos

🦩

Med-Flamingo

VQA médico few-shot de Stanford

  • ✓Se adapta a nuevas tareas de imagen a partir de unos pocos ejemplos
  • ✓Prompts con imagen y texto intercalados
  • ✓Respuestas generativas en texto libre
  • ✓Pesos abiertos para investigación
  • ✓Introdujo el benchmark Visual USMLE
  • ✓Evaluación con valoración de clínicos

Investigación sobre aprendizaje en contexto y VQA médico generativo

🤖

Otros modelos de IA médica

Cómo se compara

  • ×Los LLM generales (GPT-4, Gemini) razonan mejor en tareas abiertas, pero son cerrados y costosos
  • ×Los modelos abiertos más grandes (Meditron-70B, MedGemma-27B) necesitan mucha más memoria de GPU
  • ×Los modelos solo de texto no pueden ver imágenes
  • ×Los clasificadores solo de imagen no pueden explicar sus hallazgos con lenguaje
  • ×Los productos comerciales están validados, pero no son inspeccionables
  • ×La mayoría de las alternativas publican menos benchmarks reproducibles

Elige según la modalidad (texto o imagen), la licencia y el hardware del que realmente dispones

Preguntas frecuentes

Preguntas habituales sobre Med-Flamingo

¿Quién desarrolló Med-Flamingo?

Michael Moor y sus colegas de la Universidad de Stanford, junto con otros colaboradores (2023). No es un modelo de Google.

¿Qué significa aquí "few-shot"?

Incluyes en el prompt unos pocos tríos de ejemplo de imagen-pregunta-respuesta; después, el modelo responde sobre una imagen nueva sin ningún ajuste fino.

¿En qué se basa Med-Flamingo?

Se basa en OpenFlamingo-9B, una reimplementación abierta de la arquitectura Flamingo de DeepMind con LLaMA-7B como base de lenguaje.

¿Es seguro usar Med-Flamingo en la práctica clínica?

No. Los autores lo describen como un prototipo de investigación temprano que puede alucinar; no debe usarse en la atención a pacientes.

¿Esta demo ejecuta el propio Med-Flamingo?

La demo usa el asistente médico multimodal de Dr7.ai para mostrar la respuesta a preguntas sobre imágenes. Para usar el modelo original, ejecuta el código de los autores.