
Com tecnologia da plataforma de IA médica Dr7.ai
O Med-Flamingo é um modelo multimodal de aprendizado com poucos exemplos (few-shot) para medicina, criado por pesquisadores de Stanford. Baseado no OpenFlamingo-9B e pré-treinado com dados intercalados de imagem e texto de livros didáticos de medicina e do PubMed Central, ele consegue responder a perguntas sobre uma nova imagem médica depois de ver apenas alguns exemplos.
Envie uma imagem médica e faça uma pergunta sobre ela — a demo mostra o raciocínio intercalado de imagem e texto que o Med-Flamingo trouxe para a medicina.
Conheça a IA médica avançada
Tenha respostas ilimitadas a perguntas sobre imagens, limites de upload maiores e acesso à API para pesquisa médica multimodal.
Med-Flamingo é um modelo médico de visão e linguagem lançado em 2023 por Michael Moor e colegas de Stanford, em conjunto com colaboradores (Moor et al., "Med-Flamingo: a Multimodal Medical Few-shot Learner"). Ele adapta o OpenFlamingo-9B — uma reimplementação aberta do Flamingo da DeepMind — ao domínio médico.
O modelo passou por pré-treinamento continuado com sequências intercaladas de imagem e texto de livros didáticos de medicina (o conjunto de dados MTB) e pares figura-legenda do PMC-OA. Como processa imagens e texto intercalados em um mesmo contexto, ele permite aprendizado em contexto ("few-shot"): mostre alguns exemplos de imagem-pergunta-resposta e ele generaliza para uma nova imagem sem ajuste fino.
No VQA-RAD, no PathVQA e em um novo benchmark, o Visual USMLE, médicos avaliaram as respostas generativas do Med-Flamingo acima das dos modelos de referência, mas os autores deixam claro que se trata de um protótipo de pesquisa inicial, que pode alucinar e não é adequado para uso clínico.
Lançado em julho de 2023 por pesquisadores de Stanford e colaboradores (Moor et al., 2023)
Pesos abertos no GitHub / Hugging Face para pesquisa; baseado no OpenFlamingo-9B
Aprendizado em contexto para imagens médicas
Resposta visual a perguntas médicas com poucos exemplos
Entradas intercaladas de imagem + texto em um único prompt
Respostas generativas (texto livre), não apenas múltipla escolha
Pré-treinado com livros didáticos de medicina e figuras do PubMed Central
Baseado no OpenFlamingo-9B (com o LLaMA-7B como base de linguagem)
Avaliado no VQA-RAD, PathVQA e Visual USMLE
Protocolo de avaliação com notas de médicos
Pesos abertos para pesquisa
Avaliação descrita no artigo do Med-Flamingo; médicos pontuaram as respostas generativas em vez de um único número de acurácia
Resposta visual a perguntas de radiologia com exemplos em contexto
Resposta a perguntas sobre imagens de patologia
Questões no estilo USMLE que exigem a análise de uma imagem, apresentadas junto com o artigo
Em média, especialistas humanos preferiram as respostas do Med-Flamingo às dos modelos de referência comparados
Estude o aprendizado em contexto com imagens médicas usando um modelo aberto.
Responda em texto livre a perguntas sobre uma imagem médica para revisão por um médico.
Prática no estilo USMLE baseada em imagens, com explicações.
Código e pesos de pesquisa publicados pelos autores
O código e os pesos estão publicados no repositório do GitHub dos autores e no Hugging Face; você também precisa dos pesos base do OpenFlamingo e do LLaMA-7B.
Monte um prompt com alguns exemplos de imagem-pergunta-resposta, seguidos da nova imagem e da pergunta.
Planeje privacidade, validação e supervisão humana antes de colocar o Med-Flamingo perto de dados de pacientes.
O Med-Flamingo é um modelo de pesquisa. Seus resultados devem ser revisados por profissionais de saúde qualificados antes de qualquer uso clínico.
O modelo não é um dispositivo médico autorizado ou aprovado. Garanta a conformidade com as regulamentações de saúde locais e as regras de proteção de dados (por exemplo, HIPAA, GDPR) antes da implantação.
Os modelos descritos nesta página são ferramentas de pesquisa para imagem clínica. Se o que você tem é uma foto do dia a dia — uma erupção, uma pinta, uma unha, um ferimento —, o AI Doctor Scan a analisa e devolve gratuitamente um nível de urgência e um resumo em linguagem simples em cerca de 30 segundos. Não nomeia nenhum diagnóstico e não exige conta.
Experimente o AI Doctor Scan — grátisO que muda com o aprendizado com poucos exemplos
VQA médico few-shot de Stanford
Pesquisa sobre aprendizado em contexto e VQA médico generativo
Como ele se compara
Escolha pela modalidade (texto ou imagem), pela licença e pelo hardware que você realmente tem
Dúvidas comuns sobre o Med-Flamingo
Michael Moor e colegas da Universidade Stanford, em conjunto com colaboradores (2023). Não é um modelo do Google.
Você coloca no prompt alguns trios de exemplo de imagem-pergunta-resposta; em seguida, o modelo responde sobre uma nova imagem sem nenhum ajuste fino.
Ele se baseia no OpenFlamingo-9B, uma reimplementação aberta da arquitetura Flamingo da DeepMind com o LLaMA-7B como base de linguagem.
Não. Os autores o descrevem como um protótipo de pesquisa inicial que pode alucinar; ele não deve ser usado no atendimento a pacientes.
A demo usa o assistente médico multimodal da Dr7.ai para mostrar a resposta a perguntas sobre imagens. Para usar o modelo original, execute o código dos autores.