Plan Pro: 30% zniżkiOdbierz
Medical AI Background

Med-Flamingo

Odpowiadanie na pytania o obrazy medyczne w trybie few-shot

Działa na platformie medycznej AI Dr7.ai

Med-Flamingo to multimodalny model few-shot dla medycyny, opracowany przez badaczy ze Stanforda. Zbudowany na OpenFlamingo-9B i wstępnie wytrenowany na przeplatanych danych obraz-tekst z podręczników medycznych i PubMed Central, potrafi odpowiadać na pytania o nowy obraz medyczny po obejrzeniu zaledwie kilku przykładów.

✨
VQA
Model medycznej AI
Few-Shot
Learning
Stanford University
Multimodalny few-shot

Wypróbuj odpowiadanie na pytania o obrazy w stylu Med-Flamingo

Prześlij obraz medyczny i zadaj o niego pytanie — demo pokazuje przeplatane rozumowanie na obrazach i tekście, które Med-Flamingo wprowadził do medycyny.

Med-Flamingo Demo

Poznaj zaawansowaną medyczną AI

0/3 messages

Rozpocznij konsultację medyczną

Zadawaj złożone pytania medyczne lub poproś o pomoc w rozumowaniu klinicznym

Odblokuj pełny potencjał Med-Flamingo

Uzyskaj nieograniczone odpowiedzi na pytania o obrazy, wyższe limity przesyłania i dostęp do API na potrzeby multimodalnych badań medycznych.

VQA
Visual Q&A
Few-shot
Few-shot Accuracy
10+
AI Models Available
Przejdź na Pro→

Czym jest Med-Flamingo?

Med-Flamingo to medyczny model wizyjno-językowy udostępniony w 2023 r. przez Michaela Moora i współpracowników ze Stanforda wraz z innymi partnerami (Moor et al., "Med-Flamingo: a Multimodal Medical Few-shot Learner"). Dostosowuje do dziedziny medycznej OpenFlamingo-9B — otwartą reimplementację modelu Flamingo od DeepMind.

Model poddano dalszemu treningowi wstępnemu na przeplatanych sekwencjach obraz-tekst z podręczników medycznych (zbiór MTB) oraz parach rycina-podpis z PMC-OA. Ponieważ przetwarza obrazy i tekst przeplatane w jednym kontekście, obsługuje uczenie w kontekście ("few-shot"): wystarczy pokazać mu kilka przykładów obraz-pytanie-odpowiedź, a uogólni wiedzę na nowy obraz bez fine-tuningu.

Na VQA-RAD, PathVQA i nowym benchmarku Visual USMLE klinicyści ocenili generowane odpowiedzi Med-Flamingo wyżej niż odpowiedzi modeli bazowych, jednak autorzy wyraźnie zaznaczają, że jest to wczesny prototyp badawczy, który może halucynować i nie nadaje się do użytku klinicznego.

🦩

Najnowsze informacje

Udostępniony w lipcu 2023 r. przez badaczy ze Stanforda i współpracowników (Moor et al., 2023)

Few-shot
Learning

Otwarte wagi na GitHubie / Hugging Face do celów badawczych; oparty na OpenFlamingo-9B

Kluczowe funkcje

Uczenie w kontekście dla obrazów medycznych

Główne możliwości

Odpowiadanie na pytania o obrazy medyczne w trybie few-shot

Przeplatane dane wejściowe obraz + tekst w jednym prompcie

Odpowiedzi generatywne (dowolny tekst), nie tylko wielokrotnego wyboru

Wstępnie trenowany na podręcznikach medycznych i rycinach z PubMed Central

Zbudowany na OpenFlamingo-9B (szkielet językowy LLaMA-7B)

Oceniany na VQA-RAD, PathVQA i Visual USMLE

Protokół oceny oparty na ocenach klinicystów

Otwarte wagi badawcze

Wyniki w benchmarkach

Ocena opisana w publikacji o Med-Flamingo; klinicyści oceniali generowane odpowiedzi zamiast jednego wskaźnika trafności

VQA-RAD

Few-shot

Odpowiadanie na pytania o obrazy radiologiczne z przykładami w kontekście

PathVQA

Few-shot

Odpowiadanie na pytania o obrazy patomorfologiczne

Visual USMLE

Nowy benchmark

Pytania w stylu USMLE wymagające analizy obrazu, wprowadzone wraz z publikacją

Ocena klinicystów

+ względem modeli bazowych

Eksperci średnio wyżej oceniali odpowiedzi Med-Flamingo niż odpowiedzi porównywanych modeli bazowych

Zastosowania

🔬

Badania multimodalne

Badaj uczenie w kontekście na obrazach medycznych z użyciem otwartego modelu.

🏥

Pytania i odpowiedzi na podstawie obrazów

Odpowiada na pytania o obraz medyczny w formie dowolnego tekstu, do weryfikacji przez klinicystę.

🎓

Edukacja medyczna

Ćwiczenia w stylu USMLE oparte na obrazach, z wyjaśnieniami.

Jak korzystać z Med-Flamingo

Kod badawczy i wagi od autorów

1

Pobierz model

Kod i wagi są opublikowane w repozytorium GitHub autorów oraz na Hugging Face; potrzebne są też wagi bazowe OpenFlamingo i LLaMA-7B.

2

Opcje integracji

Ułóż prompt z kilku przykładów obraz-pytanie-odpowiedź, a następnie dodaj nowy obraz i pytanie.

  • • VQA few-shot na obrazach radiologicznych
  • • VQA few-shot na obrazach patomorfologicznych
  • • Odpowiadanie na pytania wizualne w stylu USMLE
  • • Model bazowy do multimodalnych badań medycznych
3

Kwestie wdrożeniowe

Zanim dopuścisz Med-Flamingo w pobliże danych pacjentów, zaplanuj ochronę prywatności, walidację i nadzór człowieka.

  • • Anonimizuj dane i przestrzegaj HIPAA / GDPR
  • • Przed użyciem zwaliduj model na danych własnej placówki
  • • Każdy wynik musi weryfikować uprawniony lekarz
  • • Dokumentuj ograniczenia i przeznaczenie na potrzeby audytorów

Ważne kwestie

Wymagana walidacja kliniczna

Med-Flamingo jest modelem badawczym. Przed jakimkolwiek zastosowaniem klinicznym jego wyniki muszą zostać zweryfikowane przez wykwalifikowany personel medyczny.

Zgodność z przepisami

Model nie jest dopuszczonym ani zatwierdzonym wyrobem medycznym. Przed wdrożeniem zapewnij zgodność z lokalnymi przepisami dotyczącymi ochrony zdrowia i ochrony danych (np. HIPAA, GDPR).

Med-Flamingo na tle innych multimodalnych modeli medycznych

Co zmienia uczenie few-shot

🦩

Med-Flamingo

Medyczne VQA few-shot ze Stanforda

  • ✓Dostosowuje się do nowych zadań obrazowych na podstawie kilku przykładów
  • ✓Prompty z przeplatanym obrazem i tekstem
  • ✓Generatywne odpowiedzi w formie dowolnego tekstu
  • ✓Otwarte wagi badawcze
  • ✓Wprowadził benchmark Visual USMLE
  • ✓Ocena dokonywana przez klinicystów

Badania nad uczeniem w kontekście i generatywnym medycznym VQA

🤖

Inne modele medycznej AI

Jak wypada w porównaniu

  • ×Ogólne LLM (GPT-4, Gemini) lepiej radzą sobie z otwartym rozumowaniem, ale są zamknięte i kosztowne
  • ×Większe otwarte modele (Meditron-70B, MedGemma-27B) wymagają znacznie więcej pamięci GPU
  • ×Modele tekstowe nie potrafią analizować obrazów
  • ×Klasyfikatory obrazów nie potrafią objaśnić swoich wyników słowami
  • ×Produkty komercyjne są zwalidowane, ale nie da się ich zbadać
  • ×Większość alternatyw publikuje mniej benchmarków z odtwarzalnymi wynikami

Wybieraj według modalności (tekst czy obraz), licencji i sprzętu, którym faktycznie dysponujesz

Najczęściej zadawane pytania

Częste pytania o Med-Flamingo

Kto opracował Med-Flamingo?

Michael Moor i współpracownicy ze Stanford University wraz z innymi partnerami (2023). Nie jest to model Google.

Co oznacza tutaj "few-shot"?

Umieszczasz w prompcie kilka przykładowych trójek obraz-pytanie-odpowiedź, a model odpowiada na pytanie o nowy obraz bez żadnego fine-tuningu.

Na czym opiera się Med-Flamingo?

Na OpenFlamingo-9B, otwartej reimplementacji architektury Flamingo od DeepMind ze szkieletem językowym LLaMA-7B.

Czy Med-Flamingo jest bezpieczny w zastosowaniach klinicznych?

Nie. Autorzy opisują go jako wczesny prototyp badawczy, który może halucynować; nie wolno go używać w opiece nad pacjentami.

Czy to demo uruchamia właśnie Med-Flamingo?

Demo korzysta z multimodalnego asystenta medycznego Dr7.ai, aby pokazać odpowiadanie na pytania o obrazy. Aby użyć dokładnie tego modelu, uruchom kod autorów.