
Działa na platformie medycznej AI Dr7.ai
Med-Flamingo to multimodalny model few-shot dla medycyny, opracowany przez badaczy ze Stanforda. Zbudowany na OpenFlamingo-9B i wstępnie wytrenowany na przeplatanych danych obraz-tekst z podręczników medycznych i PubMed Central, potrafi odpowiadać na pytania o nowy obraz medyczny po obejrzeniu zaledwie kilku przykładów.
Prześlij obraz medyczny i zadaj o niego pytanie — demo pokazuje przeplatane rozumowanie na obrazach i tekście, które Med-Flamingo wprowadził do medycyny.
Poznaj zaawansowaną medyczną AI
Uzyskaj nieograniczone odpowiedzi na pytania o obrazy, wyższe limity przesyłania i dostęp do API na potrzeby multimodalnych badań medycznych.
Med-Flamingo to medyczny model wizyjno-językowy udostępniony w 2023 r. przez Michaela Moora i współpracowników ze Stanforda wraz z innymi partnerami (Moor et al., "Med-Flamingo: a Multimodal Medical Few-shot Learner"). Dostosowuje do dziedziny medycznej OpenFlamingo-9B — otwartą reimplementację modelu Flamingo od DeepMind.
Model poddano dalszemu treningowi wstępnemu na przeplatanych sekwencjach obraz-tekst z podręczników medycznych (zbiór MTB) oraz parach rycina-podpis z PMC-OA. Ponieważ przetwarza obrazy i tekst przeplatane w jednym kontekście, obsługuje uczenie w kontekście ("few-shot"): wystarczy pokazać mu kilka przykładów obraz-pytanie-odpowiedź, a uogólni wiedzę na nowy obraz bez fine-tuningu.
Na VQA-RAD, PathVQA i nowym benchmarku Visual USMLE klinicyści ocenili generowane odpowiedzi Med-Flamingo wyżej niż odpowiedzi modeli bazowych, jednak autorzy wyraźnie zaznaczają, że jest to wczesny prototyp badawczy, który może halucynować i nie nadaje się do użytku klinicznego.
Udostępniony w lipcu 2023 r. przez badaczy ze Stanforda i współpracowników (Moor et al., 2023)
Otwarte wagi na GitHubie / Hugging Face do celów badawczych; oparty na OpenFlamingo-9B
Uczenie w kontekście dla obrazów medycznych
Odpowiadanie na pytania o obrazy medyczne w trybie few-shot
Przeplatane dane wejściowe obraz + tekst w jednym prompcie
Odpowiedzi generatywne (dowolny tekst), nie tylko wielokrotnego wyboru
Wstępnie trenowany na podręcznikach medycznych i rycinach z PubMed Central
Zbudowany na OpenFlamingo-9B (szkielet językowy LLaMA-7B)
Oceniany na VQA-RAD, PathVQA i Visual USMLE
Protokół oceny oparty na ocenach klinicystów
Otwarte wagi badawcze
Ocena opisana w publikacji o Med-Flamingo; klinicyści oceniali generowane odpowiedzi zamiast jednego wskaźnika trafności
Odpowiadanie na pytania o obrazy radiologiczne z przykładami w kontekście
Odpowiadanie na pytania o obrazy patomorfologiczne
Pytania w stylu USMLE wymagające analizy obrazu, wprowadzone wraz z publikacją
Eksperci średnio wyżej oceniali odpowiedzi Med-Flamingo niż odpowiedzi porównywanych modeli bazowych
Badaj uczenie w kontekście na obrazach medycznych z użyciem otwartego modelu.
Odpowiada na pytania o obraz medyczny w formie dowolnego tekstu, do weryfikacji przez klinicystę.
Ćwiczenia w stylu USMLE oparte na obrazach, z wyjaśnieniami.
Kod badawczy i wagi od autorów
Kod i wagi są opublikowane w repozytorium GitHub autorów oraz na Hugging Face; potrzebne są też wagi bazowe OpenFlamingo i LLaMA-7B.
Ułóż prompt z kilku przykładów obraz-pytanie-odpowiedź, a następnie dodaj nowy obraz i pytanie.
Zanim dopuścisz Med-Flamingo w pobliże danych pacjentów, zaplanuj ochronę prywatności, walidację i nadzór człowieka.
Med-Flamingo jest modelem badawczym. Przed jakimkolwiek zastosowaniem klinicznym jego wyniki muszą zostać zweryfikowane przez wykwalifikowany personel medyczny.
Model nie jest dopuszczonym ani zatwierdzonym wyrobem medycznym. Przed wdrożeniem zapewnij zgodność z lokalnymi przepisami dotyczącymi ochrony zdrowia i ochrony danych (np. HIPAA, GDPR).
Co zmienia uczenie few-shot
Medyczne VQA few-shot ze Stanforda
Badania nad uczeniem w kontekście i generatywnym medycznym VQA
Jak wypada w porównaniu
Wybieraj według modalności (tekst czy obraz), licencji i sprzętu, którym faktycznie dysponujesz
Częste pytania o Med-Flamingo
Michael Moor i współpracownicy ze Stanford University wraz z innymi partnerami (2023). Nie jest to model Google.
Umieszczasz w prompcie kilka przykładowych trójek obraz-pytanie-odpowiedź, a model odpowiada na pytanie o nowy obraz bez żadnego fine-tuningu.
Na OpenFlamingo-9B, otwartej reimplementacji architektury Flamingo od DeepMind ze szkieletem językowym LLaMA-7B.
Nie. Autorzy opisują go jako wczesny prototyp badawczy, który może halucynować; nie wolno go używać w opiece nad pacjentami.
Demo korzysta z multimodalnego asystenta medycznego Dr7.ai, aby pokazać odpowiadanie na pytania o obrazy. Aby użyć dokładnie tego modelu, uruchom kod autorów.