
Bereitgestellt von der medizinischen KI-Plattform Dr7.ai
Med-Flamingo ist ein multimodaler Few-Shot-Lerner für die Medizin, entwickelt von Forschenden aus Stanford. Das Modell basiert auf OpenFlamingo-9B, wurde auf verschränkten Bild-Text-Daten aus medizinischen Lehrbüchern und PubMed Central vortrainiert und kann Fragen zu einem neuen medizinischen Bild beantworten, nachdem es nur eine Handvoll Beispiele gesehen hat.
Laden Sie ein medizinisches Bild hoch und stellen Sie eine Frage dazu – die Demo zeigt das verschränkte Bild-Text-Schlussfolgern, das Med-Flamingo in die Medizin eingeführt hat.
Erleben Sie fortschrittliche medizinische KI
Erhalten Sie unbegrenzte Bild-Fragebeantwortung, höhere Upload-Limits und API-Zugang für die multimodale medizinische Forschung.
Med-Flamingo ist ein medizinisches Vision-Language-Modell, das 2023 von Michael Moor und Kollegen in Stanford gemeinsam mit weiteren Partnern veröffentlicht wurde (Moor et al., "Med-Flamingo: a Multimodal Medical Few-shot Learner"). Es überträgt OpenFlamingo-9B – eine offene Neuimplementierung von DeepMinds Flamingo – auf den medizinischen Bereich.
Das Modell wurde auf verschränkten Bild-Text-Sequenzen aus medizinischen Lehrbüchern (dem MTB-Datensatz) sowie auf Abbildung-Bildunterschrift-Paaren aus PMC-OA weiter vortrainiert. Da es Bilder und Text verschränkt in einem einzigen Kontext verarbeitet, unterstützt es In-Context-Lernen ("Few-Shot"): Zeigen Sie ihm einige Beispiele aus Bild, Frage und Antwort, und es verallgemeinert ohne Fine-Tuning auf ein neues Bild.
Auf VQA-RAD, PathVQA und dem neuen Benchmark Visual USMLE bewerteten Kliniker die generierten Antworten von Med-Flamingo besser als die der Vergleichsmodelle. Die Autoren betonen jedoch ausdrücklich, dass es sich um einen frühen Forschungsprototyp handelt, der halluzinieren kann und nicht für den klinischen Einsatz geeignet ist.
Veröffentlicht im Juli 2023 von Forschenden aus Stanford und Partnern (Moor et al., 2023)
Offene Gewichte auf GitHub / Hugging Face für die Forschung; basiert auf OpenFlamingo-9B
In-Context-Lernen für medizinische Bilder
Few-Shot-Fragebeantwortung zu medizinischen Bildern
Verschränkte Bild- und Texteingaben in einem Prompt
Generative Freitextantworten statt nur Multiple Choice
Vortrainiert auf medizinischen Lehrbüchern und Abbildungen aus PubMed Central
Basiert auf OpenFlamingo-9B (Sprach-Backbone LLaMA-7B)
Evaluiert auf VQA-RAD, PathVQA und Visual USMLE
Evaluationsprotokoll mit Bewertung durch Kliniker
Offene Forschungsgewichte
Evaluation gemäß dem Med-Flamingo-Paper; Kliniker bewerteten die generierten Antworten, statt eine einzelne Genauigkeitszahl zu verwenden
Visuelle Fragebeantwortung in der Radiologie mit In-Context-Beispielen
Fragebeantwortung zu Pathologiebildern
Fragen im USMLE-Stil, die das Betrachten eines Bildes erfordern; mit dem Paper eingeführt
Fachexperten bevorzugten im Durchschnitt die Antworten von Med-Flamingo gegenüber den verglichenen Baselines
In-Context-Lernen für medizinische Bilder mit einem offenen Modell untersuchen.
Freitextfragen zu einem medizinischen Bild zur Überprüfung durch Kliniker beantworten.
Bildbasiertes Üben im USMLE-Stil mit Erklärungen.
Forschungscode und Gewichte der Autoren
Code und Gewichte sind im GitHub-Repository der Autoren und auf Hugging Face veröffentlicht; zusätzlich benötigen Sie die Basisgewichte von OpenFlamingo und LLaMA-7B.
Erstellen Sie einen Prompt aus einigen Beispielen mit Bild, Frage und Antwort, gefolgt vom neuen Bild und der Frage.
Planen Sie Datenschutz, Validierung und menschliche Aufsicht ein, bevor Med-Flamingo auch nur in die Nähe von Patientendaten kommt.
Med-Flamingo ist ein Forschungsmodell. Seine Ausgaben müssen vor jeder klinischen Verwendung von qualifizierten medizinischen Fachkräften überprüft werden.
Das Modell ist kein behördlich freigegebenes oder zugelassenes Medizinprodukt. Stellen Sie vor dem Einsatz die Einhaltung der lokalen Gesundheitsvorschriften und Datenschutzbestimmungen (z. B. HIPAA, GDPR) sicher.
Die auf dieser Seite beschriebenen Modelle sind Forschungswerkzeuge für die klinische Bildgebung. Wenn Sie ein alltägliches Foto haben – einen Ausschlag, ein Muttermal, einen Nagel, eine Wunde –, liest AI Doctor Scan es aus und liefert in etwa 30 Sekunden kostenlos eine Dringlichkeitsstufe und eine Zusammenfassung in verständlicher Sprache. Es nennt keine Diagnose und benötigt kein Konto.
AI Doctor Scan kostenlos ausprobierenWas Few-Shot-Lernen verändert
Few-Shot-Medizin-VQA aus Stanford
Forschung zu In-Context-Lernen und generativer medizinischer VQA
Der Vergleich
Wählen Sie nach Modalität (Text oder Bild), Lizenz und der tatsächlich verfügbaren Hardware
Häufige Fragen zu Med-Flamingo
Michael Moor und Kollegen an der Stanford University gemeinsam mit Partnern (2023). Es ist kein Google-Modell.
Sie fügen einige Beispiel-Tripel aus Bild, Frage und Antwort in den Prompt ein; das Modell beantwortet dann Fragen zu einem neuen Bild ganz ohne Fine-Tuning.
Auf OpenFlamingo-9B, einer offenen Neuimplementierung der Flamingo-Architektur von DeepMind mit einem LLaMA-7B-Sprach-Backbone.
Nein. Die Autoren beschreiben es als frühen Forschungsprototyp, der halluzinieren kann; es darf nicht für die Patientenversorgung verwendet werden.
Die Demo nutzt den multimodalen medizinischen Assistenten von Dr7.ai, um Fragebeantwortung zu Bildern zu zeigen. Für das Originalmodell führen Sie den Code der Autoren aus.