Proプラン30%オフ申し込む
Medical AI Background

Med-Flamingo

Few-shot 医療ビジュアル質問応答

Dr7.ai 医療AIプラットフォーム提供

Med-Flamingo は、Stanford の研究者らによる医療向けのマルチモーダル few-shot 学習モデルです。OpenFlamingo-9B をベースに、医学教科書と PubMed Central の画像・テキストが交互に並んだデータで事前学習されており、わずかな例を見るだけで新しい医療画像に関する質問に回答できます。

✨
VQA
医療AIモデル
Few-Shot
Learning
Stanford University
マルチモーダル Few-shot

Med-Flamingo スタイルのビジュアル質問応答を試す

医療画像をアップロードして質問してみてください。Med-Flamingo が医療分野に導入した、画像とテキストを交互に扱う推論の例をデモでご覧いただけます。

Med-Flamingo デモ

先進の医療AIを体験

0/3 messages

医療相談を始める

複雑な医療の質問や臨床推論のサポートを求めることができます

Med-Flamingo の可能性を最大限に引き出す

マルチモーダル医療研究向けに、無制限の画像質問応答、より高いアップロード上限、APIアクセスをご利用いただけます。

VQA
Visual Q&A
フューショット
Few-shot Accuracy
10+
AI Models Available
Proにアップグレード→

Med-Flamingo とは?

Med-Flamingo は、2023年に Stanford の Michael Moor らが共同研究者とともに公開した医療向け視覚言語モデルです(Moor et al., "Med-Flamingo: a Multimodal Medical Few-shot Learner")。DeepMind の Flamingo をオープンに再実装した OpenFlamingo-9B を医療ドメインに適応させています。

このモデルは、医学教科書(MTB データセット)の画像・テキスト交互シーケンスと PMC-OA の図とキャプションのペアで継続事前学習されています。画像とテキストを1つのコンテキスト内で交互に受け取るため、インコンテキスト(few-shot)学習が可能です。画像・質問・回答の例をいくつか示すだけで、ファインチューニングなしに新しい画像へ汎化します。

VQA-RAD、PathVQA、および新たな Visual USMLE ベンチマークにおいて、臨床医は Med-Flamingo の生成回答をベースラインより高く評価しました。ただし著者らは、本モデルがハルシネーションを起こし得る初期の研究プロトタイプであり、臨床利用には適さないと明言しています。

🦩

最新の動向

2023年7月に Stanford の研究者と共同研究者が公開(Moor et al., 2023)

Few-shot
Learning

研究向けに GitHub / Hugging Face でオープンウェイトを公開。OpenFlamingo-9B がベース

主な特長

医療画像のためのインコンテキスト学習

コア機能

Few-shot 医療ビジュアル質問応答

1つのプロンプト内で画像とテキストを交互に入力

選択式だけでなく、生成型(自由記述)の回答

医学教科書と PubMed Central の図で事前学習

OpenFlamingo-9B(LLaMA-7B 言語バックボーン)がベース

VQA-RAD、PathVQA、Visual USMLE で評価

臨床医による評価プロトコル

研究用オープンウェイト

性能ベンチマーク

Med-Flamingo 論文に記載の評価。単一の正答率ではなく、臨床医が生成回答を採点

VQA-RAD

フューショット

インコンテキスト例を用いた放射線画像のビジュアル質問応答

PathVQA

フューショット

病理画像の質問応答

Visual USMLE

新ベンチマーク

画像の読み取りを必要とする USMLE 形式の問題。論文とともに導入

臨床医による評価

ベースライン比で優位

専門家は平均して、比較対象のベースラインよりも Med-Flamingo の回答を好んだ

ユースケース

🔬

マルチモーダル研究

オープンモデルで医療画像のインコンテキスト学習を研究します。

🏥

画像に基づくQ&A

医療画像に関する自由記述の質問に回答し、臨床医のレビューに供します。

🎓

医学教育

画像を用いた USMLE 形式の演習と解説。

Med-Flamingo の使い方

著者らによる研究用コードとウェイト

1

モデルを入手

コードとウェイトは著者らの GitHub リポジトリと Hugging Face で公開されています。OpenFlamingo と LLaMA-7B のベースウェイトも必要です。

2

統合オプション

画像・質問・回答の例をいくつか並べ、その後に新しい画像と質問を続けたプロンプトを作成します。

  • • 放射線画像での Few-shot VQA
  • • 病理画像での Few-shot VQA
  • • Visual USMLE 形式の質問応答
  • • マルチモーダル医療研究のベースライン
3

デプロイ時の考慮事項

Med-Flamingo を患者データに関わる場面で使う前に、プライバシー、検証、人による監督を計画してください。

  • • データを匿名化し、HIPAA / GDPR に準拠する
  • • 使用前に自施設のデータで検証する
  • • すべての出力について資格を持つ臨床医が確認する体制を保つ
  • • 監査に向けて制限事項と想定用途を文書化する

重要な考慮事項

臨床検証が必要

Med-Flamingo は研究用モデルです。臨床で使用する前に、その出力を資格のある医療専門家が確認する必要があります。

規制への準拠

本モデルは規制当局の認可・承認を受けた医療機器ではありません。デプロイ前に、現地の医療規制およびデータ保護規則(HIPAA、GDPR など)への準拠を確認してください。

Med-Flamingo と他の医療マルチモーダルモデルの比較

Few-shot 学習がもたらす変化

🦩

Med-Flamingo

Stanford の Few-shot 医療VQA

  • ✓少数の例から新しい画像タスクに適応
  • ✓画像とテキストを交互に配置するプロンプト
  • ✓自由記述の生成型回答
  • ✓研究用オープンウェイト
  • ✓Visual USMLE ベンチマークを導入
  • ✓臨床医による評価

インコンテキスト学習と生成型医療VQAの研究

🤖

その他の医療AIモデル

比較

  • ×汎用LLM(GPT-4、Gemini)は自由形式の推論に強いが、クローズドで高コスト
  • ×より大規模なオープンモデル(Meditron-70B、MedGemma-27B)ははるかに多くのGPUメモリを必要とする
  • ×テキスト専用モデルは画像を見ることができない
  • ×画像専用の分類器は所見を言葉で説明できない
  • ×商用製品は検証済みだが、内部を確認できない
  • ×多くの代替モデルは再現可能なベンチマークの公開が少ない

モダリティ(テキストか画像か)、ライセンス、実際に使えるハードウェアで選びましょう

よくある質問

Med-Flamingo に関するよくある質問

Med-Flamingo は誰が開発しましたか?

Stanford University の Michael Moor らが共同研究者とともに開発しました(2023年)。Google のモデルではありません。

ここでいう「few-shot」とは?

プロンプトに画像・質問・回答の例をいくつか含めると、モデルはファインチューニングなしで新しい画像について回答します。

Med-Flamingo は何をベースにしていますか?

OpenFlamingo-9B です。これは DeepMind の Flamingo アーキテクチャをオープンに再実装したもので、LLaMA-7B を言語バックボーンとしています。

Med-Flamingo を臨床で安全に使えますか?

いいえ。著者らはハルシネーションを起こし得る初期の研究プロトタイプと説明しており、患者ケアに使用してはなりません。

このデモでは Med-Flamingo そのものが動いていますか?

デモでは Dr7.ai のマルチモーダル医療アシスタントを使って、画像の質問応答をお見せしています。元のモデルそのものを使うには、著者らのコードを実行してください。