
Dr7.ai 医療AIプラットフォーム提供
Med-Flamingo は、Stanford の研究者らによる医療向けのマルチモーダル few-shot 学習モデルです。OpenFlamingo-9B をベースに、医学教科書と PubMed Central の画像・テキストが交互に並んだデータで事前学習されており、わずかな例を見るだけで新しい医療画像に関する質問に回答できます。
医療画像をアップロードして質問してみてください。Med-Flamingo が医療分野に導入した、画像とテキストを交互に扱う推論の例をデモでご覧いただけます。
マルチモーダル医療研究向けに、無制限の画像質問応答、より高いアップロード上限、APIアクセスをご利用いただけます。
Med-Flamingo は、2023年に Stanford の Michael Moor らが共同研究者とともに公開した医療向け視覚言語モデルです(Moor et al., "Med-Flamingo: a Multimodal Medical Few-shot Learner")。DeepMind の Flamingo をオープンに再実装した OpenFlamingo-9B を医療ドメインに適応させています。
このモデルは、医学教科書(MTB データセット)の画像・テキスト交互シーケンスと PMC-OA の図とキャプションのペアで継続事前学習されています。画像とテキストを1つのコンテキスト内で交互に受け取るため、インコンテキスト(few-shot)学習が可能です。画像・質問・回答の例をいくつか示すだけで、ファインチューニングなしに新しい画像へ汎化します。
VQA-RAD、PathVQA、および新たな Visual USMLE ベンチマークにおいて、臨床医は Med-Flamingo の生成回答をベースラインより高く評価しました。ただし著者らは、本モデルがハルシネーションを起こし得る初期の研究プロトタイプであり、臨床利用には適さないと明言しています。
2023年7月に Stanford の研究者と共同研究者が公開(Moor et al., 2023)
研究向けに GitHub / Hugging Face でオープンウェイトを公開。OpenFlamingo-9B がベース
医療画像のためのインコンテキスト学習
Few-shot 医療ビジュアル質問応答
1つのプロンプト内で画像とテキストを交互に入力
選択式だけでなく、生成型(自由記述)の回答
医学教科書と PubMed Central の図で事前学習
OpenFlamingo-9B(LLaMA-7B 言語バックボーン)がベース
VQA-RAD、PathVQA、Visual USMLE で評価
臨床医による評価プロトコル
研究用オープンウェイト
Med-Flamingo 論文に記載の評価。単一の正答率ではなく、臨床医が生成回答を採点
インコンテキスト例を用いた放射線画像のビジュアル質問応答
病理画像の質問応答
画像の読み取りを必要とする USMLE 形式の問題。論文とともに導入
専門家は平均して、比較対象のベースラインよりも Med-Flamingo の回答を好んだ
オープンモデルで医療画像のインコンテキスト学習を研究します。
医療画像に関する自由記述の質問に回答し、臨床医のレビューに供します。
画像を用いた USMLE 形式の演習と解説。
著者らによる研究用コードとウェイト
コードとウェイトは著者らの GitHub リポジトリと Hugging Face で公開されています。OpenFlamingo と LLaMA-7B のベースウェイトも必要です。
画像・質問・回答の例をいくつか並べ、その後に新しい画像と質問を続けたプロンプトを作成します。
Med-Flamingo を患者データに関わる場面で使う前に、プライバシー、検証、人による監督を計画してください。
Med-Flamingo は研究用モデルです。臨床で使用する前に、その出力を資格のある医療専門家が確認する必要があります。
本モデルは規制当局の認可・承認を受けた医療機器ではありません。デプロイ前に、現地の医療規制およびデータ保護規則(HIPAA、GDPR など)への準拠を確認してください。
Few-shot 学習がもたらす変化
Stanford の Few-shot 医療VQA
インコンテキスト学習と生成型医療VQAの研究
比較
モダリティ(テキストか画像か)、ライセンス、実際に使えるハードウェアで選びましょう
Med-Flamingo に関するよくある質問
Stanford University の Michael Moor らが共同研究者とともに開発しました(2023年)。Google のモデルではありません。
プロンプトに画像・質問・回答の例をいくつか含めると、モデルはファインチューニングなしで新しい画像について回答します。
OpenFlamingo-9B です。これは DeepMind の Flamingo アーキテクチャをオープンに再実装したもので、LLaMA-7B を言語バックボーンとしています。
いいえ。著者らはハルシネーションを起こし得る初期の研究プロトタイプと説明しており、患者ケアに使用してはなりません。
デモでは Dr7.ai のマルチモーダル医療アシスタントを使って、画像の質問応答をお見せしています。元のモデルそのものを使うには、著者らのコードを実行してください。