
由 Dr7.ai 醫療 AI 平台提供支援
Med-Flamingo 是 Stanford 研究人員推出的醫學多模態少樣本學習模型。它基於 OpenFlamingo-9B 建構,並在醫學教科書和 PubMed Central 的圖文交錯資料上進行預訓練,只需看過少量範例,就能回答關於一張新醫學影像的問題。
上傳一張醫學影像並就其提問——本示範展示了 Med-Flamingo 為醫學領域引入的圖文交錯推理方式。
獲得無限次影像問答、更高的上傳上限,以及用於多模態醫學研究的 API 存取。
Med-Flamingo 是一款醫學視覺-語言模型,由 Stanford University 的 Michael Moor 及其同事與合作者於 2023 年發布(Moor et al.,"Med-Flamingo: a Multimodal Medical Few-shot Learner")。它將 OpenFlamingo-9B(DeepMind Flamingo 的公開重現版本)適配到了醫學領域。
該模型在醫學教科書的圖文交錯序列(MTB 資料集)和 PMC-OA 圖片-圖注對上進行了繼續預訓練。由於它能在同一上下文中處理交錯的影像和文字,因此支援上下文(「少樣本」)學習:給它看幾個影像-問題-答案範例,它無需微調即可泛化到新影像。
在 VQA-RAD、PathVQA 和新的 Visual USMLE 基準上,臨床醫師對 Med-Flamingo 生成式答案的評分高於基線模型,但作者明確指出,它只是一個可能產生幻覺的早期研究原型,不適合臨床使用。
2023 年 7 月由 Stanford 研究人員及合作者發布(Moor et al., 2023)
權重已在 GitHub / Hugging Face 開放供研究使用;基於 OpenFlamingo-9B
面向醫學影像的上下文學習
少樣本醫學視覺問答
在同一提示中交錯輸入影像和文字
生成式(自由文字)回答,而不僅是選擇題
基於醫學教科書和 PubMed Central 圖片進行預訓練
基於 OpenFlamingo-9B 建構(LLaMA-7B 語言骨幹)
在 VQA-RAD、PathVQA 和 Visual USMLE 上接受評估
由臨床醫師評分的評估方案
開放的研究權重
Med-Flamingo 論文中所述的評估方式:由臨床醫師對生成式答案評分,而非給出單一準確率
藉助上下文範例的放射學視覺問答
病理影像問答
需要結合影像作答的 USMLE 風格題目,隨論文一同推出
平均而言,人類專家更傾向於 Med-Flamingo 的答案,而非所比較的基線模型
藉助開放模型研究醫學影像的上下文學習。
針對醫學影像回答自由文字問題,供臨床醫師審閱。
基於影像的 USMLE 風格練習,並附帶解析。
作者發布的研究程式碼與權重
程式碼和權重發布在作者的 GitHub 儲存庫和 Hugging Face 上;您還需要 OpenFlamingo 和 LLaMA-7B 的基礎權重。
先在提示中放入幾個影像-問題-答案範例,再附上新影像和問題。
在讓 Med-Flamingo 接觸任何患者資料之前,請先規劃好隱私保護、驗證和人工監督。
Med-Flamingo 是研究模型。在任何臨床使用之前,其輸出必須經合格的醫療專業人員審核。
該模型並非經主管機關許可或核准的醫療器材。部署前請確保符合當地醫療法規和資料保護規定(如 HIPAA、GDPR)。
少樣本學習帶來的改變
Stanford 少樣本醫學 VQA
上下文學習與生成式醫學 VQA 研究
與其他模型比較
請根據模態(文字或影像)、授權條款以及您實際擁有的硬體進行選擇
關於 Med-Flamingo 的常見問題
由 Stanford University 的 Michael Moor 及其同事與合作者開發(2023 年)。它不是 Google 的模型。
在提示中放入幾組影像-問題-答案範例,模型隨後無需任何微調即可回答關於新影像的問題。
OpenFlamingo-9B——DeepMind Flamingo 架構的公開重現版本,採用 LLaMA-7B 作為語言骨幹。
不可以。作者將其描述為可能產生幻覺的早期研究原型;絕不能用於患者診療。
本示範使用 Dr7.ai 的多模態醫療助手來展示影像問答。如需使用原版模型,請執行作者發布的程式碼。