Pro版本30%折扣立即获取
Medical AI Background

Med-Flamingo

少样本医学视觉问答

由 Dr7.ai 医疗 AI 平台提供支持

Med-Flamingo 是 Stanford 研究人员推出的医学多模态少样本学习模型。它基于 OpenFlamingo-9B 构建,并在医学教科书和 PubMed Central 的图文交错数据上进行预训练,只需看过少量示例,就能回答关于一张新医学图像的问题。

✨
VQA
医疗 AI 模型
Few-Shot
Learning
Stanford University
多模态少样本

体验 Med-Flamingo 风格的视觉问答

上传一张医学图像并就其提问——本演示展示了 Med-Flamingo 为医学领域引入的图文交错推理方式。

Med-Flamingo 演示

体验先进的医疗 AI

0/3 messages

开始医疗咨询

提出复杂的医学问题或寻求临床推理方面的帮助

释放 Med-Flamingo 的全部潜力

获得无限次图像问答、更高的上传上限,以及用于多模态医学研究的 API 访问。

VQA
Visual Q&A
少样本
Few-shot Accuracy
10+
AI Models Available
升级到 Pro→

什么是 Med-Flamingo?

Med-Flamingo 是一款医学视觉-语言模型,由 Stanford University 的 Michael Moor 及其同事与合作者于 2023 年发布(Moor et al.,"Med-Flamingo: a Multimodal Medical Few-shot Learner")。它将 OpenFlamingo-9B(DeepMind Flamingo 的公开复现版本)适配到了医学领域。

该模型在医学教科书的图文交错序列(MTB 数据集)和 PMC-OA 图片-图注对上进行了继续预训练。由于它能在同一上下文中处理交错的图像和文本,因此支持上下文(“少样本”)学习:给它看几个图像-问题-答案示例,它无需微调即可泛化到新图像。

在 VQA-RAD、PathVQA 和新的 Visual USMLE 基准上,临床医生对 Med-Flamingo 生成式答案的评分高于基线模型,但作者明确指出,它只是一个可能产生幻觉的早期研究原型,不适合临床使用。

🦩

最新进展

2023 年 7 月由 Stanford 研究人员及合作者发布(Moor et al., 2023)

Few-shot
Learning

权重已在 GitHub / Hugging Face 开放供研究使用;基于 OpenFlamingo-9B

核心特性

面向医学图像的上下文学习

核心能力

少样本医学视觉问答

在同一提示中交错输入图像和文本

生成式(自由文本)回答,而不仅是多项选择

基于医学教科书和 PubMed Central 图片进行预训练

基于 OpenFlamingo-9B 构建(LLaMA-7B 语言骨干)

在 VQA-RAD、PathVQA 和 Visual USMLE 上接受评估

由临床医生评分的评估方案

开放的研究权重

性能基准

Med-Flamingo 论文中所述的评估方式:由临床医生对生成式答案打分,而非给出单一准确率

VQA-RAD

少样本

借助上下文示例的放射学视觉问答

PathVQA

少样本

病理图像问答

Visual USMLE

新基准

需要结合图像作答的 USMLE 风格题目,随论文一同推出

临床医生评分

优于基线

平均而言,人类专家更倾向于 Med-Flamingo 的答案,而非对比的基线模型

应用场景

🔬

多模态研究

借助开放模型研究医学图像的上下文学习。

🏥

基于图像的问答

针对医学图像回答自由文本问题,供临床医生审阅。

🎓

医学教育

基于图像的 USMLE 风格练习,并附带解析。

如何使用 Med-Flamingo

作者发布的研究代码与权重

1

获取模型

代码和权重发布在作者的 GitHub 仓库和 Hugging Face 上;您还需要 OpenFlamingo 和 LLaMA-7B 的基础权重。

2

集成方式

先在提示中放入几个图像-问题-答案示例,再附上新图像和问题。

  • • 放射影像的少样本 VQA
  • • 病理图像的少样本 VQA
  • • Visual USMLE 风格问答
  • • 多模态医学研究的基线模型
3

部署注意事项

在让 Med-Flamingo 接触任何患者数据之前,请先规划好隐私保护、验证和人工监督。

  • • 对数据去标识化,并遵守 HIPAA / GDPR
  • • 使用前先在本机构的数据上进行验证
  • • 每一项输出都须由执业临床医生参与审核
  • • 为审计人员记录局限性和预期用途

重要注意事项

须经临床验证

Med-Flamingo 是研究模型。在任何临床使用之前,其输出必须经合格的医疗专业人员审核。

法规合规

该模型并非已获监管许可或批准的医疗器械。部署前请确保符合当地医疗法规和数据保护规定(如 HIPAA、GDPR)。

Med-Flamingo 与其他医学多模态模型对比

少样本学习带来的改变

🦩

Med-Flamingo

Stanford 少样本医学 VQA

  • ✓仅凭几个示例即可适应新的图像任务
  • ✓图文交错式提示
  • ✓生成自由文本答案
  • ✓开放的研究权重
  • ✓推出了 Visual USMLE 基准
  • ✓由临床医生评分的评估

上下文学习与生成式医学 VQA 研究

🤖

其他医疗 AI 模型

对比情况

  • ×通用 LLM(GPT-4、Gemini)开放式推理能力更强,但闭源且成本高
  • ×更大的开放模型(Meditron-70B、MedGemma-27B)需要多得多的 GPU 显存
  • ×纯文本模型无法查看图像
  • ×纯图像分类器无法用语言解释其发现
  • ×商业产品经过验证,但无法审查其内部
  • ×大多数替代方案公布的可复现基准较少

请根据模态(文本或图像)、许可证以及您实际拥有的硬件进行选择

常见问题

关于 Med-Flamingo 的常见问题

Med-Flamingo 是由谁开发的?

由 Stanford University 的 Michael Moor 及其同事与合作者开发(2023 年)。它不是 Google 的模型。

这里的“少样本”是什么意思?

在提示中放入几组图像-问题-答案示例,模型随后无需任何微调即可回答关于新图像的问题。

Med-Flamingo 基于什么构建?

OpenFlamingo-9B——DeepMind Flamingo 架构的公开复现版本,采用 LLaMA-7B 作为语言骨干。

Med-Flamingo 可以安全地用于临床吗?

不可以。作者将其描述为可能产生幻觉的早期研究原型;绝不能用于患者诊疗。

本演示运行的是 Med-Flamingo 本身吗?

本演示使用 Dr7.ai 的多模态医疗助手来展示图像问答。如需使用原版模型,请运行作者发布的代码。