
由 Dr7.ai 医疗 AI 平台提供支持
Med-Flamingo 是 Stanford 研究人员推出的医学多模态少样本学习模型。它基于 OpenFlamingo-9B 构建,并在医学教科书和 PubMed Central 的图文交错数据上进行预训练,只需看过少量示例,就能回答关于一张新医学图像的问题。
上传一张医学图像并就其提问——本演示展示了 Med-Flamingo 为医学领域引入的图文交错推理方式。
获得无限次图像问答、更高的上传上限,以及用于多模态医学研究的 API 访问。
Med-Flamingo 是一款医学视觉-语言模型,由 Stanford University 的 Michael Moor 及其同事与合作者于 2023 年发布(Moor et al.,"Med-Flamingo: a Multimodal Medical Few-shot Learner")。它将 OpenFlamingo-9B(DeepMind Flamingo 的公开复现版本)适配到了医学领域。
该模型在医学教科书的图文交错序列(MTB 数据集)和 PMC-OA 图片-图注对上进行了继续预训练。由于它能在同一上下文中处理交错的图像和文本,因此支持上下文(“少样本”)学习:给它看几个图像-问题-答案示例,它无需微调即可泛化到新图像。
在 VQA-RAD、PathVQA 和新的 Visual USMLE 基准上,临床医生对 Med-Flamingo 生成式答案的评分高于基线模型,但作者明确指出,它只是一个可能产生幻觉的早期研究原型,不适合临床使用。
2023 年 7 月由 Stanford 研究人员及合作者发布(Moor et al., 2023)
权重已在 GitHub / Hugging Face 开放供研究使用;基于 OpenFlamingo-9B
面向医学图像的上下文学习
少样本医学视觉问答
在同一提示中交错输入图像和文本
生成式(自由文本)回答,而不仅是多项选择
基于医学教科书和 PubMed Central 图片进行预训练
基于 OpenFlamingo-9B 构建(LLaMA-7B 语言骨干)
在 VQA-RAD、PathVQA 和 Visual USMLE 上接受评估
由临床医生评分的评估方案
开放的研究权重
Med-Flamingo 论文中所述的评估方式:由临床医生对生成式答案打分,而非给出单一准确率
借助上下文示例的放射学视觉问答
病理图像问答
需要结合图像作答的 USMLE 风格题目,随论文一同推出
平均而言,人类专家更倾向于 Med-Flamingo 的答案,而非对比的基线模型
借助开放模型研究医学图像的上下文学习。
针对医学图像回答自由文本问题,供临床医生审阅。
基于图像的 USMLE 风格练习,并附带解析。
作者发布的研究代码与权重
代码和权重发布在作者的 GitHub 仓库和 Hugging Face 上;您还需要 OpenFlamingo 和 LLaMA-7B 的基础权重。
先在提示中放入几个图像-问题-答案示例,再附上新图像和问题。
在让 Med-Flamingo 接触任何患者数据之前,请先规划好隐私保护、验证和人工监督。
Med-Flamingo 是研究模型。在任何临床使用之前,其输出必须经合格的医疗专业人员审核。
该模型并非已获监管许可或批准的医疗器械。部署前请确保符合当地医疗法规和数据保护规定(如 HIPAA、GDPR)。
少样本学习带来的改变
Stanford 少样本医学 VQA
上下文学习与生成式医学 VQA 研究
对比情况
请根据模态(文本或图像)、许可证以及您实际拥有的硬件进行选择
关于 Med-Flamingo 的常见问题
由 Stanford University 的 Michael Moor 及其同事与合作者开发(2023 年)。它不是 Google 的模型。
在提示中放入几组图像-问题-答案示例,模型随后无需任何微调即可回答关于新图像的问题。
OpenFlamingo-9B——DeepMind Flamingo 架构的公开复现版本,采用 LLaMA-7B 作为语言骨干。
不可以。作者将其描述为可能产生幻觉的早期研究原型;绝不能用于患者诊疗。
本演示使用 Dr7.ai 的多模态医疗助手来展示图像问答。如需使用原版模型,请运行作者发布的代码。