
Dr7.ai 医療AIプラットフォーム提供
BioMedLM(旧称 PubMedGPT)は、Stanford CRFM と MosaicML が PubMed の抄録と全文論文のみで学習させた、27億パラメータの GPT 型言語モデルです。小規模なドメイン特化モデルでも、生物医学の質問応答ではるかに大きな汎用モデルに匹敵し得ることを示しました。
生物医学文献、メカニズム、用語について質問してみてください。ドメイン特化で学習した言語モデルが生成する、PubMed に基づく回答の例をデモでご覧いただけます。
先進の医療AIを体験
文献中心のワークフロー向けに、無制限の生物医学Q&A、より長いコンテキスト、APIアクセスをご利用いただけます。
BiomedLM は、Stanford Center for Research on Foundation Models(CRFM)が MosaicML と共同で開発した、27億パラメータの自己回帰型言語モデルです。2022年12月に PubMedGPT として初公開され、その後 BioMedLM に改称されました。
大量のデータの中でわずかな生物医学テキストしか目にしない汎用モデルとは異なり、BioMedLM は PubMed の抄録と PubMed Central の全文論文(The Pile の PubMed 部分、約500億トークン)のみでゼロから学習されました。この特化により、比較的小さなモデルでありながら、ファインチューニング後に MedQA(USMLE)で約50%、PubMedQA で74%に到達しました。これは公開当時、50倍の規模のモデルに匹敵する結果でした。
BioMedLM はオープンウェイトで、単一のGPUでファインチューニングできるほど小さいため、生物医学の情報抽出、要約、質問応答の研究で広く使われるベースとなりました。臨床製品ではなく研究成果物であり、患者向けの利用は想定されていません。
2022年12月に Stanford CRFM と MosaicML が PubMedGPT として公開、2023年に BioMedLM へ改称(論文:Bolton et al., 2024)
Hugging Face でオープンウェイトを公開(stanford-crfm/BioMedLM)。PubMed テキスト 300B トークンで学習
生物医学文献のみで学習した小規模モデル
2.7B パラメータ — 1台のGPUでファインチューニング可能
PubMed の抄録と PMC の全文のみで学習
生物医学の質問応答(MedQA、PubMedQA、MedMCQA)
文献の要約と情報抽出
ファインチューニングによる生物医学エンティティと関係の抽出
独自の生物医学トークナイザーを備えた GPT-2 型アーキテクチャ
研究用のオープンウェイト
汎用LLMと比べてパラメータあたりの効率が高い
ファインチューニング済み 2.7B モデルについて Stanford CRFM / MosaicML が報告した結果
米国医師国家試験(USMLE)形式の4択問題
PubMed 抄録に基づく yes/no/maybe 形式の問題
インドの医学部入試問題。BioMedLM の論文で報告
汎用LLMのごく一部のパラメータ数でこれらのスコアを達成
論文の要約、エンティティの抽出、文献からの仮説生成を行います。
PubMed 形式のテキストに基づく質問応答と要約。
試験形式の生物医学問題に回答し、その背景にあるメカニズムを説明します。
単一GPUに収まるオープンウェイト
transformers を使って Hugging Face から stanford-crfm/BioMedLM を読み込みます。ベースモデルは素の言語モデルなので、用途に合わせてファインチューニングしてください。
BioMedLM は、タスク特化のファインチューニングのベースとして最も有用です。
BioMedLM を患者データに関わる場面で使う前に、プライバシー、検証、人による監督を計画してください。
BioMedLM は研究用モデルです。臨床で使用する前に、その出力を資格のある医療専門家が確認する必要があります。
本モデルは規制当局の認可・承認を受けた医療機器ではありません。デプロイ前に、現地の医療規制およびデータ保護規則(HIPAA、GDPR など)への準拠を確認してください。
小規模・特化型 vs 大規模・汎用型
Stanford CRFM の 2.7B モデル
限られたハードウェアでファインチューニング可能な生物医学ベースモデルを必要とする研究グループ
比較
モダリティ(テキストか画像か)、ライセンス、実際に使えるハードウェアで選びましょう
BioMedLM に関するよくある質問
Stanford CRFM(Center for Research on Foundation Models)が MosaicML と共同で開発しました。2022年12月に PubMedGPT として初めて公開されました。
27億パラメータです。1台のGPUでファインチューニングできる小ささこそが、このプロジェクトの狙いです。
Stanford CRFM の発表によると、ファインチューニング後に MedQA(USMLE)で約50.3%、PubMedQA で74.4%です。
ウェイトは研究向けに公開されています。医療機器ではなく、著者らは検証なしに患者向けに使用しないよう明確に注意を促しています。
デモでは Dr7.ai の医療アシスタントを使って、PubMed 形式の生物医学Q&Aをお見せしています。結果を厳密に再現するには、オープンウェイトをローカルで実行してください。