프로 플랜 30% 할인신청
Medical AI Background

BiomedLM

Stanford CRFM 2.7B 생의학 언어 모델

Dr7.ai 의료 AI 플랫폼 제공

BioMedLM(구 PubMedGPT)은 Stanford CRFM과 MosaicML이 PubMed 초록과 전문 논문만으로 학습시킨 27억 파라미터 규모의 GPT 방식 언어 모델입니다. 작은 도메인 특화 모델도 생의학 질의응답에서 훨씬 큰 범용 모델에 필적할 수 있음을 보여 주었습니다.

🧪
2.7B
의료 AI 모델
Stanford
CRFM
Stanford CRFM & MosaicML
생의학 NLP

BioMedLM 스타일 생의학 Q&A 체험

생의학 문헌, 기전, 용어에 대해 질문해 보세요. 도메인 특화 학습을 거친 언어 모델이 내놓는 PubMed 기반 답변의 예를 데모로 확인할 수 있습니다.

BiomedLM 데모

첨단 의료 AI를 경험하세요

0/3 messages

의료 상담 시작

복잡한 의료 질문을 하거나 임상 추론 지원을 요청하세요

BiomedLM 전체 잠재력 잠금 해제

문헌 중심 워크플로를 위한 무제한 생의학 Q&A, 더 긴 컨텍스트, API 접근을 이용하세요.

2.7B
Parameters
PubMed
Training Corpus
10+
AI Models Available
프로로 업그레이드→

BioMedLM이란?

BiomedLM — Stanford Center for Research on Foundation Models(CRFM)가 MosaicML과 함께 개발한 27억 파라미터 규모의 자기회귀 언어 모델입니다. 2022년 12월 PubMedGPT라는 이름으로 처음 공개된 뒤 BioMedLM으로 이름이 바뀌었습니다.

다른 데이터 속에서 생의학 텍스트를 일부만 접하는 범용 모델과 달리, BioMedLM은 PubMed 초록과 PubMed Central 전문 논문(The Pile의 PubMed 부분, 약 500억 토큰)만으로 처음부터 학습되었습니다. 이러한 집중 덕분에 비교적 작은 모델임에도 파인튜닝 후 MedQA(USMLE)에서 약 50%, PubMedQA에서 74%에 도달했으며, 이는 공개 당시 50배 큰 모델과 견줄 만한 결과였습니다.

BioMedLM은 오픈 가중치이며 단일 GPU로 파인튜닝할 수 있을 만큼 작아, 생의학 정보 추출·요약·질의응답 연구에서 널리 쓰이는 베이스가 되었습니다. 임상 제품이 아닌 연구용 산출물이며, 환자 대상 사용을 위한 것이 아닙니다.

🧬

최신 동향

2022년 12월 Stanford CRFM과 MosaicML이 PubMedGPT로 공개, 2023년 BioMedLM으로 개명(논문: Bolton et al., 2024)

2.7B
Parameters

Hugging Face에 오픈 가중치 공개(stanford-crfm/BioMedLM), PubMed 텍스트 300B 토큰으로 학습

주요 특징

생의학 문헌만으로 학습한 소형 모델

핵심 기능

2.7B 파라미터 — GPU 한 대로 파인튜닝 가능

PubMed 초록과 PMC 전문만으로 학습

생의학 질의응답(MedQA, PubMedQA, MedMCQA)

문헌 요약 및 정보 추출

파인튜닝을 통한 생의학 개체 및 관계 추출

맞춤형 생의학 토크나이저를 갖춘 GPT-2 방식 아키텍처

연구용 오픈 가중치

범용 LLM 대비 높은 파라미터당 효율

성능 벤치마크

파인튜닝된 2.7B 모델에 대해 Stanford CRFM / MosaicML이 보고한 결과

MedQA (USMLE)

50.3%

미국 의사 면허 시험(USMLE) 형식의 4지선다 문제

PubMedQA

74.4%

PubMed 초록 기반의 예/아니요/아마도 형식 문제

MedMCQA

경쟁력 있음

인도 의대 입학시험 문제, BioMedLM 논문에서 보고

모델 크기

2.7B

범용 LLM의 일부에 불과한 파라미터로 이 점수를 달성

사용 사례

🔬

생의학 연구

논문 요약, 개체 추출, 문헌 기반 가설 생성을 수행합니다.

📚

문헌 분석

PubMed 형식 텍스트에 근거한 질의응답과 요약.

💊

의학 교육

시험 형식의 생의학 문제에 답하고 그 밑바탕이 되는 기전을 설명합니다.

BioMedLM 사용 방법

단일 GPU에 들어가는 오픈 가중치

1

가중치 받기

transformers로 Hugging Face에서 stanford-crfm/BioMedLM을 불러옵니다. 베이스 모델은 일반 언어 모델이므로 작업에 맞게 파인튜닝하세요.

2

통합 옵션

BioMedLM은 작업별 파인튜닝의 베이스로 활용할 때 가장 유용합니다.

  • • 생의학 QA 또는 분류용 파인튜닝
  • • 개체명 및 관계 추출
  • • 초록 요약 파이프라인
  • • 검색용 도메인 적응 임베딩
3

배포 시 고려 사항

BioMedLM을 환자 데이터를 다루는 환경에 도입하기 전에 개인정보 보호, 검증, 사람의 감독을 계획하십시오.

  • • 데이터를 비식별화하고 HIPAA / GDPR을 준수합니다
  • • 사용 전에 자체 기관 데이터로 검증합니다
  • • 모든 출력에 대해 면허를 가진 임상의가 검토하도록 합니다
  • • 감사자를 위해 한계와 의도된 용도를 문서화합니다

중요 고려 사항

임상 검증 필요

BioMedLM은 연구용 모델입니다. 임상에 사용하기 전에 반드시 자격을 갖춘 의료 전문가가 출력을 검토해야 합니다.

규제 준수

이 모델은 규제 당국의 허가 또는 승인을 받은 의료기기가 아닙니다. 배포 전에 현지 의료 규정과 데이터 보호 규칙(예: HIPAA, GDPR)을 준수하는지 확인하십시오.

BioMedLM과 다른 의료 언어 모델 비교

소형·특화형 대 대형·범용형

🧬

BioMedLM

Stanford CRFM의 2.7B 모델

  • ✓생의학 문헌만으로 학습
  • ✓단일 GPU로 실행 및 파인튜닝 가능
  • ✓오픈 가중치로 내부를 완전히 검토 가능
  • ✓크기 대비 경쟁력 있는 MedQA / PubMedQA 점수
  • ✓맞춤형 생의학 토크나이저
  • ✓잘 문서화된 학습 방법

제한된 하드웨어에서 파인튜닝 가능한 생의학 베이스 모델이 필요한 연구 그룹

🤖

기타 의료 AI 모델

비교

  • ×범용 LLM(GPT-4, Gemini)은 개방형 추론에 더 강하지만 폐쇄형이며 비용이 높음
  • ×더 큰 오픈 모델(Meditron-70B, MedGemma-27B)은 훨씬 많은 GPU 메모리가 필요함
  • ×텍스트 전용 모델은 이미지를 볼 수 없음
  • ×이미지 전용 분류기는 소견을 언어로 설명할 수 없음
  • ×상용 제품은 검증되었지만 내부를 들여다볼 수 없음
  • ×대부분의 대안은 재현 가능한 벤치마크를 적게 공개함

모달리티(텍스트 대 이미지), 라이선스, 실제 보유한 하드웨어를 기준으로 선택하세요

자주 묻는 질문

BioMedLM에 관한 자주 묻는 질문

BioMedLM은 누가 개발했나요?

Stanford CRFM(Center for Research on Foundation Models)이 MosaicML과 함께 개발했습니다. 2022년 12월 PubMedGPT라는 이름으로 처음 공개되었습니다.

BioMedLM의 규모는 어느 정도인가요?

27억 파라미터입니다. GPU 한 대로 파인튜닝할 수 있을 만큼 작다는 점이 이 프로젝트의 핵심입니다.

BioMedLM은 의학 시험에서 어떤 점수를 받았나요?

Stanford CRFM 발표에 따르면 파인튜닝 후 MedQA(USMLE)에서 약 50.3%, PubMedQA에서 74.4%입니다.

BioMedLM을 임상 제품에 사용할 수 있나요?

가중치는 연구용으로 공개되어 있습니다. 의료기기가 아니며, 저자들은 검증 없이 환자 대상으로 사용하지 않도록 명시적으로 경고하고 있습니다.

이 데모는 BioMedLM 자체를 실행하나요?

데모는 Dr7.ai의 의료 어시스턴트를 사용해 PubMed 형식의 생의학 Q&A를 보여 줍니다. 결과를 그대로 재현하려면 오픈 가중치를 로컬에서 실행하세요.