
Dr7.ai 의료 AI 플랫폼 제공
BioMedLM(구 PubMedGPT)은 Stanford CRFM과 MosaicML이 PubMed 초록과 전문 논문만으로 학습시킨 27억 파라미터 규모의 GPT 방식 언어 모델입니다. 작은 도메인 특화 모델도 생의학 질의응답에서 훨씬 큰 범용 모델에 필적할 수 있음을 보여 주었습니다.
생의학 문헌, 기전, 용어에 대해 질문해 보세요. 도메인 특화 학습을 거친 언어 모델이 내놓는 PubMed 기반 답변의 예를 데모로 확인할 수 있습니다.
첨단 의료 AI를 경험하세요
문헌 중심 워크플로를 위한 무제한 생의학 Q&A, 더 긴 컨텍스트, API 접근을 이용하세요.
BiomedLM — Stanford Center for Research on Foundation Models(CRFM)가 MosaicML과 함께 개발한 27억 파라미터 규모의 자기회귀 언어 모델입니다. 2022년 12월 PubMedGPT라는 이름으로 처음 공개된 뒤 BioMedLM으로 이름이 바뀌었습니다.
다른 데이터 속에서 생의학 텍스트를 일부만 접하는 범용 모델과 달리, BioMedLM은 PubMed 초록과 PubMed Central 전문 논문(The Pile의 PubMed 부분, 약 500억 토큰)만으로 처음부터 학습되었습니다. 이러한 집중 덕분에 비교적 작은 모델임에도 파인튜닝 후 MedQA(USMLE)에서 약 50%, PubMedQA에서 74%에 도달했으며, 이는 공개 당시 50배 큰 모델과 견줄 만한 결과였습니다.
BioMedLM은 오픈 가중치이며 단일 GPU로 파인튜닝할 수 있을 만큼 작아, 생의학 정보 추출·요약·질의응답 연구에서 널리 쓰이는 베이스가 되었습니다. 임상 제품이 아닌 연구용 산출물이며, 환자 대상 사용을 위한 것이 아닙니다.
2022년 12월 Stanford CRFM과 MosaicML이 PubMedGPT로 공개, 2023년 BioMedLM으로 개명(논문: Bolton et al., 2024)
Hugging Face에 오픈 가중치 공개(stanford-crfm/BioMedLM), PubMed 텍스트 300B 토큰으로 학습
생의학 문헌만으로 학습한 소형 모델
2.7B 파라미터 — GPU 한 대로 파인튜닝 가능
PubMed 초록과 PMC 전문만으로 학습
생의학 질의응답(MedQA, PubMedQA, MedMCQA)
문헌 요약 및 정보 추출
파인튜닝을 통한 생의학 개체 및 관계 추출
맞춤형 생의학 토크나이저를 갖춘 GPT-2 방식 아키텍처
연구용 오픈 가중치
범용 LLM 대비 높은 파라미터당 효율
파인튜닝된 2.7B 모델에 대해 Stanford CRFM / MosaicML이 보고한 결과
미국 의사 면허 시험(USMLE) 형식의 4지선다 문제
PubMed 초록 기반의 예/아니요/아마도 형식 문제
인도 의대 입학시험 문제, BioMedLM 논문에서 보고
범용 LLM의 일부에 불과한 파라미터로 이 점수를 달성
논문 요약, 개체 추출, 문헌 기반 가설 생성을 수행합니다.
PubMed 형식 텍스트에 근거한 질의응답과 요약.
시험 형식의 생의학 문제에 답하고 그 밑바탕이 되는 기전을 설명합니다.
단일 GPU에 들어가는 오픈 가중치
transformers로 Hugging Face에서 stanford-crfm/BioMedLM을 불러옵니다. 베이스 모델은 일반 언어 모델이므로 작업에 맞게 파인튜닝하세요.
BioMedLM은 작업별 파인튜닝의 베이스로 활용할 때 가장 유용합니다.
BioMedLM을 환자 데이터를 다루는 환경에 도입하기 전에 개인정보 보호, 검증, 사람의 감독을 계획하십시오.
BioMedLM은 연구용 모델입니다. 임상에 사용하기 전에 반드시 자격을 갖춘 의료 전문가가 출력을 검토해야 합니다.
이 모델은 규제 당국의 허가 또는 승인을 받은 의료기기가 아닙니다. 배포 전에 현지 의료 규정과 데이터 보호 규칙(예: HIPAA, GDPR)을 준수하는지 확인하십시오.
소형·특화형 대 대형·범용형
Stanford CRFM의 2.7B 모델
제한된 하드웨어에서 파인튜닝 가능한 생의학 베이스 모델이 필요한 연구 그룹
비교
모달리티(텍스트 대 이미지), 라이선스, 실제 보유한 하드웨어를 기준으로 선택하세요
BioMedLM에 관한 자주 묻는 질문
Stanford CRFM(Center for Research on Foundation Models)이 MosaicML과 함께 개발했습니다. 2022년 12월 PubMedGPT라는 이름으로 처음 공개되었습니다.
27억 파라미터입니다. GPU 한 대로 파인튜닝할 수 있을 만큼 작다는 점이 이 프로젝트의 핵심입니다.
Stanford CRFM 발표에 따르면 파인튜닝 후 MedQA(USMLE)에서 약 50.3%, PubMedQA에서 74.4%입니다.
가중치는 연구용으로 공개되어 있습니다. 의료기기가 아니며, 저자들은 검증 없이 환자 대상으로 사용하지 않도록 명시적으로 경고하고 있습니다.
데모는 Dr7.ai의 의료 어시스턴트를 사용해 PubMed 형식의 생의학 Q&A를 보여 줍니다. 결과를 그대로 재현하려면 오픈 가중치를 로컬에서 실행하세요.