
ขับเคลื่อนโดยแพลตฟอร์ม AI ทางการแพทย์ Dr7.ai
Med-Flamingo เป็นโมเดลเรียนรู้แบบ few-shot มัลติโมดัลสำหรับการแพทย์จากนักวิจัย Stanford พัฒนาบน OpenFlamingo-9B และฝึกล่วงหน้าด้วยข้อมูลภาพ-ข้อความแบบสลับจากตำราแพทย์และ PubMed Central สามารถตอบคำถามเกี่ยวกับภาพทางการแพทย์ใหม่ได้หลังเห็นตัวอย่างเพียงไม่กี่ตัวอย่าง
อัปโหลดภาพทางการแพทย์แล้วถามคำถามเกี่ยวกับภาพนั้น — เดโมนี้แสดงการให้เหตุผลจากภาพและข้อความแบบสลับที่ Med-Flamingo นำมาใช้ในการแพทย์
สัมผัส AI ทางการแพทย์ขั้นสูง
ถาม-ตอบจากภาพได้ไม่จำกัด อัปโหลดได้มากขึ้น และเข้าถึง API สำหรับงานวิจัยทางการแพทย์แบบมัลติโมดัล
Med-Flamingo เป็นโมเดลภาพ-ภาษาทางการแพทย์ที่เปิดตัวในปี 2023 โดย Michael Moor และคณะที่ Stanford ร่วมกับผู้ร่วมวิจัย (Moor et al., "Med-Flamingo: a Multimodal Medical Few-shot Learner") โดยปรับ OpenFlamingo-9B — การพัฒนาซ้ำแบบเปิดของ Flamingo จาก DeepMind — ให้เข้ากับสาขาการแพทย์
โมเดลได้รับการฝึกล่วงหน้าต่อเนื่องด้วยลำดับภาพ-ข้อความแบบสลับจากตำราแพทย์ (ชุดข้อมูล MTB) และคู่ภาพประกอบ-คำบรรยายจาก PMC-OA เนื่องจากรับภาพและข้อความแบบสลับกันในบริบทเดียว จึงรองรับการเรียนรู้ในบริบท ("few-shot"): แสดงตัวอย่างภาพ-คำถาม-คำตอบเพียงไม่กี่ชุด แล้วโมเดลจะนำไปใช้กับภาพใหม่ได้โดยไม่ต้องปรับแต่ง
บน VQA-RAD, PathVQA และเบนช์มาร์กใหม่ Visual USMLE แพทย์ให้คะแนนคำตอบเชิงสร้างของ Med-Flamingo สูงกว่าโมเดลอ้างอิง (baseline) แต่คณะผู้วิจัยระบุชัดเจนว่าเป็นต้นแบบงานวิจัยระยะแรกที่อาจเกิดอาการหลอน (hallucination) และไม่เหมาะสำหรับการใช้งานทางคลินิก
เปิดตัวในเดือนกรกฎาคม 2023 โดยนักวิจัย Stanford และผู้ร่วมวิจัย (Moor et al., 2023)
น้ำหนักโมเดลแบบเปิดบน GitHub / Hugging Face สำหรับการวิจัย; พัฒนาบน OpenFlamingo-9B
การเรียนรู้ในบริบทสำหรับภาพทางการแพทย์
การถาม-ตอบจากภาพทางการแพทย์แบบ few-shot
อินพุตภาพ + ข้อความแบบสลับในพรอมต์เดียว
คำตอบเชิงสร้าง (ข้อความอิสระ) ไม่ใช่แค่แบบหลายตัวเลือก
ฝึกล่วงหน้าด้วยตำราแพทย์และภาพประกอบจาก PubMed Central
พัฒนาบน OpenFlamingo-9B (โครงหลักภาษา LLaMA-7B)
ประเมินผลบน VQA-RAD, PathVQA และ Visual USMLE
โปรโตคอลการประเมินโดยให้แพทย์ให้คะแนน
น้ำหนักโมเดลแบบเปิดเพื่อการวิจัย
การประเมินตามที่อธิบายในบทความ Med-Flamingo; แพทย์ให้คะแนนคำตอบเชิงสร้างแทนการใช้ตัวเลขความแม่นยำเพียงค่าเดียว
การถาม-ตอบจากภาพรังสีวิทยาพร้อมตัวอย่างในบริบท
การถาม-ตอบจากภาพพยาธิวิทยา
คำถามแนว USMLE ที่ต้องดูภาพประกอบ นำเสนอพร้อมกับบทความ
โดยเฉลี่ย ผู้เชี่ยวชาญเลือกคำตอบของ Med-Flamingo มากกว่าโมเดลอ้างอิง (baseline) ที่นำมาเปรียบเทียบ
ศึกษาการเรียนรู้ในบริบทสำหรับภาพทางการแพทย์ด้วยโมเดลแบบเปิด
ตอบคำถามแบบข้อความอิสระเกี่ยวกับภาพทางการแพทย์ เพื่อให้แพทย์ตรวจทาน
ฝึกทำข้อสอบแนว USMLE จากภาพพร้อมคำอธิบาย
โค้ดและน้ำหนักโมเดลเพื่อการวิจัยจากคณะผู้วิจัย
โค้ดและน้ำหนักโมเดลเผยแพร่ในรีโพสิทอรี GitHub ของคณะผู้วิจัยและบน Hugging Face; คุณต้องใช้น้ำหนักฐานของ OpenFlamingo และ LLaMA-7B ด้วย
สร้างพรอมต์จากตัวอย่างภาพ-คำถาม-คำตอบไม่กี่ชุด ตามด้วยภาพและคำถามใหม่
วางแผนด้านความเป็นส่วนตัว การตรวจสอบความถูกต้อง และการกำกับดูแลโดยมนุษย์ ก่อนนำ Med-Flamingo ไปใช้ใกล้กับข้อมูลผู้ป่วย
Med-Flamingo เป็นโมเดลเพื่อการวิจัย ผลลัพธ์ต้องได้รับการตรวจทานโดยบุคลากรทางการแพทย์ที่มีคุณสมบัติก่อนนำไปใช้ทางคลินิกใด ๆ
โมเดลนี้ไม่ใช่เครื่องมือแพทย์ที่ได้รับอนุญาตหรือได้รับการอนุมัติจากหน่วยงานกำกับดูแล โปรดตรวจสอบให้แน่ใจว่าเป็นไปตามกฎระเบียบด้านสุขภาพและกฎการคุ้มครองข้อมูลในพื้นที่ (เช่น HIPAA, GDPR) ก่อนนำไปใช้งาน
การเรียนรู้แบบ few-shot เปลี่ยนอะไรบ้าง
VQA ทางการแพทย์แบบ few-shot จาก Stanford
งานวิจัยด้านการเรียนรู้ในบริบทและ VQA ทางการแพทย์เชิงสร้าง
เปรียบเทียบกันอย่างไร
เลือกตามประเภทข้อมูล (ข้อความหรือภาพ) ใบอนุญาต และฮาร์ดแวร์ที่คุณมีจริง
คำถามทั่วไปเกี่ยวกับ Med-Flamingo
Michael Moor และคณะที่ Stanford University ร่วมกับผู้ร่วมวิจัย (2023) ไม่ใช่โมเดลของ Google
คุณใส่ตัวอย่างชุดภาพ-คำถาม-คำตอบไม่กี่ชุดในพรอมต์ จากนั้นโมเดลจะตอบคำถามเกี่ยวกับภาพใหม่ได้โดยไม่ต้องปรับแต่งใด ๆ
OpenFlamingo-9B ซึ่งเป็นการพัฒนาซ้ำแบบเปิดของสถาปัตยกรรม Flamingo จาก DeepMind โดยมีโครงหลักภาษาเป็น LLaMA-7B
ไม่ คณะผู้วิจัยระบุว่าเป็นต้นแบบงานวิจัยระยะแรกที่อาจเกิดอาการหลอน (hallucination) จึงห้ามใช้ในการดูแลผู้ป่วย
เดโมนี้ใช้ผู้ช่วยทางการแพทย์แบบมัลติโมดัลของ Dr7.ai เพื่อแสดงการถาม-ตอบจากภาพ หากต้องการโมเดลต้นฉบับ ให้รันโค้ดของคณะผู้วิจัย