Мовну модель оцінюють як лікаря
26 грудня 2022 року Google Research і DeepMind опублікували Med-PaLM і набір MultiMedQA: Flan-PaLM дала 67,6 % на питаннях у стилі медичного ліцензійного іспиту США, на понад 17 пунктів вище за попередній рекорд, а донавчена підказками Med-PaLM відповідала згідно з науковим консенсусом майже так часто, як лікарі.
Чому це важливо
Досі клінічні знання моделей міряли автоматично на обмежених наборах; тут до тестів додано оцінку відповідей клініцистами за фактичністю, можливою шкодою й упередженням, і модель наблизилася до лікарів. Автори самі пишуть, що модель лишається гіршою за клініцистів.
MultiMedQA об'єднує шість наявних наборів — MedQA, MedMCQA, PubMedQA, клінічні розділи MMLU та інші — і новий HealthSearchQA з 3 375 поширених пошукових запитів про здоров'я. На 140 питаннях клініцисти визнали відповідними консенсусу 61,9 % відповідей Flan-PaLM, 92,9 % відповідей клініцистів і відповіді Med-PaLM — 92,6 % за вступом першої версії і 92,9 % за її ж розділом результатів. Потенційно шкідливими визнано 29,7 % відповідей Flan-PaLM, 5,8 % Med-PaLM і 6,5 % клініцистів. Твердження, що Med-PaLM першою перейшла прохідний поріг, з'являється лише в наступній статті; у цій його немає.