Повернутися до часової лінії

Бенчмарк · 26 грудня 2022 р.

Мовну модель оцінюють як лікаря

26 грудня 2022 року Google Research і DeepMind опублікували Med-PaLM і набір MultiMedQA: Flan-PaLM дала 67,6 % на питаннях у стилі медичного ліцензійного іспиту США, на понад 17 пунктів вище за попередній рекорд, а донавчена підказками Med-PaLM відповідала згідно з науковим консенсусом майже так часто, як лікарі.

Чому це важливо

Досі клінічні знання моделей міряли автоматично на обмежених наборах; тут до тестів додано оцінку відповідей клініцистами за фактичністю, можливою шкодою й упередженням, і модель наблизилася до лікарів. Автори самі пишуть, що модель лишається гіршою за клініцистів.

MultiMedQA об'єднує шість наявних наборів — MedQA, MedMCQA, PubMedQA, клінічні розділи MMLU та інші — і новий HealthSearchQA з 3 375 поширених пошукових запитів про здоров'я. На 140 питаннях клініцисти визнали відповідними консенсусу 61,9 % відповідей Flan-PaLM, 92,9 % відповідей клініцистів і відповіді Med-PaLM — 92,6 % за вступом першої версії і 92,9 % за її ж розділом результатів. Потенційно шкідливими визнано 29,7 % відповідей Flan-PaLM, 5,8 % Med-PaLM і 6,5 % клініцистів. Твердження, що Med-PaLM першою перейшла прохідний поріг, з'являється лише в наступній статті; у цій його немає.

Відомості про подію

Дата події
26 грудня 2022 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 25 вересня 2026 р.
Лінії
ID
evt-0749

Перша версія препринта; рецензована стаття вийшла в Nature 12 липня 2023 року.

Джерела

Пов’язані події

Записи, що посилаються на цей