Повернутися до часової осі

Бенчмарк · 23 квітня 2026 р.

Незалежний вимір ставить GPT-5.5 на перше місце

23 квітня 2026 року, того самого дня, коли OpenAI випустила GPT-5.5, компанія Artificial Analysis — з попереднім доступом до моделі на всіх пʼяти рівнях міркування — опублікувала власний вимір: модель очолила індекс інтелекту Artificial Analysis на 3 пункти, розірвавши трибічну рівність з Anthropic і Google, і показала найвищу точність на бенчмарку знань AA-Omniscience (57 %), водночас із найвищою серед порівнюваних моделей частотою галюцинацій (86 %).

Чому це важливо

Незалежний вимірювач підтвердив лідерство моделі виробника на кількох тестах того самого дня, коли вона вийшла, і водночас назвав компроміс, якого немає в заяві компанії: найвища точність по знаннях супроводжується і найвищою частотою вигаданих відповідей серед порівнюваних моделей. Оцінка редакційна.

GPT-5.5 (рівень зусиль xhigh) очолила пʼять ключових тестів Artificial Analysis (зокрема Terminal-Bench Hard, GDPval-AA і новий APEX-Agents-AA), поступившись лише іншим моделям OpenAI на CritPt і AA-LCR та Gemini 3.1 Pro Preview ще на трьох тестах. На бенчмарку GDPval-AA (реальні економічно значущі завдання) модель набрала Elo 1785, випередивши Claude Opus 4.7 (max) приблизно на 30 пунктів і Gemini 3.1 Pro Preview — приблизно на 470. На AA-Omniscience (знання й галюцинації) точність 57 % — найвища серед порівнюваних моделей і на 14 пунктів вища за GPT-5.4, але частота галюцинацій — 86 % проти 36 % в Opus 4.7 (max) і 50 % у Gemini 3.1 Pro Preview; приріст точності забезпечили здебільшого нові знання, а не менша схильність відповідати навмання. За рівнем зусиль medium модель зрівнюється з Opus 4.7 (max) на індексі інтелекту за чверть вартості (близько 1200 проти 4800 доларів), хоча Gemini 3.1 Pro Preview досягає того самого результату за 900 доларів; ціна за токен подвоїлася з часів GPT-5.4, але скорочення використання токенів приблизно на 40 % дає чистий приріст вартості прогону індексу близько 20 %. Чого запис не стверджує. Джерело — вимірювач, а не рецензоване видання; порівняння побудовані на власних тестах Artificial Analysis, які компанія не розкриває повністю. Запис не стверджує, що вища частота галюцинацій робить модель гіршою загалом — лише те, що на цьому тесті приріст точності не супроводжувався відповідним зниженням частоти галюцинацій.

Відомості про подію

Дата події
23 квітня 2026 р.
Дата на часовій осі
Дата події
Перевірка
Джерела зібрано автоматично · 29 вересня 2026 р.
Лінії
ID
evt-0943

Джерела

Пов’язані події

У той самий час