Незалежний вимір ставить GPT-5.5 на перше місце
23 квітня 2026 року, того самого дня, коли OpenAI випустила GPT-5.5, компанія Artificial Analysis — з попереднім доступом до моделі на всіх пʼяти рівнях міркування — опублікувала власний вимір: модель очолила індекс інтелекту Artificial Analysis на 3 пункти, розірвавши трибічну рівність з Anthropic і Google, і показала найвищу точність на бенчмарку знань AA-Omniscience (57 %), водночас із найвищою серед порівнюваних моделей частотою галюцинацій (86 %).
Чому це важливо
Незалежний вимірювач підтвердив лідерство моделі виробника на кількох тестах того самого дня, коли вона вийшла, і водночас назвав компроміс, якого немає в заяві компанії: найвища точність по знаннях супроводжується і найвищою частотою вигаданих відповідей серед порівнюваних моделей. Оцінка редакційна.
GPT-5.5 (рівень зусиль xhigh) очолила пʼять ключових тестів Artificial Analysis (зокрема Terminal-Bench Hard, GDPval-AA і новий APEX-Agents-AA), поступившись лише іншим моделям OpenAI на CritPt і AA-LCR та Gemini 3.1 Pro Preview ще на трьох тестах. На бенчмарку GDPval-AA (реальні економічно значущі завдання) модель набрала Elo 1785, випередивши Claude Opus 4.7 (max) приблизно на 30 пунктів і Gemini 3.1 Pro Preview — приблизно на 470. На AA-Omniscience (знання й галюцинації) точність 57 % — найвища серед порівнюваних моделей і на 14 пунктів вища за GPT-5.4, але частота галюцинацій — 86 % проти 36 % в Opus 4.7 (max) і 50 % у Gemini 3.1 Pro Preview; приріст точності забезпечили здебільшого нові знання, а не менша схильність відповідати навмання. За рівнем зусиль medium модель зрівнюється з Opus 4.7 (max) на індексі інтелекту за чверть вартості (близько 1200 проти 4800 доларів), хоча Gemini 3.1 Pro Preview досягає того самого результату за 900 доларів; ціна за токен подвоїлася з часів GPT-5.4, але скорочення використання токенів приблизно на 40 % дає чистий приріст вартості прогону індексу близько 20 %. Чого запис не стверджує. Джерело — вимірювач, а не рецензоване видання; порівняння побудовані на власних тестах Artificial Analysis, які компанія не розкриває повністю. Запис не стверджує, що вища частота галюцинацій робить модель гіршою загалом — лише те, що на цьому тесті приріст точності не супроводжувався відповідним зниженням частоти галюцинацій.