Llama 3
Meta випустила моделі на 8 і 70 мільярдів параметрів, навчені на п'ятнадцяти трильйонах токенів — усемеро більше даних, ніж отримала Llama 2.
Чому це важливо
Відкриті моделі перестали бути на покоління позаду: менша з двох тримала рівень, на якому рік тому були найбільші закриті.
Кількість даних, а не параметрів, стала головним важелем: 8-мільярдна модель бачила більше тексту, ніж 70-мільярдна попередниця, і саме це дало приріст. Meta також розширила словник токенізатора і застосувала групову увагу, щоб здешевити висновування. Ліцензія лишалася не зовсім відкритою — з обмеженням для дуже великих сервісів, — але на практиці ваги стали основою для більшості похідних моделей року.