Trainium виходить у загальний доступ
10 жовтня 2022 року Amazon відкрила загальний доступ до інстансів EC2 Trn1 на власному кристалі AWS Trainium. Найбільша конфігурація — 16 чипів, 512 гігабайтів пам'яті з високою смугою, до 3,4 петафлопса в TF32, FP16 і BF16 та до 800 гігабітів за секунду мережі.
Чому це важливо
Найбільший орендодавець обчислення перестає бути лише перепродавцем чужих прискорювачів. Це початок розгалуження: з цього моменту питання «скільки коштує навчання» має різні відповіді залежно від того, чиє залізо, і оператор може порівнювати власну лінійку з ринковою.
Числа з оголошення: trn1.32xlarge несе 16 чипів Trainium і 128 віртуальних ядер, до 512 гігабайтів пам'яті з високою смугою, до 3,4 петафлопса на TF32/FP16/BF16, чотири накопичувачі NVMe по 2 терабайти й міжчиповий зв'язок NeuronLink. Це перші інстанси EC2 з мережею Elastic Fabric Adapter до 800 гігабітів за секунду. Порівняння дано проти інстансів P4d: у 1,4 раза більше терафлопсів на BF16, у 2,5 — на TF32, у 5 — на FP32, у 4 рази ширша мережа між вузлами й до 50 % економії на вартості навчання. Попередній доступ оголошено на re:Invent 2021. Одне уточнення, у якому легко помилитися. Trainium — це другий прискорювач машинного навчання, який AWS зробила сама, наступний після Inferentia, а не друге покоління самого Trainium: так і написано в оголошенні. Другий Trainium вийде пізніше. Запис не наводить смуги пам'яті на чип: 820 гігабайтів за секунду, які подавав звіт, на сторінці оголошення відсутні.