Gemini 2.0 Flash
Google випустила модель, що приймає й породжує текст, зображення і звук, викликає інструменти сама і при цьому працює вдвічі швидше за велику модель попереднього покоління.
Чому це важливо
Мультимодальність на вході й на виході зійшлася в одній дешевій моделі, і компанія прямо назвала це підготовкою до агентів.
Доти породження зображень і звуку жило в окремих моделях, і система збиралася з частин. Тут один прохід приймає й віддає всі три види даних, включно з живим аудіопотоком у діалозі. Модель також уміє викликати пошук і виконувати код без зовнішнього оркестрування. Google подала випуск під гаслом агентної доби і показала поряд експериментальні прототипи — браузерного помічника й агента для програмування.