Apache Spark
Захарія з колегами запропонували тримати проміжні дані в пам'яті кластера, і обчислення, що повторюються, прискорилися в десятки разів.
Чому це важливо
Машинне навчання на великих даних стало здійсненним: алгоритми, що йдуть по даних багато разів, перестали впиратися в диск.
MapReduce записував результат кожного кроку на диск, що годиться для одного проходу і згубно для ітеративних методів, тобто для більшості алгоритмів навчання. Стійкі розподілені набори даних Spark зберігаються в пам'яті, а відновлюються після відмови перерахунком за історією походження. Це зробило кластер придатним для навчання моделей, а не лише для підрахунку.