Повернутися до часової лінії

Дослідження · квітень 2012 р.

Apache Spark

Захарія з колегами запропонували тримати проміжні дані в пам'яті кластера, і обчислення, що повторюються, прискорилися в десятки разів.

Чому це важливо

Машинне навчання на великих даних стало здійсненним: алгоритми, що йдуть по даних багато разів, перестали впиратися в диск.

MapReduce записував результат кожного кроку на диск, що годиться для одного проходу і згубно для ітеративних методів, тобто для більшості алгоритмів навчання. Стійкі розподілені набори даних Spark зберігаються в пам'яті, а відновлюються після відмови перерахунком за історією походження. Це зробило кластер придатним для навчання моделей, а не лише для підрахунку.

Відомості про подію

Дата події
квітень 2012 р.
Дата на часовій лінії
Дата події
Перевірка
Джерела зібрано автоматично · 17 вересня 2026 р.
Лінії
ID
evt-0256

Доповідь на конференції NSDI у квітні 2012 року.

Джерела

Пов’язані події