Большие данные
Big Data
Это понятие впервые встречается на программе «Разработка и инженерия для старшеклассников» — примерно 15-17 лет (9-11 класс).
Потоки данных — клики, покупки, показания датчиков — такие огромные, что один компьютер их не переварит: их обрабатывают сотни компьютеров сразу.
Перепись всей страны против списка класса: список прочтёшь глазами, перепись считают машины — зато она показывает закономерности, невидимые в одном классе.
Прикинуть, какие данные твоя семья оставила за день: сообщения, фото, маршруты, покупки, просмотры — и назвать, кто их собирает.
Данные, у которых объём, скорость поступления и разнообразие таковы, что одна машина с привычными программами их не обрабатывает. Работу делят между многими компьютерами. Ценность — закономерности всего массива: рекомендации, прогноз спроса, обучение моделей ИИ.
Посчитать с командой слова в длинной книге: каждый — свою главу, итоги сложить; объяснить, чем это похоже на распределённую обработку.
Классика определения — «3V»: volume, velocity, variety (объём, скорость, разнообразие). Данные не помещаются и не обрабатываются на одной машине за разумное время, поэтому хранение и вычисления распределяют по кластеру, а потоки обрабатывают на лету. На таких данных обучают нейросети и рекомендательные системы. Обратная сторона: даже обезличенные следы в сумме складываются в портрет человека.
Разобрать рекомендации музыкального сервиса по «3V»: где объём, где скорость, где разнообразие; назвать, что сервис предсказывает и по каким данным.
Частое заблуждение
«Большие данные — это просто очень много строк». Нет: главное — что привычные инструменты уже не справляются, а закономерности видны только на всём объёме; отсюда особые способы хранения и обработки.