Датасет
набор данных
Это понятие впервые встречается на программе «Электроника, программирование и инженерная практика» — примерно 13-14 лет (7-8 класс).
Коллекция примеров с готовыми ответами, на которой учат программу: тысячи фото кошек и собак с подписями, кто есть кто.
Сборник задач с ответами: каким собрали сборник, так ученик и натренируется — по одним задачам на сложение делить не научишься.
Собрать мини-датасет: по 10 фото двух предметов с подписями; проверить, что примеров каждого вида поровну.
Набор данных для обучения и проверки модели машинного обучения: примеры плюс разметка — правильные ответы к ним. Датасет делят на обучающую и проверочную части, чтобы оценивать модель на незнакомых примерах. Ошибки разметки и перекос состава модель выучит как правду — качество набора важнее хитрости алгоритма.
Найти перекос в учебном датасете (все кошки сняты дома, все собаки — на улице) и предсказать, как обученная на нём модель ошибётся.
Выборка для обучения и проверки моделей: в задачах с учителем — размеченная, но бывают и неразмеченные (кластеризация, корпуса языковых моделей). Стандартное деление train/validation/test (например, 70/15/15); ключевые свойства — репрезентативность, баланс классов, чистота разметки. Утечка теста в обучение завышает метрики; смещение выборки модель наследует и усиливает. Открытые эталоны (MNIST, ImageNet) позволяют честно сравнивать модели.
Взять открытый набор рукописных цифр, проверить баланс классов и предложить деление train/val/test с обоснованием долей.
Частое заблуждение
«Чем больше датасет, тем лучше модель, — остальное неважно». Нет: грязный или перекошенный набор портит модель при любом размере; важны разнообразие примеров и точность разметки.