Ученые определили, сколько данных нужно для эффективного обучения нейросетей
Учёные из МФТИ выяснили, как стабилизируется обучение нейросетей при увеличении объёма данных. Это позволит оптимизировать размер выборки и повысить эффективность машинного обучения.
Natura
Исследователи из МФТИ впервые провели системный анализ того, как обучение нейронных сетей меняется по мере увеличения объема данных. Их работа, опубликованная в Doklady Mathematics, сочетает теоретические расчеты и масштабные эксперименты.
Нейронные сети — основа современного искусственного интеллекта. Обучение этих моделей — поиск оптимальных параметров, минимизирующих ошибки предсказаний. Главный ориентир здесь — функция потерь, отражающая точность работы сети. Все возможные значения этой функции для разных настроек формируют сложный "ландшафт" с множеством локальных и глобальных минимумов.
Наиболее интересны для исследователей "плоские" долины ландшафта — они обеспечивают моделям хорошее обобщение на новых данных. Для оценки кривизны в окрестности минимума используется матрица Гессе. Анализ ее спектра позволяет выявить особенности ландшафта: большинство направлений почти не влияют на потери, но есть и резкие изменения.
Ранее основное внимание уделялось геометрии ландшафта на фиксированной выборке. Оставался открытым вопрос: как меняется форма ландшафта при добавлении новых данных? Становится ли он стабильнее и предсказуемее?
МФТИ поставил цель: количественно описать, как меняются значения функции потерь вблизи минимума, если в обучающую выборку добавить всего один новый объект, и как быстро эта разница уменьшается с увеличением объема данных. Эксперименты проводились на подвыборках разного размера: сначала сеть обучали, искали минимум, затем добавляли по одному объекту и измеряли изменение функции потерь. Использовались как сырые пиксели изображений, так и признаки, извлеченные мощной предобученной моделью.
Результаты теории и экспериментов совпали: по мере увеличения размера выборки ландшафт функции потерь действительно стабилизируется. Это открытие поможет эффективнее планировать обучение нейросетей и определять необходимый объем данных для надежной работы моделей.
