Аутсорсинговый центр

Неземной
аутсорсинг

Переобучение (Overfitting)

Переобучение (переподгонка, англ. overfitting) — в машинном обучении и статистике явление, при котором построенная модель чрезмерно подстраивается под данные обучающей выборки, улавливая в них случайный шум и нерепрезентативные особенности, вследствие чего хорошо описывает известные примеры, но плохо обобщает результат на новых данных, не участвовавших в обучении.

Что означает термин

Термин описывает ситуацию, когда алгоритм при обучении находит не только общие закономерности в данных, но и воспроизводит их случайные отклонения, свойственные конкретному набору примеров. В результате модель фактически запоминает обучающие наблюдения вместо того, чтобы выявлять устойчивые зависимости, применимые к новым случаям. Основным признаком переобучения считается существенный разрыв между качеством работы на обучающей выборке и качеством на независимой контрольной или тестовой выборке: малая ошибка на обучении сама по себе не свидетельствует о высокой обобщающей способности.

Как устроено

С точки зрения теории переобучение характеризуется высокой дисперсией (variance) модели: небольшие изменения в обучающих данных приводят к заметным изменениям в предсказаниях. На практике это проявляется как точное совпадение с обучающими примерами при неточных ответах на новых данных. Специалисты описывают это через баланс между смещением и дисперсией: чрезмерное усложнение модели снижает смещение, но резко увеличивает дисперсию и усугубляет переобучение. К распространённым методам борьбы с явлением относятся кросс-проверка, регуляризация, ранняя остановка обучения и байесовское сравнение моделей.

Где применяется

Понятие используется в задачах классификации, регрессии и прогнозирования — везде, где модель строится по выборке и затем применяется к новым наблюдениям. Классический учебный пример — аппроксимация зашумлённых данных полиномом высокой степени: полином гарантирует идеальное совпадение с обучающими точками, тогда как более простая линейная функция лучше отражает истинный тренд и точнее предсказывает новые значения. Аналогично сложная нейронная сеть для классификации изображений может запомнить обучающие картинки, но ошибаться на ранее не виденных примерах.

Отличие от близких понятий

Противоположное явление называется недообучением (underfitting): при нём модель оказывается слишком простой или недостаточно обученной и не выявляет закономерности даже в обучающих данных. Утечка данных (data leakage) — например, попадание почти одинаковых объектов в обучающую и тестовую выборки или использование будущих значений во временном ряду — приводит к сходным симптомам в виде завышенной оценки качества, однако формально не тождественна переобучению: она связана с нарушением протокола оценки, а не с избыточной подстройкой модели под данные.

Возврат к списку

База знаний организована при поддержке делового сообщества. Спираль?!