Нормальное распределение что это
Нормальное распределение (Normal Distribution)
Нормальное распределение (распределением Гаусса или Гаусса — Лапласа) – распространенная разновидность непрерывного распределения вероятностей для случайной величины.
Помните колоколообразную кривую? Вот эту:
Долгое время она служила главным критерием профессиональной оценки сотрудников американских учреждений, и равнодушных не оставляла, ведь от нее зависело, как себя позиционирует человек и его начальство.
Нормальное распределение – это ключевая концепция Статистики (Statistics) и основа Науки о данных (Data Science). При выполнении Разведочного анализа данных (EDA) мы сначала стремимся найти их распределение вероятностей, и наиболее распространенный ее вид – нормальное распределение.
Посмотрите на распределение вероятностей окупить инвестиции в фондовый индекс S&P 500:
Да-да, вероятность «выйти в ноль» выше остальных! Также справедливо утверждение, что вероятность потерять больше как бы тает вместе с отрицательным процентом возврата. Белой непрерывной линией обозначено предсказание кривой нормального распределения. Прочие наблюдения, такие как вес при рождении и показатель IQ, часто следуют нормальному распределению подобным образом.
Еще одна причина, по которой нормальное распределение становится важным для Дата-сайентистов (Data Scientist) – это Центральная предельная теорема (Central Limit Theorem). Эта теорема объясняет магию математики и является основой методов проверки гипотез.
В этой статье мы поймем важность и различные свойства нормального распределения, а изучим, как использовать эти свойства для проверки нормальности наших данных.
Свойства нормального распределения
Кривая стандартного нормального распределения симметрична относительно Среднего арифметического (Mean), Медианы (Median) и Моды (Mode). Более того, также являются нормальным распределением произведение двух нормальных распределений и их сумма. Магия, не правда ли? Существуют и другие, более сложные закономерности, пока обойдемся самыми понятными.
Эмпирическое правило
Вы слышали об эмпирическом правиле? Оно часто используется в статистике и гласит: «68,27% наблюдений случайной Выборки (Sample) лежат в пределах одного Стандартного отклонения (Standard Deviation), 95,45% – в пределах двух, а 99,73 – в пределах трех стандартных отклонений от среднего»:
Это правило позволяет нам идентифицировать Выбросы (Outlier) и очень полезно при Проверке на нормальность (Normality Test).
Стандартное нормальное распределение
Стандартное нормальное распределение – это частный случай нормального распределения, когда среднее значение равно нулю и стандартное отклонение равно единице. Любое нормальное распределение мы можем преобразовать его в стандартное, используя формулу:
Пример. Есть два интерна: Левин и Ричардс. Левин набрал 65 баллов на экзамене по терапии, а Ричардс – 80 баллов на экзамене по кожной венерологии. Верно ли, что Ричардс учился лучше, чем Левин?
Нет, потому что манера поведения людей в терапии отличается от того, как люди проявляют себя в кожной венерологии. Таким образом, прямое сравнение простым сравнением оценок некорректно.
Теперь предположим, что отметки теста по терапии подчиняются нормальному распределению со средним значением 60 и стандартным отклонением 4. С другой стороны, отметки о кожвенерологии подчиняются нормальному распределению со средним значением 79 и стандартным отклонением 2.
Нам нужно будет вычислить Стандартизированную оценку (Z-score) путем стандартизации обоих этих распределений:
Таким образом, Левин набрал 1,25 стандартного отклонения выше среднего, в то время как Ричардс – только 0,5. Следовательно, Левин показал себя лучше:
Асимметричное распределение
Нормальное распределение – это симметрично, что означает, что его «хвосты» слева и справа – зеркальные отображения друг друга. Но это не относится к большинству реальных наборов данных. Как правило, мы будем иметь дело со скошенными асимметричными распределениями.
Визуальная оценка нормальности
Для таких целей принято использовать три вида графиков:
Для оценки нормальности распределения также используют Скошенность (Skewness) и Эксцесс (Kurtosis).
Нормальное распределение и Python
Посмотрим, как выглядит код, визуализирующий распределение и заодно рассчитывающий основные метрики Датасета (Dataset). Для начала импортируем необходимые библиотеки:
Определим функцию, которая пройдется по всем столбцам датасета, рассчитает основные статистические метрики (среднее, минимум, максимум и т.д.):
Построим тройной график:
Ноутбук, не требующий дополнительной настройки на момент написания статьи, можно скачать здесь.
Нормальный закон распределения вероятностей
Без преувеличения его можно назвать философским законом. Наблюдая за различными объектами и процессами окружающего мира, мы часто сталкиваемся с тем, что чего-то бывает мало, и что бывает норма: 
Перед вами принципиальный вид функции плотности нормального распределения вероятностей, и я приветствую вас на этом интереснейшем уроке.
Какие можно привести примеры? Их просто тьма. Это, например, рост, вес людей (и не только), их физическая сила, умственные способности и т.д. Существует «основная масса» (по тому или иному признаку) и существуют отклонения в обе стороны.
Это различные характеристики неодушевленных объектов (те же размеры, вес). Это случайная продолжительность процессов, например, время забега стометровки или превращения смолы в янтарь. Из физики вспомнились молекулы воздуха: среди них есть медленные, есть быстрые, но большинство двигаются со «стандартными» скоростями.
Более того, даже дискретные распределения бывают близкИ к нормальному, и в конце урока мы раскроем важный секрет «нормальности». Но прежде, математика, математика, математика, которая в древности не зря считалась философией!
Непрерывная случайная величина 



Данная функция получила фамилию некоронованного короля математики, и я не могу удержаться, чтобы не запостить: 
Одну из таких купюр мне довелось лично держать в руках, и ещё будучи школьником я внимательно изучил функцию Гаусса. Педантичные немцы отобразили все её особенности (на картинке видно плохо), и мы с толком, с расстановкой приступаем к их немцев изучению.
Начнём с того, что для функции 


Любопытно отметить, что сам по себе неопределённый интеграл 



Следующие замечательные факты я тоже приведу без доказательства:


Эти значения выводятся с помощью общих формул математического ожидания и дисперсии, и желающие / нуждающиеся могут ознакомиться с подробными выкладками в учебной литературе, и совсем здОрово, если вам удастся провести их самостоятельно.
Ну а мы переходим к насущным практическим вопросам. Практики сегодня будет много, и она будет интересна не только «чайникам», но и более подготовленным читателям:
Нормально распределённая случайная величина задана параметрами 
Несмотря на кажущуюся простоту задания, в нём существует немало тонкостей.
Первый момент касается обозначений. Они стандартные, и никаких вольностей: математическое ожидание обозначают буквой 



Решение начнём шаблонной фразой: функция плотности нормально распределённой случайной величины имеет вид 

Первая, более лёгкая часть задачи выполнена. Теперь график. Вот на нём-то, на моей памяти, студентов «заворачивали» десятки раз, причём, многих неоднократно. По той причине, что график 
Сначала полная картина, затем комментарии:
Строим декартову систему координат. При выполнении чертежа от руки во многих случаях оптимален следующий масштаб:
по оси абсцисс: 2 тетрадные клетки = 1 ед.;
по оси ординат: 2 тетрадные клетки = 0,1 ед., при этом саму ось следует расположить из тех соображений, что в точке 

И логично, что в первую очередь удобно найти максимум функции. В данном примере он находится в точке 

Отмечаем вершину графика (красная точка).
Далее вычислим значения функции при 

Отмечаем синим цветом.
Внимание! 

Далее отклоняемся от центра ещё на одно стандартное отклонение 
Отмечаем точки на чертеже (зелёный цвет) и видим, что этого вполне достаточно.
На завершающем этапе аккуратно чертим график, и особо аккуратно отражаем его выпуклость / вогнутость! Ну и, наверное, вы давно поняли, что ось абсцисс – это горизонтальная асимптота, и «залезать» за неё категорически нельзя!
При электронном оформлении решения график легко построить в Экселе, и неожиданно для самого себя я даже записал короткий видеоролик на эту тему. Но сначала поговорим о том, как меняется форма нормальной кривой в зависимости от значений 

При увеличении или уменьшении «а» (при неизменном «сигма») график сохраняет свою форму и перемещается вправо / влево соответственно. Так, например, при 


Нормально распределённая величина с нулевым математическим ожиданием получила вполне естественное название – центрированная; её функция плотности 
В случае изменения «сигмы» (при постоянном «а»), график «остаётся на месте», но меняет форму. При увеличении 



Всё в полном соответствии с геометрическими преобразованиями графиков.
Нормальное распределёние с единичным значением «сигма» называется нормированным, а если оно ещё и центрировано (наш случай), то такое распределение называют стандартным. Оно имеет ещё более простую функцию плотности, которая уже встречалась в локальной теореме Лапласа: 
Ну а теперь смотрим кино:
Да, совершенно верно – как-то незаслуженно у нас осталась в тени функция распределения вероятностей. Вспоминаем её определение:



Внутри интеграла обычно используют другую букву, чтобы не возникало «накладок» с обозначениями, ибо здесь каждому значению 


Почти все значения 


Раз, два – и готово:

На чертеже хорошо видно выполнение всех свойств функции распределения, и из технических нюансов здесь следует обратить внимание на горизонтальные асимптоты и точку перегиба 
Теперь вспомним одну из ключевых задач темы, а именно выясним, как найти 



но каждый раз вымучивать приближенное значение 

! Вспоминаем также, что
Тут можно снова задействовать Эксель, но есть пара весомых «но»: во-первых, он не всегда под рукой, а во-вторых, «готовые» значения 
Об этом я неоднократно рассказывал ранее: в своё время (и ещё не очень давно) роскошью был обычный калькулятор, и в учебной литературе до сих пор сохранился «ручной» способ решения рассматриваемой задачи. Его суть состоит в том, чтобы стандартизировать значения «альфа» и «бета», то есть свести решение к стандартному распределению:
Примечание: функцию 




и из проведённой замены как раз следует формула 


Зачем это нужно? Дело в том, что значения 

В силу очевидной нечётности функции Лапласа (






Таким образом, наша задача становится чуть ли не устной! Порой, здесь хмыкают и говорят, что метод устарел. Может быть…, но парадокс состоит в том, что «устаревший метод» очень быстро приводит к результату! И ещё в этом заключена большая мудрость – если вдруг пропадёт электричество или восстанут машины, то у человечества останется возможность заглянуть в бумажные таблицы и спасти мир =)
Из пункта 

Решение: в задаче рассматривается нормально распределённая случайная величина 

Если в нашем распоряжении есть таблица значений функции 


Для самопроверки можно задействовать экселевскую функцию =НОРМСТРАСП(z) или напрямую «забить» 

Если же в нашем распоряжении есть таблица значений функции Лапласа 

Дробные значения традиционно округляем до 4 знаков после запятой, как это сделано в типовой таблице. И для контроля есть Пункт 5 макета.
Напоминаю, что 
Ответ требуется дать в процентах, поэтому рассчитанную вероятность нужно умножить на 100 и снабдить результат содержательным комментарием:
– с перелётом от 5 до 70 м упадёт примерно 15,87% снарядов
Диаметр подшипников, изготовленных на заводе, представляет собой случайную величину, распределенную нормально с математическим ожиданием 1,5 см и средним квадратическим отклонением 0,04 см. Найти вероятность того, что размер наугад взятого подшипника колеблется от 1,4 до 1,6 см.
В образце решения и далее я буду использовать функцию Лапласа, как самый распространённый вариант. Кстати, обратите внимание, что согласно формулировке, здесь можно включить концы интервала в рассмотрение. Впрочем, это не критично.
И уже в этом примере нам встретился особый случай – когда интервал 


Параметр «дельта» называют отклонением от математического ожидания, и двойное неравенство можно «упаковывать» с помощью модуля:



Хорошо то решение, которое умещается в одну строчку:)

Результат этой задачи получился близким к единице, но хотелось бы ещё бОльшей надежности – а именно, узнать границы, в которых находится диаметр почти всех подшипников. Существует ли какой-нибудь критерий на этот счёт? Существует! На поставленный вопрос отвечает так называемое
правило «трех сигм»
Его суть состоит в том, что практически достоверным является тот факт, что нормально распределённая случайная величина 

И в самом деле, вероятность отклонения от матожидания менее чем на 

В «пересчёте на подшипники» – это 9973 штуки с диаметром от 1,38 до 1,62 см и всего лишь 27 «некондиционных» экземпляров.
В практических исследованиях правило «трёх сигм» обычно применяют в обратном направлении: если статистически установлено, что почти все значения исследуемой случайной величины укладываются в интервал длиной 6 стандартных отклонений, то появляются веские основания полагать, что эта величина распределена по нормальному закону. Проверка осуществляется с помощью теории статистических гипотез.
Продолжаем решать суровые советские задачи:
Случайная величина 
Решение очень простое. По условию, 



Ответ:
Прорешанная задача принципиально отличается от вроде бы похожего Примера 3 урока о равномерном распределении. Там была погрешность округления результатов измерений, здесь же речь идёт о случайной погрешности самих измерений. Такие погрешности возникают в связи с техническими характеристиками самого прибора (диапазон допустимых ошибок, как правило, указывают в его паспорте), а также по вине экспериментатора – когда мы, например, «на глазок» снимаем показания со стрелки тех же весов.
Помимо прочих, существуют ещё так называемые систематические ошибки измерения. Это уже неслучайные ошибки, которые возникают по причине некорректной настройки или эксплуатации прибора. Так, например, неотрегулированные напольные весы могут стабильно «прибавлять» килограмм, а продавец систематически обвешивать покупателей. Или не систематически ведь можно обсчитать. Однако, в любом случае, случайной такая ошибка не будет, и её матожидание отлично от нуля.
…срочно разрабатываю курс по подготовке продавцов =)
Самостоятельно решаем обратную задачу:
Диаметр валика – случайная нормально распределенная случайная величина, среднее квадратическое отклонение ее равно 

Пункт 5* расчётного макета в помощь. Обратите внимание, что здесь не известно математическое ожидание, но это нисколько не мешает решить поставленную задачу.
И экзаменационное задание, которое я настоятельно рекомендую для закрепления материала:
Нормально распределенная случайная величина 


а) записать плотность вероятности и схематически изобразить ее график;
б) найти вероятность того, что 

в) найти вероятность того, что 


г) применяя правило «трех сигм», найти значения случайной величины 
Такие задачи предлагаются повсеместно, и за годы практики мне их довелось решить сотни и сотни штук. Обязательно попрактикуйтесь в ручном построении чертежа и использовании бумажных таблиц 😉
Ну а я разберу пример повышенной сложности:
Плотность распределения вероятностей случайной величины 






Решение: прежде всего, обратим внимание, что в условии ничего не сказано о характере случайной величины. Само по себе присутствие экспоненты ещё ничего не значит: это может оказаться, например, показательное или вообще произвольное непрерывное распределение. И поэтому «нормальность» распределения ещё нужно обосновать:
Так как функция 



Приводим. Для этого выделяем полный квадрат и организуем трёхэтажную дробь: 
Обязательно выполняем проверку, возвращая показатель в исходный вид: 

Таким образом:


Теперь найдём значение параметра 






Построим график плотности: 
и график функции распределения 

Если под рукой нет Экселя и даже обычного калькулятора, то последний график легко строится вручную! В точке 






После чего аккуратно проводим интегральную кривую, не забывая о перегибе и двух горизонтальных асимптотах.
Да, и ещё нужно вычислить:


Ответ:
Но этим, конечно, всё дело не ограничивается! Дополнительные примеры, причём довольно творческие, можно найти в тематической pdf-книжке.
И в заключение урока обещанный секрет:
понятие о центральной предельной теореме
которую также называют теоремой Ляпунова. Её суть состоит в том, что если случайная величина 


В окружающем мире условие теоремы Ляпунова выполняется очень часто, и поэтому нормальное распределение (близкое к нему) и встречается буквально на каждом шагу.
Так, например, молекул воздуха очень и очень много, и каждая из них своим движением оказывает ничтожно малое влияние на всю совокупность. Поэтому скорость молекул воздуха распределена нормально.
Большая популяция некоторых особей. Каждая из них (или подавляющее большинство) оказывает несущественное влияние на жизнь всей популяции, следовательно, длина их лапок тоже распределена по нормальному закону.
Теперь вернёмся к знакомой задаче, где проводится 






Уже при 


И чем больше 

Именно этот факт мы и использовали в теоремах Лапласа – когда приближали биномиальные вероятности соответствующими значениями функций нормального распределения.
Вот такие вот пироги.
Необычайно интересной, и я бы даже сказал «сочной» получилась эта статья, что бывает далеко не всегда, но всегда вдохновляет на новое творчество! Надеюсь, вам тоже понравилось, и вы освоили весь материал «на одном дыхании».
Пример 3. Решение: т.к. случайная величина 




Ответ:
Пример 5. Решение: используем формулу: 
В данной задаче 


откуда находим:

Длина искомого интервала составляет
Ответ: 20 мм
Пример 6. Решение: функция плотности нормально распределённой случайной величины имеет вид 




Выполним чертёж: 
! Примечание: несмотря на то, что условие допускает схематическое построение графика, на чертеже обязательно отображаем все его принципиальные особенности, в частности, на забываем о перегибах в точках 
б) Используем формулу 

В данной задаче 



в) Используем формулу 



г) Согласно правилу «трех сигм», практически все значения (99,73%) нормально распределенной случайной величины входят в интервал 


Ответ: а) 


Автор: Емелин Александр
(Переход на главную страницу)

cкидкa 15% на первый зaкaз, прoмoкoд: 5530-hihi5
















