Проверка распределения на нормальность в EXCEL
Предположим, что имеется некий набор данных. Требуется оценить, соответствует ли данная выборка нормальному распределению .
Рассмотренный ниже графический метод основан на субъективной визуальной оценке данных. Объективным же подходом является, например, анализ степени согласия гипотетического распределения с наблюдаемыми данными (goodness-of-fit test), который рассмотрен в статье Проверка простых гипотез критерием Пирсона ХИ-квадрат .
Из-за наличия неустранимой статистической ошибки выборки, присущей случайной величине, невозможно однозначно ответить на вопрос «Взята ли данная выборка из нормального распределения или нет». Поэтому, рассмотренный графический метод, скорее, дает ответ на вопрос «Разумно ли предположение, что оцениваемая выборка взята из нормального распределения »?
Рассмотрим алгоритм построения графика проверки распределения на нормальность ( Normal Probability Plot ) :
- Отсортируйте значения выборки по возрастанию (значения выборки x j будут отложены по горизонтальной оси Х);
- Каждому значению x jвыборки поставьте в соответствие значения (j-0,5)/n, где n – количество значений в выборке , j – порядковый номер значения от 1 до n. Этот массив будет содержать значения от 0,5/n до (n-0,5)/n. Таким образом, диапазон от 0 до 1 будет разбит на равномерные отрезки. Этот диапазон соответствует вероятности наблюдения значений случайной величины Z j ;
- Преобразуем значения массива, полученные на предыдущем шаге, с помощью обратной функциистандартного нормального распределения НОРМ.СТ.ОБР() и отложим их по вертикальной оси Y.
Если значения выборки , откладываемые по оси Х, взяты из стандартного нормального распределения , то на графике мы получим приблизительно прямую линию, проходящую примерно через 0 и под углом 45 градусов к оси х (если масштабы осей совпадают).
Расчеты и графики приведены в файле примера на листе Нормальное . О построении диаграмм см. статью Основные типы диаграмм в MS EXCEL .
Примечание : Значения выборки в файле примера сгенерированы с помощью формулы =НОРМ.СТ.ОБР(СЛЧИС()) . При перерасчете листа или нажатии клавиши F9 происходит обновление данных в выборке . О генерации чисел, распределенных по нормальному закону см. статью Нормальное распределение. Непрерывные распределения в MS EXCEL . Таже значения выборки могут быть сгенерированы с помощью надстройки Пакет анализа .

Если значения выборки взяты из нормального распределения (μ не обязательно равно 0, σ не обязательно равно 1), то угол наклона кривой даст оценку стандартного отклонения σ, а ордината точки пересечения оси Y – оценку среднего значения μ.
Данные оценки несколько отличаются от оценок параметров, полученных с помощью функций СРЗНАЧ() и СТАНДОТКЛОН.В() , т.к. они получены методом наименьших квадратов , рассмотренного в статье про регрессионный анализ.
Примечание : Рассмотренный выше метод в отечественной литературе имеет название Метод номограмм . Номограмма – это листы бумаги, разлинованные определенным образом. Номограмма используется в различных областях знаний. В математической статистике номограмма называется вероятностной бумагой. Такую «вероятностную бумагу» мы практически построили самостоятельно, когда нелинейно изменили масштаб шкалы ординат: =НОРМ.СТ.ОБР((j-0,5)/n)

Интересно посмотреть, как будут выглядеть на диаграмме данные, полученные из выборок из других распределений (не из нормального ). В файле примера на листе Равномерное приведен график, построенный на основе выборки из непрерывного равномерного распределения.
Очевидно, что значения выборки совсем не ложатся на прямую линию и предположение о нормальности выборки должно быть отвергнуто.
Подобная визуальная проверка выборки на соответствие другим распределениям может быть сделана при наличии соответствующих обратных функций . В статье Статистики, их выборочные распределения и точечные оценки параметров распределений в MS EXCEL приведены графики для следующих распределений: Стьюдента , ХИ-квадрат распределения , F-распределения . Подобный график также приведен в статье про распределение Вейбулла .
Функция НОРМРАСП
Excel для Microsoft 365 Excel для Microsoft 365 для Mac Excel для Интернета Excel 2021 Excel 2021 для Mac Excel 2019 Excel 2019 для Mac Excel 2016 Excel 2016 для Mac Excel 2013 Excel 2010 Excel 2007 Excel для Mac 2011 Excel Starter 2010 Еще. Меньше
Возвращает нормальную функцию распределения для указанного среднего и стандартного отклонения. Эта функция очень широко применяется в статистике, в том числе при проверке гипотез.
Важно: Эта функция была заменена одной или несколькими новыми функциями, которые обеспечивают более высокую точность и имеют имена, лучше отражающие их назначение. Хотя эта функция все еще используется для обеспечения обратной совместимости, она может стать недоступной в последующих версиях Excel, поэтому мы рекомендуем использовать новые функции.
Дополнительные сведения о новом варианте этой функции см. в статье Функция НОРМ.РАСП.
Синтаксис
Аргументы функции НОРМРАСП описаны ниже.
- X Обязательный. Значение, для которого строится распределение.
- Среднее Обязательный. Среднее арифметическое распределения.
- Стандартное_откл Обязательный. Стандартное отклонение распределения.
- Интегральная — обязательный аргумент. Логическое значение, определяющее форму функции. Если аргумент «интегральная» имеет значение ИСТИНА, функция НОРМРАСП возвращает интегральную функцию распределения; если этот аргумент имеет значение ЛОЖЬ, возвращается весовая функция распределения.
Замечания
- Если «standard_dev» не является числом, то возвращается #VALUE! значение ошибки #ЗНАЧ!.
- Если standard_dev ≤ 0, то нормДАТ возвращает #NUM! значение ошибки #ЗНАЧ!.
- Если среднее = 0, стандартное_откл = 1 и интегральная = ИСТИНА, то функция НОРМРАСП возвращает стандартное нормальное распределение, т. е. НОРМСТРАСП.
- Уравнение для плотности нормального распределения (аргумент «интегральная» содержит значение ЛОЖЬ) имеет следующий вид:
- Если аргумент «интегральная» имеет значение ИСТИНА, формула описывает интеграл с пределами от минус бесконечности до x.
Пример
Скопируйте образец данных из следующей таблицы и вставьте их в ячейку A1 нового листа Excel. Чтобы отобразить результаты формул, выделите их и нажмите клавишу F2, а затем — клавишу ВВОД. При необходимости измените ширину столбцов, чтобы видеть все данные.
Значение, для которого нужно вычислить распределение
Среднее арифметическое распределения
Стандартное отклонение распределения
Интегральная функция распределения для приведенных выше условий
Функция плотности распределения для приведенных выше условий

Нужна дополнительная помощь?
Нужны дополнительные параметры?
Изучите преимущества подписки, просмотрите учебные курсы, узнайте, как защитить свое устройство и т. д.




В сообществах можно задавать вопросы и отвечать на них, отправлять отзывы и консультироваться с экспертами разных профилей.
Как выполнить тест на нормальность в Excel (шаг за шагом)

Многие статистические тесты предполагают, что значения в наборе данных имеют нормальное распределение .
Один из самых простых способов проверить это предположение — выполнить тест Харке-Бера , который представляет собой тест согласия, который определяет, имеют ли выборочные данные асимметрию и эксцесс, соответствующие нормальному распределению.
В этом тесте используются следующие гипотезы:
H 0 : Данные нормально распределены.
H A : Данные не распределены нормально.
Тестовая статистика JB определяется как:
JB = (n/6) * (S 2 + (C 2 /4))
При нулевой гипотезе нормальности JB ~ X 2 (2).
Если значение p , соответствующее тестовой статистике, меньше некоторого уровня значимости (например, α = 0,05), то мы можем отклонить нулевую гипотезу и сделать вывод, что данные не распределены нормально.
В этом руководстве представлен пошаговый пример того, как выполнить тест Харке-Бера для заданного набора данных в Excel.
Шаг 1: Создайте данные
Во-первых, давайте создадим поддельный набор данных с 15 значениями:

Шаг 2: Рассчитайте тестовую статистику
Затем рассчитайте статистику теста JB. В столбце E показаны используемые формулы:

Тестовая статистика оказывается 1,0175 .
Шаг 3: Рассчитайте P-значение
При нулевой гипотезе нормальности тестовая статистика JB следует распределению хи-квадрат с 2 степенями свободы.
Итак, чтобы найти p-значение для теста, мы будем использовать следующую функцию в Excel: =CHISQ.DIST.RT(статистика теста JB, 2)

Значение p теста составляет 0,601244.Поскольку это p-значение не меньше 0,05, мы не можем отвергнуть нулевую гипотезу. У нас нет достаточных доказательств того, что набор данных не имеет нормального распределения.
Другими словами, мы можем предположить, что данные распределены нормально.
Проверка выборки на нормальность распределения, хи-квадрат
Рисунок. Кривая нормального распределения. В процентах указаны объёмы выборки, попадающие в интервалы, измеренные в «сигмах» (=стандартных отклонениях для генеральной совокупности).
Проверка нормальности распределения по критерию согласия Пирсона хи-квадрат
Итак, мы имеем некую выборку из данных, полученных в результате наших измерений.
Если закон распределения генеральной совокупности, из которой взята наша выборка, неизвестен, то первое, что надо сделать — это проверить распределение в выборке на нормальность, т.е. соответствие закону нормального распределения (смотри: нормальное распределение ) .
У нас есть теоретически основания предполагать, что закон распределения есть и имеет какой-то определенный вид: назовем его А.
Проверяем нулевую гипотезу: генеральная совокупность распределена по закону А.
Проверка этой гипотезы производится при помощи специально подобранной случайной величины – критерия согласия.
Критерием согласия называют критерий проверки гипотезы о предполагаемом законе неизвестного распределения.
Имеется несколько критериев согласия. Наиболее часто используется критерий согласия К.Пирсона («хи-квадрат»). Здесь мы ограничимся применением критерия Пирсона к проверке гипотезы о нормальном распределении генеральной совокупности.
Пусть по выборке объёма n получено следующее эмпирическое распределение:


Допустим, что в предположении нормального распределения генеральной совокупности вычислены теоретические частоты . При уровне значимости требуется проверить нулевую гипотезу: генеральная совокупность распределена нормально.
В качестве критерия проверки нулевой гипотезы примем случайную величину:
Естественно, что чем меньше различаются эмпирические и теоретические частоты, тем меньше величина критерия, и, следовательно, он характеризует близость эмпирического и теоретического распределений.
Доказано, что при n→∞ закон распределения случайной величины (А) стремится к закону распределения с степенями свободы независимо от того, какому закону распределения подчинена генеральная совокупность. Поэтому сам критерий называют критерием согласия .

Построим правостороннюю критическую область, исходя из требования, чтобы вероятность попадания критерия в эту область в предположении справедливости нулевой гипотезы была равна принятому уровню значимости :

Если – то нет оснований отвергать нулевую гипотезу. В противном случае нулевую гипотезу отвергают, считая, что генеральная совокупность не распределена по нормальному закону.
Объём выборки должен быть достаточно велик (не менее 50). Каждая группа должна содержать не менее 5–8 вариант, а малочисленные группы следует объединять в одну, суммируя частоты.
Поскольку возможны ошибки первого и второго рода, следует проявлять осторожность. Например, можно повторить опыт, увеличить число наблюдений, построить предварительно график распределения и т.п.
При уровне значимости 0,05 проверить гипотезу о нормальном распределении генеральной совокупности, если известны эмпирические и теоретические частоты:

Так как , то нет оснований отвергать нулевую гипотезу. Данные наблюдений согласуются с гипотезой о нормальном распределении генеральной совокупности.
Проверка выборки на нормальность распределения, хи-квадрат | Кинезиолог
Рисунок. Кривая нормального распределения. В процентах указаны объёмы выборки, попадающие в интервалы, измеренные в «сигмах» (=стандартных отклонениях для генеральной совокупности).

[expert_bq закон распределения генеральной совокупности, из которой взята наша выборка, неизвестен, то первое, что надо сделать — это проверить распределение в выборке на нормальность, т. Если же вы хотите что-то уточнить, обращайтесь ко мне![/expert_bq] В библиотеке pandas функции для вычисления дисперсии (варианса) и стандартного отклонения имплементированы соответственно, как var и std . При этом последняя по умолчанию вычисляет несмещенное значение, поэтому, чтобы получить тот же самый результат, нужно применить именованный аргумент ddof=0 , который сообщает, что требуется вычислить смещенное значение стандартного отклонения:
Q-Q Plots. От чайника до профессионала за один гайд / Хабр
Среднее арифметическое и медиана являются двумя альтернативными способами описания среднего значения последовательности, но сами по себе они мало что говорят о содержащихся в ней значениях. Например, если известно, что среднее последовательности из девяноста девяти значений равно 50, то мы почти ничего не скажем о том, какого рода значения последовательность содержит.
Расширяя границы или о задаче проверки гипотезы о нормальности многомерного распределения
Схема проверки статистической гипотезы о нормальности многомерного распределения идентична соответствующей для одномерного случая, только в ней используются другие тесты.

n — количество наблюдений, р – переменных
При этом m – это расстояние Маланхобиса между i-м и j-м наблюдениями

S — ковариационная матрицы
В такой трактовке рассчитанная величина асимметрии, умноженная на n/6, распределена по закону Хи-квадрат с p(p+1)(p+2)/6 степенями свободы, а величина эксцесса распределена по закону нормального распределения со средним p(p+2) и отклонением 8p(p+2)/n
D – расстояние Маланхобиса, β – параметр
Значения критерия распределены по логнормальному закону с параметрами

Тест Ройстона основан на идее теста Шапиро-Уилкса. Значение статистического критерия рассчитывается по формуле

Его величина распределяется по закону Хи-квадрат с количеством степеней свободы, равным е. Цепочка расчетов следующая:

Wj – значение статистики Шапиро-Уилка для j-ой переменной, r – коэффициент корреляции
Далее рассчитывается эксцесс и асимметрия для каждой переменной в новой матрице.
Значения асимметрии (b1) и эксцесса (b2) распределены не по нормальному закону. Для их трансформации применяются следующие преобразования:

Полученные значения z1 и z2 объединяются в вектора Z1 и Z2, а рассчитанная величина статистики распределена по закону Хи-квадрат с числом степеней свободы, равном 2k
Формула расчета тестовой статистики

n – количество наблюдений, d – количество переменных
y – центрированная матрица наблюдений, получаемая путем постолбцовых пребразований как

Методология
Для примера выберем базу данных “Crime” из пакета plm, и возьмем оттуда три переменных:
pctymle – доля в населении мужчин в возрасте 15-24 лет
Из этих трех переменных соберем две базы данных – с двумя и тремя переменными:
Расчеты и описание
Базовая функция расчетов – функция mvn со следующими параметрами:
mvnTest — Определяет статистический тест, которым проводится проверка
desc — Логическая переменная. Если она равна истине, выводятся описательные статистики
univariateTest — Определяет статистический тест, которым проводится проверка на нормальность отдельных переменных
univariatePlot — Определяет вид выводимого одномерного графика нормальности
Проверим наши данные на нормальность с помощью классического теста Мардиа



Цифры — соответствующие квантили
Можно также вывести, например, Q-Q график по каждой переменной в отдельности
Особенно интересна возможность, предоставляемая переменной subset. Если есть группировочная переменная, есть возможность проверить многомерные / одномерные нормальности в зависимости от разных ее значений:
[expert_bq если известно, что среднее последовательности из девяноста девяти значений равно 50, то мы почти ничего не скажем о том, какого рода значения последовательность содержит. Если же вы хотите что-то уточнить, обращайтесь ко мне![/expert_bq] Когда квантили делят диапазон на четыре равных диапазона, как показано выше, то они называются квартилями. Разница между нижним (0.25) и верхним (0.75) квартилями называется межквартильным размахом, или иногда сокращенно МКР. Аналогично дисперсии (варианса) вокруг среднего значения, межквартильный размах измеряет разброс данных вокруг медианы.
Python, исследование данных и выборы: часть 2 / Хабр
Мы разобрались с основными понятиями и выяснили, что QQ-Plot нормального распределения или выборки из нормального распределения хорошо визуализирует медиану и стандартное отклонение, чем являются коэффициенты прямой.
