StatBlank
← Все методы

Критерий Колмогорова-Смирнова — проверка нормальности

Критерий Колмогорова-Смирнова проверяет, согласуется ли ваш ряд измерений с нормальным распределением. Ряд нужен ровно один: метод отвечает не на вопрос «различаются ли группы», а на вопрос «можно ли дальше применять параметрические критерии». Калькулятор считает вариант с поправкой Лиллиефорса — тот самый, что показывают SPSS и Statistica, когда среднее и σ оценены по самой выборке. Введите значения в таблицу: получите статистику D, критическое значение при выбранном уровне значимости, p-уровень, гистограмму и готовую фразу для диплома.

Под одним названием живут две разные задачи

Одновыборочный — считает этот калькулятор

Один ряд измерений сравнивается с теоретическим законом — нормальным. Это и есть «проверка нормальности», которую просят сделать перед выбором основного критерия. Отвечает на вопрос: можно ли применять параметрические методы.

Двухвыборочный (критерий Смирнова) — другая задача

Сравниваются между собой два эмпирических распределения: различаются ли две группы. Нормальность там ни при чём. Для этой задачи в дипломах берут критерий Манна-Уитни — он мощнее и понятнее для комиссии, а на явно разошедшихся рядах Q-критерий Розенбаума.

Путаница возникает из-за названия: «Колмогорова-Смирнова» называют оба варианта. Если в задании написано «сравнить распределения двух групп» — вам нужен второй, и эта страница не подойдёт.

Один столбец — один показательКаждая строка — одно измерение: индекс Руфье, балл теста, время в секундах, число повторений. Проверяют всегда ОДИН ряд чисел, а не две группы. Дробные — через запятую: 9,7.

Сколько нужно значенийКритерий считается от 5 наблюдений, но осмысленным становится от 30–50: это его родная область. На выборке меньше 30 берите критерий Шапиро-Уилка — он мощнее и находит отклонение там, где Колмогоров-Смирнов его пропускает.

Таблица заполнена примером

Чтобы вы посмотрели, как работает калькулятор. Это индекс Руфье у 32 студентов первого курса: у нескольких сердце восстанавливается плохо, их значения вытягивают правый хвост — поэтому распределение у самой границы нормальности. Методика — проба Руфье.

Наблюдение \ Значение

Названия можно переписать — они попадут в результат и в таблицу для диплома. Если столбцов много, таблица прокручивается вбок. Данные из Excel вставляются целиком: скопируйте диапазон и вставьте в первую ячейку.

Уровень значимости — допустимая вероятность по ошибке забраковать нормальное распределение. При α = 0,05 такая ошибка допускается не чаще чем в пяти случаях из ста. Для педагогических и психологических исследований этого почти всегда достаточно. Выбирают уровень до расчёта, а не подгоняют под результат — это грубая ошибка, которую замечают на защите. Подробнее: что такое p-значение и ось значимости.

Ничего не понятно или не хотите разбираться?

Закажите проверку у эксперта: он определит распределение, подберёт основной критерий под вашу тему, посчитает и оформит таблицы по ГОСТ. Останется вставить в работу.

Заказать расчёт у эксперта

Одновыборочный и двухвыборочный — это разные задачи

Под названием «критерий Колмогорова-Смирнова» живут два разных метода, и их постоянно путают. Одновыборочный сравнивает ваши данные с ТЕОРЕТИЧЕСКИМ законом — обычно нормальным. Это и есть проверка нормальности, её делают перед выбором основного критерия. Именно её считает калькулятор на этой странице.

Двухвыборочный (его правильнее называть критерием Смирнова) сравнивает между собой ДВА эмпирических распределения: различаются ли контрольная и экспериментальная группы. Нормальность там ни при чём, и результат этой страницы к такой задаче отношения не имеет.

Если в задании написано «сравнить распределения двух групп», берите критерий Манна-Уитни: в педагогике, психологии и спорте он мощнее двухвыборочного Колмогорова-Смирнова и понятнее комиссии. Когда ряды почти не перекрываются, подойдёт и Q-критерий Розенбаума.

Поправка Лиллиефорса — почему без неё считать нельзя

«Чистый» критерий Колмогорова построен на допущении, что нормальный закон известен заранее: среднее и стандартное отклонение взяты из норматива, а не посчитаны по вашим числам. Тогда работают привычные границы 1,36/√n и 1,63/√n.

При проверке нормальности параметры почти всегда оценивают по той же выборке. Подогнанная кривая проходит ближе к данным, статистика D систематически занижается, и классические критические значения оказываются завышенными. Критерий становится слишком консервативным: он почти никогда не находит ненормальности, даже когда перекос виден на гистограмме невооружённым глазом.

Поправка Лиллиефорса (H. W. Lilliefors, 1967) — это тот же самый D, но со своим, гораздо более строгим распределением. Разница огромна: при 30 наблюдениях критическое D по Лиллиефорсу равно 0,159, а по классической таблице — 0,248. Калькулятор считает вариант с поправкой и рядом показывает классический результат, чтобы было видно цену вопроса.

В работе так и пишите: «критерий Колмогорова-Смирнова с поправкой Лиллиефорса». Это грамотнее, снимает вопрос на защите и объясняет, почему ваше критическое значение не совпадает с таблицей из методички.

Как читать результат

Статистика D — наибольший просвет между накопленной долей ваших наблюдений и той же долей у нормального закона. Чем D меньше, тем ближе данные к нормальному распределению. Правило вывода прямое: если D БОЛЬШЕ критического, нормальность отклоняется.

p-уровень читается «наоборот»: большой p — это хорошо. При p > 0,05 распределение можно считать нормальным и применять параметрические методы; при p < 0,05 оно значимо отличается от нормального, и нужны ранговые критерии.

Вывод по критическому значению и вывод по p-уровню у нас не могут разойтись: критическое D находится обращением того же p-уровня, а не по приближённой формуле.

Что делать по результату проверки

РезультатЧто это значитКакой критерий брать дальше
D < D кр, p > 0,05Распределение можно считать нормальнымСтьюдент, ANOVA, корреляция Пирсона
D > D кр, p < 0,05Распределение отличается от нормальногоМанна-Уитни, Вилкоксон, Спирмен
n меньше 30Критерий слабо чувствителен, вывод ненадёженЛучше критерий Шапиро-Уилка

Таблица критических значений D

Статистику D сравнивают с критическим значением для своего объёма выборки n и уровня значимости. Значения в таблице посчитаны так же, как их считает калькулятор, — они совпадут клетка в клетку.

Последний столбец приведён для сравнения: это классические границы (1,36/√n), которые годятся, только когда параметры распределения известны заранее. Видно, насколько они мягче, — на них и списывают большинство «нормальных» результатов в чужих онлайн-калькуляторах.

Показать таблицу критических значений D
nЛиллиефорс, α = 0,05Лиллиефорс, α = 0,01Классическое, α = 0,05
50,3460,3960,607
60,3230,3700,554
70,3040,3490,513
80,2880,3310,480
90,2740,3160,453
100,2620,3020,429
120,2420,2800,392
140,2260,2620,363
160,2130,2470,340
180,2020,2340,320
200,1930,2240,304
250,1740,2020,272
300,1590,1850,248
400,1390,1620,215
500,1250,1450,192
600,1140,1330,175
800,0990,1160,152
1000,0890,1040,136

Для промежуточных n и для n больше 100 калькулятор считает критическое значение сам. Ориентир при n больше 30: 0,886/√n при α = 0,05 и 1,031/√n при α = 0,01 — это и есть асимптотическая строка таблицы Лиллиефорса.

Колмогоров-Смирнов или Шапиро-Уилк

Оба критерия проверяют одно и то же, но с разной чувствительностью. Шапиро-Уилк заметно мощнее на малых и средних выборках — примерно до 50 наблюдений он находит отклонение там, где Колмогоров-Смирнов его пропускает. Если выбор за вами, для дипломной выборки в 20–40 человек берите Шапиро-Уилка.

Колмогорова-Смирнова оставляют для больших выборок и для случаев, когда его прямо требует методичка или научный руководитель. На выборке в несколько сотен наблюдений оба критерия становятся излишне придирчивыми: они бракуют нормальность из-за мелочей, не мешающих применять параметрические методы, поэтому вывод там подкрепляют гистограммой, асимметрией и эксцессом.

Калькулятор показывает результат Шапиро-Уилка на тех же данных — для сверки. Если выводы разошлись, значит вы у самой границы значимости: укажите в работе оба и объясните, какой критерий выбрали и почему.

Можно ли посчитать критерий в Excel и SPSS

Готовой функции в Excel нет. Пришлось бы вручную отсортировать данные, посчитать для каждого значения нормальную функцию распределения через НОРМ.РАСП, сравнить её с накопленной долей и найти максимальное расхождение — а потом ещё где-то взять критическое значение с поправкой Лиллиефорса.

В SPSS критерий лежит в «Анализ → Описательные статистики → Разведочный анализ → Графики → Критерии нормальности с графиками» и выводится строкой «Колмогоров-Смирнов» со сноской «Коррекция значимости Лиллиефорса». Именно это значение и считает наш калькулятор, поэтому числа совпадут.

Как оформить результат в дипломе

Проверку нормальности описывают одним абзацем перед основным расчётом. Готовая формулировка (подставьте свои числа — калькулятор соберёт её сам после расчёта):

«Нормальность распределения показателя проверена критерием Колмогорова-Смирнова с поправкой Лиллиефорса (n = 32; M = 9,71; σ = 3,20). Эмпирическое значение D = 0,163 превышает критическое D кр = 0,155 при α = 0,05, p = 0,031, поэтому гипотеза о нормальности отклонена и в дальнейшем применялись непараметрические методы».

Если распределение нормальным оказалось, конец фразы меняется: «…D = 0,110 не превышает критического D кр = 0,155 при α = 0,05, p = 0,418, поэтому распределение признано соответствующим нормальному закону и в дальнейшем применялись параметрические методы».

Рядом обычно ставят таблицу с n, M, σ, D, D кр и p и гистограмму распределения — калькулятор выгружает и то и другое в Word одним файлом. Слова «с поправкой Лиллиефорса» не выбрасывайте: без них проверяющий не сойдётся с вашим критическим значением.

Частые вопросы

Связанные методы