Двухвыборочный критерий Колмогорова-Смирнова — калькулятор
Двухвыборочный критерий Колмогорова-Смирнова (критерий Смирнова) отвечает на вопрос, который остальные критерии обходят стороной: различаются ли два распределения ЦЕЛИКОМ. Две группы могут иметь одинаковые средние и почти совпадающие медианы, но выглядеть совершенно по-разному: в одной результаты кучные, в другой разошлись на два полюса. Критерий Стьюдента и критерий Манна-Уитни такое различие пропускают — они ищут сдвиг уровня. Здесь же сравниваются накопленные частоты, и учитывается любое расхождение: по уровню, по разбросу, по форме. Введите два ряда чисел — калькулятор посчитает D, точный p-уровень и покажет, где именно распределения разошлись.
Этот критерий сравнивает два распределения между собой — целиком, а не только по среднему
Вам сюда: две выборки
Есть два ряда чисел от РАЗНЫХ людей: контрольная и экспериментальная группа, юноши и девушки, спортсмены и новички. Вопрос — различаются ли распределения признака: по уровню, по разбросу или по форме. Ни о какой нормальности речи не идёт, она тут не нужна.
Вам не сюда: один ряд и проверка нормальности
Если ряд ОДИН и вы проверяете, подчиняется ли он нормальному закону (чтобы потом выбрать между Стьюдентом и Манна-Уитни), нужен одновыборочный критерий Колмогорова-Смирнова. Название почти то же, а задача другая: там ваши данные сравниваются с теоретической кривой, здесь — две группы друг с другом.
Зачем он, если есть Манна-Уитни. U-критерий ищет сдвиг: «в одной группе значения систематически выше». Если группы отличаются не уровнем, а формой — в одной результаты кучные, в другой разошлись на два полюса, — суммы рангов остаются почти равными, и Манна-Уитни различий не находит. Колмогоров-Смирнов смотрит на накопленные частоты и ловит любое расхождение распределений. Чтобы это было видно, калькулятор считает оба критерия и показывает их рядом.
Две группы — два столбцаСтолбец — состав людей: контрольная и экспериментальная группа, спортсмены и не занимающиеся спортом. Строки между собой не связаны, число участников в группах может отличаться — лишние клетки оставьте пустыми. Замеры «до и после» у одних и тех же людей этим критерием не сравнивают.
Что писать в клеткахИзмеренное значение признака: баллы методики, проценты, секунды, индекс. Дробные — через запятую: 73,6. Названия групп в шапке перепишите под свою работу — они попадут и в результат, и в таблицу для диплома.
Таблица заполнена примером
Чтобы вы посмотрели, как работает калькулятор. Это индекс Гарвардского степ-теста (ИГСТ) у двух групп студентов по 30 человек. В контрольной группе значения кучные, в экспериментальной разошлись на два полюса: часть студентов заметно прибавила, часть нагрузку не перенесла. Средние при этом совпали почти в точности — 73,4 против 73,3, — и ни критерий Стьюдента, ни Манна-Уитни различий тут не находят. Нажмите «Рассчитать» и посмотрите, что скажет Колмогоров-Смирнов.
| Участник \ Группа | ||
|---|---|---|
Названия можно переписать — они попадут в результат и в таблицу для диплома. Если столбцов много, таблица прокручивается вбок. Данные из Excel вставляются целиком: скопируйте диапазон и вставьте в первую ячейку.
Уровень значимости — это допустимая вероятность ошибиться, признав различие распределений там, где его на самом деле нет. При α = 0,05 такая ошибка допускается не чаще чем в пяти случаях из ста. Для педагогических и психологических исследований этого почти всегда достаточно. От выбранного уровня зависит критическое значение D: при двух группах по 30 человек это 0,367 для 0,05 и уже 0,433 для 0,01. Выбирают уровень до расчёта, а не подгоняют под результат — это грубая ошибка, которую замечают на защите. Подробнее: что такое p-значение и ось значимости.
Ничего не понятно или не хотите разбираться?
Закажите расчёт у эксперта: он определит, сравнивать ли распределения целиком или достаточно сравнить уровни, посчитает и напишет готовый вывод. Останется вставить в работу.
Заказать расчёт у экспертаКогда применять двухвыборочный критерий
Метод нужен, когда есть два ряда измерений от разных людей и вопрос стоит не «где больше», а «одинаково ли устроен признак в двух группах». Никакой нормальности он не требует и шкалу признака не ограничивает — годятся баллы, проценты, секунды, индексы. Типичные задачи из дипломов:
- Экспериментальная программа сработала неодинаково: часть студентов заметно прибавила, часть просела, среднее не сдвинулось. Нужно доказать, что группы всё-таки различаются.
- Сравнить однородность двух групп: в одной результаты кучные, в другой разброс вдвое шире при том же уровне.
- Показать, что после воздействия распределение стало «двугорбым» — появились две подгруппы вместо одной.
- Сравнить форму распределения одного показателя у юношей и девушек, у спортсменов и не занимающихся спортом.
- Если различие ожидается именно в уровне («в экспериментальной группе показатель выше»), берите критерий Манна-Уитни: против сдвига он чувствительнее.
- Если данные — это замеры «до и после» у одних и тех же людей, критерий не подходит вовсе: он рассчитан на две независимые выборки. Нужен критерий Вилкоксона.
- Если признак задан категориями («низкий / средний / высокий», тип темперамента), а не числами, распределения сравнивают критерием χ² по таблице сопряжённости.
Чем это отличается от проверки на нормальность
На сайте есть вторая страница с почти таким же названием — одновыборочный критерий Колмогорова-Смирнова (страница /calc/kriteriy-kolmogorova-smirnova). Названия совпадают, задачи разные, и путают их постоянно.
Там ряд ОДИН, и он сравнивается с теоретической кривой — нормальным законом с вашими средним и σ. Это проверка нормальности: её делают перед выбором между критерием Стьюдента и Манна-Уитни. Ответ на выходе: «данные можно считать нормальными» или «нельзя».
Здесь рядов ДВА, и они сравниваются между собой. Никакого нормального закона нет вовсе: сравниваются две эмпирические ступенчатые линии. Ответ на выходе: «распределения в группах различаются» или «не различаются». Это уже не подготовка к анализу, а сам анализ — результат, который идёт в главу с выводами.
Историческая справка, которая снимает путаницу: одновыборочный вариант предложил А. Н. Колмогоров в 1933 году, двухвыборочный — Н. В. Смирнов в 1939-м. Поэтому строго правильно говорить «критерий Колмогорова» для одной выборки и «критерий Смирнова» для двух, а привычное «критерий Колмогорова-Смирнова» относится к обоим сразу. В дипломе достаточно написать «двухвыборочный критерий Колмогорова-Смирнова», и вопросов не будет.
Две страницы с похожим названием
| Одновыборочный (/calc/kriteriy-kolmogorova-smirnova) | Двухвыборочный (эта страница) | |
|---|---|---|
| Что на входе | Один ряд чисел | Два ряда чисел от разных людей |
| С чем сравнивается | С нормальным законом | Одна группа с другой |
| Что проверяется | Согласие с нормальным распределением | Совпадение двух распределений |
| Зачем нужно | Выбрать метод дальнейшего анализа | Получить результат для главы выводов |
| Автор | А. Н. Колмогоров, 1933 | Н. В. Смирнов, 1939 |
Если вы пришли за фразой «проверка нормальности распределения» — вам на соседнюю страницу. Если за сравнением двух групп — вы там, где нужно.
Чем отличается от Манна-Уитни и когда даёт больше
U-критерий Манна-Уитни устроен так: все значения обеих групп выстраиваются в общий ряд и заменяются рангами, после чего сравниваются суммы рангов. Он отвечает на вопрос «в какой группе значения систематически больше», то есть ищет СДВИГ.
Представьте две группы по тридцать человек с одним и тем же средним. В первой значения плотно собраны вокруг середины. Во второй они разошлись: треть ушла заметно вниз, треть заметно вверх, треть осталась в середине. Ранги низких значений второй группы компенсируются рангами высоких, суммы рангов выравниваются, и U-критерий честно отвечает: различий нет. Критерий Стьюдента отвечает так же — средние-то совпали.
Колмогоров-Смирнов смотрит на другое: какая доля группы уже набралась к каждому значению признака. В нашем примере к нижней трети шкалы во второй группе набралось уже 37 % участников, а в первой — ни одного. Это расхождение в 0,37 и есть статистика D, и на выборках по тридцать человек оно значимо. Именно так устроен пример, которым открывается калькулятор: Манна-Уитни даёт p = 0,73, Стьюдент — p = 0,99, а Колмогоров-Смирнов — p = 0,035.
Обратная сторона общности — потеря чувствительности. Там, где различие действительно сводится к сдвигу, Манна-Уитни мощнее: он использует ранги всех наблюдений, а Колмогоров-Смирнов — только точку наибольшего расхождения. Поэтому метод выбирают ДО расчёта, исходя из гипотезы, а не после, глядя, где p меньше. Подгонка метода под результат — самая заметная ошибка на защите, и калькулятор специально показывает оба числа рядом, чтобы вы понимали, что именно выбираете.
Какой критерий что улавливает
| Как различаются группы | Стьюдент | Манна-Уитни | Колмогоров-Смирнов |
|---|---|---|---|
| Средние сдвинуты, форма одна | улавливает | улавливает | улавливает слабее |
| Сдвиг есть, но распределение перекошено | ненадёжен | улавливает лучше всех | улавливает |
| Средние равны, разброс разный | не улавливает | почти не улавливает | улавливает |
| Средние равны, распределение «двугорбое» | не улавливает | не улавливает | улавливает |
| Различие только в хвостах распределения | не улавливает | не улавливает | улавливает при большой выборке |
«Не улавливает» здесь не фигура речи: на данных примера со степ-тестом Стьюдент даёт p = 0,99 при том, что распределения различаются наглядно.
Как читать график накопленных частот
Главный рисунок этой страницы — две ступенчатые линии. Каждая показывает, какая доля СВОЕЙ группы уже набралась к данному значению признака: на левом краю обе линии в нуле, на правом обе приходят к единице. Такую линию называют эмпирической функцией распределения, но проще думать о ней как о накопленном проценте.
Читается рисунок так. Возьмите любое значение на горизонтальной оси и проведите вверх вертикаль: она пересечёт обе линии, и вы увидите, сколько процентов каждой группы имеет показатель НЕ ВЫШЕ этого значения. Красный отрезок на рисунке отмечает то место, где этот просвет самый большой; его длина по вертикали и есть статистика D.
Что означает взаимное расположение линий. Если одна линия идёт целиком выше другой, значит она «набирается» раньше — в этой группе значения в среднем меньше; это чистый сдвиг, и его нашёл бы и Манна-Уитни. Если линии ПЕРЕСЕКАЮТСЯ, дело не в сдвиге: одна группа обгоняет другую внизу шкалы и отстаёт наверху, а это и есть разная форма распределения. Пересечение кривых — верный признак того, что вы взяли нужный критерий.
Крутизна линии показывает плотность: чем круче участок, тем больше человек попало в этот узкий диапазон. Кучная группа даёт одну крутую «ступень» в середине, поляризованная — две крутые ступени по краям и пологий участок между ними. Этот рисунок обязательно ставят в диплом рядом с расчётом: по одному числу D читатель не поймёт ничего, а по кривым видно, где именно группы разошлись.
Как понять результат и критические значения
Статистика D меняется от 0 до 1. Ноль означает, что накопленные частоты совпали в каждой точке — распределения неотличимы. Единица означает, что группы не пересекаются вовсе: все значения одной ниже всех значений другой. Реальные результаты дипломных работ лежат между 0,2 и 0,5.
Правило вывода прямое: различия значимы, когда эмпирическое D БОЛЬШЕ ИЛИ РАВНО критического. Это стоит подчеркнуть, потому что у соседних непараметрических критериев — Манна-Уитни, Вилкоксона, знаков — правило перевёрнутое, и студенты по привычке сравнивают наоборот.
Само D сравнивать между работами бессмысленно без объёма выборки: на двух группах по десять человек D = 0,5 незначимо, а на двух группах по пятьдесят — значимо с запасом. Приведённая величина λ = D·√(n₁·n₂/(n₁+n₂)) от объёма уже не зависит: ориентир — 1,36 на границе значимости при α = 0,05.
Калькулятор считает p-уровень точно — перебором всех способов разложить объединённую выборку на две группы (пока произведение объёмов не превышает 10 000; дальше берётся предельное распределение, ровно как в пакете R). Поэтому критические значения в таблице ниже получены не по приближённой формуле, а обращением того же точного распределения: они заметно строже приближения, особенно на малых выборках. Приближённая формула D = 1,36·√((n₁+n₂)/(n₁·n₂)) годится для групп примерно от 40 человек.
Критические значения D при равных объёмах групп ▾
| n в каждой группе | α = 0,05 | α = 0,01 |
|---|---|---|
| 5 | 1,000 | 1,000 |
| 6 | 0,833 | 1,000 |
| 7 | 0,857 | 0,857 |
| 8 | 0,750 | 0,875 |
| 9 | 0,667 | 0,778 |
| 10 | 0,700 | 0,800 |
| 12 | 0,583 | 0,667 |
| 14 | 0,571 | 0,643 |
| 15 | 0,533 | 0,600 |
| 16 | 0,500 | 0,625 |
| 18 | 0,500 | 0,556 |
| 20 | 0,450 | 0,550 |
| 22 | 0,409 | 0,500 |
| 25 | 0,400 | 0,480 |
| 28 | 0,393 | 0,464 |
| 30 | 0,367 | 0,433 |
| 35 | 0,343 | 0,400 |
| 40 | 0,325 | 0,375 |
| 45 | 0,289 | 0,356 |
| 50 | 0,280 | 0,340 |
Значения получены обращением точного распределения статистики, поэтому они не ложатся на гладкую кривую: D принимает только значения, кратные 1/n, и порог «прыгает» с шагом сетки. Отсюда же странности вроде «при n = 7 порог выше, чем при n = 6»: у семёрки ближайшее достижимое значение оказывается дальше от нужной вероятности. Для неравных групп критическое значение считает калькулятор — при любых объёмах и всех трёх уровнях значимости.
Совпадающие значения: почему это важно
Критерий выведен для непрерывных величин, где два измерения никогда не совпадают в точности. В баллах методик совпадения неизбежны: шкала из двадцати делений и шестьдесят человек — повторы гарантированы.
Что при этом ломается. Накопленная частота внутри группы одинаковых значений «не определена»: линия делает один большой скачок вместо нескольких мелких, и число возможных положений статистики уменьшается. Классическая таблица критических значений, составленная для случая без совпадений, становится слишком строгой, а критерий — консервативным: он реже находит различия, чем должен.
Как поступает калькулятор. Если совпадения есть, точный p-уровень считается условно — перебором по вашему же набору чисел вместе с их повторами (так же устроена функция psmirnov в R начиная с версии 4.2). Это честная вероятность для ваших данных, но сравнивать её с печатной таблицей из учебника нельзя, и калькулятор об этом прямо предупреждает жёлтым блоком.
Практический вывод. Когда совпадений много — скажем, показатель принимает всего десяток разных значений на шестьдесят человек, — критерий теряет чувствительность. Если гипотеза о сдвиге уровня, надёжнее взять Манна-Уитни: он на связки рассчитан и вводит на них поправку в формулу. Если гипотеза именно о форме распределения, критерий Колмогорова-Смирнова остаётся единственным вариантом, но объём выборки желательно увеличить.
Можно ли посчитать в Excel
Готовой функции для двухвыборочного критерия Колмогорова-Смирнова в Excel нет — ни в русской, ни в английской версии. СТЬЮДЕНТ.ТЕСТ, ХИ2.ТЕСТ и Ф.ТЕСТ есть, а этого критерия нет, и «Пакет анализа» его тоже не содержит. Поэтому в методичках его часто обходят стороной, хотя задача встречается постоянно.
Вручную посчитать можно, и это несложно. Отсортируйте каждую группу по возрастанию. Постройте общий список всех встречающихся значений. Для каждого значения посчитайте, сколько наблюдений первой группы ему не превышает, и разделите на n₁ — это накопленная частота первой группы; то же самое для второй. Вычтите одну от другой, возьмите модуль и найдите наибольшую разность по всему списку — это D.
Дальше начинаются трудности. Точный p-уровень руками не считается: он требует перебора сочетаний, которых у двух групп по тридцать человек больше 10 в 17-й степени. Остаётся приближение: сравнить D с критическим значением 1,36·√((n₁+n₂)/(n₁·n₂)) при α = 0,05 или 1,63·√((n₁+n₂)/(n₁·n₂)) при α = 0,01. На малых выборках это приближение занижает порог, то есть завышает значимость, — на границе оно может показать различия там, где точный расчёт их не подтверждает.
Проверить свой ручной расчёт удобно прямо здесь: калькулятор показывает и D, и точный p, и приближённый рядом. Если ваши D сошлись, а выводы разошлись — почти всегда дело в том, что в методичке использована приближённая формула. В работу берите точное значение и укажите, каким способом оно получено.
Как оформить результат в дипломе
В работе приводят: объёмы обеих групп, описательную статистику по каждой (среднее ± σ, медиана, размах), значение D, критическое значение при выбранном α, p-уровень и вывод словами. Отдельной фразой объясняют, почему взят именно этот критерий, — этот вопрос задают почти всегда.
Готовая формулировка: «Для сравнения распределений индекса Гарвардского степ-теста в контрольной (n₁ = 30) и экспериментальной (n₂ = 30) группах применён двухвыборочный критерий Колмогорова-Смирнова. В контрольной группе M = 73,36 ± 3,99, медиана 73,25; в экспериментальной M = 73,34 ± 13,28, медиана 72,05. Наибольшее расхождение накопленных частот составило D = 0,367 при критическом значении 0,367 (α = 0,05), p = 0,035. Различия распределений статистически значимы. При этом по уровню показателя группы не различаются (U-критерий Манна-Уитни: U = 426, p = 0,728), то есть различие носит характер иной формы распределения, а не сдвига».
Обоснование выбора метода пишут так: «поскольку гипотеза касалась не сдвига среднего уровня, а изменения характера распределения показателя, применён критерий, чувствительный к любым различиям распределений». Такая фраза снимает половину вопросов на защите.
Рисунок к этому абзацу обязателен — график накопленных частот с двумя кривыми. Калькулятор выгружает в Word таблицу накопленных частот, таблицу результатов расчёта и диаграмму; в файле всё редактируется под требования кафедры.