StatBlank
← Все методы

Двухвыборочный критерий Колмогорова-Смирнова — калькулятор

Двухвыборочный критерий Колмогорова-Смирнова (критерий Смирнова) отвечает на вопрос, который остальные критерии обходят стороной: различаются ли два распределения ЦЕЛИКОМ. Две группы могут иметь одинаковые средние и почти совпадающие медианы, но выглядеть совершенно по-разному: в одной результаты кучные, в другой разошлись на два полюса. Критерий Стьюдента и критерий Манна-Уитни такое различие пропускают — они ищут сдвиг уровня. Здесь же сравниваются накопленные частоты, и учитывается любое расхождение: по уровню, по разбросу, по форме. Введите два ряда чисел — калькулятор посчитает D, точный p-уровень и покажет, где именно распределения разошлись.

Этот критерий сравнивает два распределения между собой — целиком, а не только по среднему

Вам сюда: две выборки

Есть два ряда чисел от РАЗНЫХ людей: контрольная и экспериментальная группа, юноши и девушки, спортсмены и новички. Вопрос — различаются ли распределения признака: по уровню, по разбросу или по форме. Ни о какой нормальности речи не идёт, она тут не нужна.

Вам не сюда: один ряд и проверка нормальности

Если ряд ОДИН и вы проверяете, подчиняется ли он нормальному закону (чтобы потом выбрать между Стьюдентом и Манна-Уитни), нужен одновыборочный критерий Колмогорова-Смирнова. Название почти то же, а задача другая: там ваши данные сравниваются с теоретической кривой, здесь — две группы друг с другом.

Зачем он, если есть Манна-Уитни. U-критерий ищет сдвиг: «в одной группе значения систематически выше». Если группы отличаются не уровнем, а формой — в одной результаты кучные, в другой разошлись на два полюса, — суммы рангов остаются почти равными, и Манна-Уитни различий не находит. Колмогоров-Смирнов смотрит на накопленные частоты и ловит любое расхождение распределений. Чтобы это было видно, калькулятор считает оба критерия и показывает их рядом.

Две группы — два столбцаСтолбец — состав людей: контрольная и экспериментальная группа, спортсмены и не занимающиеся спортом. Строки между собой не связаны, число участников в группах может отличаться — лишние клетки оставьте пустыми. Замеры «до и после» у одних и тех же людей этим критерием не сравнивают.

Что писать в клеткахИзмеренное значение признака: баллы методики, проценты, секунды, индекс. Дробные — через запятую: 73,6. Названия групп в шапке перепишите под свою работу — они попадут и в результат, и в таблицу для диплома.

Таблица заполнена примером

Чтобы вы посмотрели, как работает калькулятор. Это индекс Гарвардского степ-теста (ИГСТ) у двух групп студентов по 30 человек. В контрольной группе значения кучные, в экспериментальной разошлись на два полюса: часть студентов заметно прибавила, часть нагрузку не перенесла. Средние при этом совпали почти в точности — 73,4 против 73,3, — и ни критерий Стьюдента, ни Манна-Уитни различий тут не находят. Нажмите «Рассчитать» и посмотрите, что скажет Колмогоров-Смирнов.

Участник \ Группа

Названия можно переписать — они попадут в результат и в таблицу для диплома. Если столбцов много, таблица прокручивается вбок. Данные из Excel вставляются целиком: скопируйте диапазон и вставьте в первую ячейку.

Уровень значимости — это допустимая вероятность ошибиться, признав различие распределений там, где его на самом деле нет. При α = 0,05 такая ошибка допускается не чаще чем в пяти случаях из ста. Для педагогических и психологических исследований этого почти всегда достаточно. От выбранного уровня зависит критическое значение D: при двух группах по 30 человек это 0,367 для 0,05 и уже 0,433 для 0,01. Выбирают уровень до расчёта, а не подгоняют под результат — это грубая ошибка, которую замечают на защите. Подробнее: что такое p-значение и ось значимости.

Ничего не понятно или не хотите разбираться?

Закажите расчёт у эксперта: он определит, сравнивать ли распределения целиком или достаточно сравнить уровни, посчитает и напишет готовый вывод. Останется вставить в работу.

Заказать расчёт у эксперта

Когда применять двухвыборочный критерий

Метод нужен, когда есть два ряда измерений от разных людей и вопрос стоит не «где больше», а «одинаково ли устроен признак в двух группах». Никакой нормальности он не требует и шкалу признака не ограничивает — годятся баллы, проценты, секунды, индексы. Типичные задачи из дипломов:

  • Экспериментальная программа сработала неодинаково: часть студентов заметно прибавила, часть просела, среднее не сдвинулось. Нужно доказать, что группы всё-таки различаются.
  • Сравнить однородность двух групп: в одной результаты кучные, в другой разброс вдвое шире при том же уровне.
  • Показать, что после воздействия распределение стало «двугорбым» — появились две подгруппы вместо одной.
  • Сравнить форму распределения одного показателя у юношей и девушек, у спортсменов и не занимающихся спортом.
  • Если различие ожидается именно в уровне («в экспериментальной группе показатель выше»), берите критерий Манна-Уитни: против сдвига он чувствительнее.
  • Если данные — это замеры «до и после» у одних и тех же людей, критерий не подходит вовсе: он рассчитан на две независимые выборки. Нужен критерий Вилкоксона.
  • Если признак задан категориями («низкий / средний / высокий», тип темперамента), а не числами, распределения сравнивают критерием χ² по таблице сопряжённости.

Чем это отличается от проверки на нормальность

На сайте есть вторая страница с почти таким же названием — одновыборочный критерий Колмогорова-Смирнова (страница /calc/kriteriy-kolmogorova-smirnova). Названия совпадают, задачи разные, и путают их постоянно.

Там ряд ОДИН, и он сравнивается с теоретической кривой — нормальным законом с вашими средним и σ. Это проверка нормальности: её делают перед выбором между критерием Стьюдента и Манна-Уитни. Ответ на выходе: «данные можно считать нормальными» или «нельзя».

Здесь рядов ДВА, и они сравниваются между собой. Никакого нормального закона нет вовсе: сравниваются две эмпирические ступенчатые линии. Ответ на выходе: «распределения в группах различаются» или «не различаются». Это уже не подготовка к анализу, а сам анализ — результат, который идёт в главу с выводами.

Историческая справка, которая снимает путаницу: одновыборочный вариант предложил А. Н. Колмогоров в 1933 году, двухвыборочный — Н. В. Смирнов в 1939-м. Поэтому строго правильно говорить «критерий Колмогорова» для одной выборки и «критерий Смирнова» для двух, а привычное «критерий Колмогорова-Смирнова» относится к обоим сразу. В дипломе достаточно написать «двухвыборочный критерий Колмогорова-Смирнова», и вопросов не будет.

Две страницы с похожим названием

Одновыборочный (/calc/kriteriy-kolmogorova-smirnova)Двухвыборочный (эта страница)
Что на входеОдин ряд чиселДва ряда чисел от разных людей
С чем сравниваетсяС нормальным закономОдна группа с другой
Что проверяетсяСогласие с нормальным распределениемСовпадение двух распределений
Зачем нужноВыбрать метод дальнейшего анализаПолучить результат для главы выводов
АвторА. Н. Колмогоров, 1933Н. В. Смирнов, 1939

Если вы пришли за фразой «проверка нормальности распределения» — вам на соседнюю страницу. Если за сравнением двух групп — вы там, где нужно.

Чем отличается от Манна-Уитни и когда даёт больше

U-критерий Манна-Уитни устроен так: все значения обеих групп выстраиваются в общий ряд и заменяются рангами, после чего сравниваются суммы рангов. Он отвечает на вопрос «в какой группе значения систематически больше», то есть ищет СДВИГ.

Представьте две группы по тридцать человек с одним и тем же средним. В первой значения плотно собраны вокруг середины. Во второй они разошлись: треть ушла заметно вниз, треть заметно вверх, треть осталась в середине. Ранги низких значений второй группы компенсируются рангами высоких, суммы рангов выравниваются, и U-критерий честно отвечает: различий нет. Критерий Стьюдента отвечает так же — средние-то совпали.

Колмогоров-Смирнов смотрит на другое: какая доля группы уже набралась к каждому значению признака. В нашем примере к нижней трети шкалы во второй группе набралось уже 37 % участников, а в первой — ни одного. Это расхождение в 0,37 и есть статистика D, и на выборках по тридцать человек оно значимо. Именно так устроен пример, которым открывается калькулятор: Манна-Уитни даёт p = 0,73, Стьюдент — p = 0,99, а Колмогоров-Смирнов — p = 0,035.

Обратная сторона общности — потеря чувствительности. Там, где различие действительно сводится к сдвигу, Манна-Уитни мощнее: он использует ранги всех наблюдений, а Колмогоров-Смирнов — только точку наибольшего расхождения. Поэтому метод выбирают ДО расчёта, исходя из гипотезы, а не после, глядя, где p меньше. Подгонка метода под результат — самая заметная ошибка на защите, и калькулятор специально показывает оба числа рядом, чтобы вы понимали, что именно выбираете.

Какой критерий что улавливает

Как различаются группыСтьюдентМанна-УитниКолмогоров-Смирнов
Средние сдвинуты, форма однаулавливаетулавливаетулавливает слабее
Сдвиг есть, но распределение перекошеноненадёженулавливает лучше всехулавливает
Средние равны, разброс разныйне улавливаетпочти не улавливаетулавливает
Средние равны, распределение «двугорбое»не улавливаетне улавливаетулавливает
Различие только в хвостах распределенияне улавливаетне улавливаетулавливает при большой выборке

«Не улавливает» здесь не фигура речи: на данных примера со степ-тестом Стьюдент даёт p = 0,99 при том, что распределения различаются наглядно.

Как читать график накопленных частот

Главный рисунок этой страницы — две ступенчатые линии. Каждая показывает, какая доля СВОЕЙ группы уже набралась к данному значению признака: на левом краю обе линии в нуле, на правом обе приходят к единице. Такую линию называют эмпирической функцией распределения, но проще думать о ней как о накопленном проценте.

Читается рисунок так. Возьмите любое значение на горизонтальной оси и проведите вверх вертикаль: она пересечёт обе линии, и вы увидите, сколько процентов каждой группы имеет показатель НЕ ВЫШЕ этого значения. Красный отрезок на рисунке отмечает то место, где этот просвет самый большой; его длина по вертикали и есть статистика D.

Что означает взаимное расположение линий. Если одна линия идёт целиком выше другой, значит она «набирается» раньше — в этой группе значения в среднем меньше; это чистый сдвиг, и его нашёл бы и Манна-Уитни. Если линии ПЕРЕСЕКАЮТСЯ, дело не в сдвиге: одна группа обгоняет другую внизу шкалы и отстаёт наверху, а это и есть разная форма распределения. Пересечение кривых — верный признак того, что вы взяли нужный критерий.

Крутизна линии показывает плотность: чем круче участок, тем больше человек попало в этот узкий диапазон. Кучная группа даёт одну крутую «ступень» в середине, поляризованная — две крутые ступени по краям и пологий участок между ними. Этот рисунок обязательно ставят в диплом рядом с расчётом: по одному числу D читатель не поймёт ничего, а по кривым видно, где именно группы разошлись.

Как понять результат и критические значения

Статистика D меняется от 0 до 1. Ноль означает, что накопленные частоты совпали в каждой точке — распределения неотличимы. Единица означает, что группы не пересекаются вовсе: все значения одной ниже всех значений другой. Реальные результаты дипломных работ лежат между 0,2 и 0,5.

Правило вывода прямое: различия значимы, когда эмпирическое D БОЛЬШЕ ИЛИ РАВНО критического. Это стоит подчеркнуть, потому что у соседних непараметрических критериев — Манна-Уитни, Вилкоксона, знаков — правило перевёрнутое, и студенты по привычке сравнивают наоборот.

Само D сравнивать между работами бессмысленно без объёма выборки: на двух группах по десять человек D = 0,5 незначимо, а на двух группах по пятьдесят — значимо с запасом. Приведённая величина λ = D·√(n₁·n₂/(n₁+n₂)) от объёма уже не зависит: ориентир — 1,36 на границе значимости при α = 0,05.

Калькулятор считает p-уровень точно — перебором всех способов разложить объединённую выборку на две группы (пока произведение объёмов не превышает 10 000; дальше берётся предельное распределение, ровно как в пакете R). Поэтому критические значения в таблице ниже получены не по приближённой формуле, а обращением того же точного распределения: они заметно строже приближения, особенно на малых выборках. Приближённая формула D = 1,36·√((n₁+n₂)/(n₁·n₂)) годится для групп примерно от 40 человек.

Критические значения D при равных объёмах групп
n в каждой группеα = 0,05α = 0,01
51,0001,000
60,8331,000
70,8570,857
80,7500,875
90,6670,778
100,7000,800
120,5830,667
140,5710,643
150,5330,600
160,5000,625
180,5000,556
200,4500,550
220,4090,500
250,4000,480
280,3930,464
300,3670,433
350,3430,400
400,3250,375
450,2890,356
500,2800,340

Значения получены обращением точного распределения статистики, поэтому они не ложатся на гладкую кривую: D принимает только значения, кратные 1/n, и порог «прыгает» с шагом сетки. Отсюда же странности вроде «при n = 7 порог выше, чем при n = 6»: у семёрки ближайшее достижимое значение оказывается дальше от нужной вероятности. Для неравных групп критическое значение считает калькулятор — при любых объёмах и всех трёх уровнях значимости.

Совпадающие значения: почему это важно

Критерий выведен для непрерывных величин, где два измерения никогда не совпадают в точности. В баллах методик совпадения неизбежны: шкала из двадцати делений и шестьдесят человек — повторы гарантированы.

Что при этом ломается. Накопленная частота внутри группы одинаковых значений «не определена»: линия делает один большой скачок вместо нескольких мелких, и число возможных положений статистики уменьшается. Классическая таблица критических значений, составленная для случая без совпадений, становится слишком строгой, а критерий — консервативным: он реже находит различия, чем должен.

Как поступает калькулятор. Если совпадения есть, точный p-уровень считается условно — перебором по вашему же набору чисел вместе с их повторами (так же устроена функция psmirnov в R начиная с версии 4.2). Это честная вероятность для ваших данных, но сравнивать её с печатной таблицей из учебника нельзя, и калькулятор об этом прямо предупреждает жёлтым блоком.

Практический вывод. Когда совпадений много — скажем, показатель принимает всего десяток разных значений на шестьдесят человек, — критерий теряет чувствительность. Если гипотеза о сдвиге уровня, надёжнее взять Манна-Уитни: он на связки рассчитан и вводит на них поправку в формулу. Если гипотеза именно о форме распределения, критерий Колмогорова-Смирнова остаётся единственным вариантом, но объём выборки желательно увеличить.

Можно ли посчитать в Excel

Готовой функции для двухвыборочного критерия Колмогорова-Смирнова в Excel нет — ни в русской, ни в английской версии. СТЬЮДЕНТ.ТЕСТ, ХИ2.ТЕСТ и Ф.ТЕСТ есть, а этого критерия нет, и «Пакет анализа» его тоже не содержит. Поэтому в методичках его часто обходят стороной, хотя задача встречается постоянно.

Вручную посчитать можно, и это несложно. Отсортируйте каждую группу по возрастанию. Постройте общий список всех встречающихся значений. Для каждого значения посчитайте, сколько наблюдений первой группы ему не превышает, и разделите на n₁ — это накопленная частота первой группы; то же самое для второй. Вычтите одну от другой, возьмите модуль и найдите наибольшую разность по всему списку — это D.

Дальше начинаются трудности. Точный p-уровень руками не считается: он требует перебора сочетаний, которых у двух групп по тридцать человек больше 10 в 17-й степени. Остаётся приближение: сравнить D с критическим значением 1,36·√((n₁+n₂)/(n₁·n₂)) при α = 0,05 или 1,63·√((n₁+n₂)/(n₁·n₂)) при α = 0,01. На малых выборках это приближение занижает порог, то есть завышает значимость, — на границе оно может показать различия там, где точный расчёт их не подтверждает.

Проверить свой ручной расчёт удобно прямо здесь: калькулятор показывает и D, и точный p, и приближённый рядом. Если ваши D сошлись, а выводы разошлись — почти всегда дело в том, что в методичке использована приближённая формула. В работу берите точное значение и укажите, каким способом оно получено.

Как оформить результат в дипломе

В работе приводят: объёмы обеих групп, описательную статистику по каждой (среднее ± σ, медиана, размах), значение D, критическое значение при выбранном α, p-уровень и вывод словами. Отдельной фразой объясняют, почему взят именно этот критерий, — этот вопрос задают почти всегда.

Готовая формулировка: «Для сравнения распределений индекса Гарвардского степ-теста в контрольной (n₁ = 30) и экспериментальной (n₂ = 30) группах применён двухвыборочный критерий Колмогорова-Смирнова. В контрольной группе M = 73,36 ± 3,99, медиана 73,25; в экспериментальной M = 73,34 ± 13,28, медиана 72,05. Наибольшее расхождение накопленных частот составило D = 0,367 при критическом значении 0,367 (α = 0,05), p = 0,035. Различия распределений статистически значимы. При этом по уровню показателя группы не различаются (U-критерий Манна-Уитни: U = 426, p = 0,728), то есть различие носит характер иной формы распределения, а не сдвига».

Обоснование выбора метода пишут так: «поскольку гипотеза касалась не сдвига среднего уровня, а изменения характера распределения показателя, применён критерий, чувствительный к любым различиям распределений». Такая фраза снимает половину вопросов на защите.

Рисунок к этому абзацу обязателен — график накопленных частот с двумя кривыми. Калькулятор выгружает в Word таблицу накопленных частот, таблицу результатов расчёта и диаграмму; в файле всё редактируется под требования кафедры.

Частые вопросы

Связанные методы