StatBlank
194,0 ± 1,7 200,3 ± 1,7 p < 0,05 КГ, n = 12 ЭГ, n = 12 Прыжок в длину с места, см Достоверность различий t эмп 2,57 t крит (p = 0,05) 2,07 df 22 p 0,017 различия достоверны
Основы19 сентября 202620 мин чтения

Как доказать достоверность различий

Андрей Лазарев
Эксперт по мат. статистике, пишу работы на заказ

Разницу средних доказывает критерий, а не сами числа. Порог в дипломах p < 0,05. На ранговых шкалах Стьюдент не работает, на маленьких группах теряет чувствительность. Запись результата разобрана на примере.

Разница в шесть сантиметров между классами может оказаться случайной.

Расчет ниже верен для двух групп разных людей. Если вы измеряли одних и тех же до и после, нужен парный критерийСтатистический тест: расчет, который проверяет, случайна разница или нет. Парный считают для одних и тех же людей, измеренных дважды., а достоверность сдвига «до и после» доказывают иначе.

Итоговый выбор критерия и формулировку вывода согласуйте с научным руководителем: требования кафедр различаются.

В двух словах

Коротко для тех, кто уже собрал результаты и завтра сдает третью главу: чем достоверная разница отличается от случайной и какие числа должны стоять рядом с выводом.

  • Достоверность различий означает, что разница между группами больше, чем можно списать на случайный разбросНасколько сильно результаты людей внутри одной группы отличаются друг от друга.. Порог в дипломах: p < 0,05, в старой записи PДоверительная вероятность: тот же порог, записанный с другого конца шкалы. ≥ 0,95.
  • Выбор критерия по схеме сравнения. В методичках ее называют дизайномКого с кем сравнивают и сколько раз измеряли. исследования. Для двух групп разных людей берут t-критерий Стьюдента или U Манна-Уитни, для замеров «до и после» парный Стьюдент или T Вилкоксона.
  • Решение принимают по правилу: t эмп (число, которое выдал калькулятор) больше t крит (число из готовой таблицы в конце статьи), или p меньше 0,05, значит различия достоверны.
  • Пять чисел. В работу идут M ± mM это среднее по группе, m показывает, насколько это среднее может гулять. по каждой группе, t, dfСтепени свободы: сколько человек измерили в обеих группах вместе, минус два. По нему выбирают строку в таблице. и p. Если группы маленькие, к ним добавляют размер эффекта: он показывает, насколько разница велика.

Что значит «различия достоверны»

Два класса сдавали прыжок в длину с места. В одном среднее 194 см, в другом 200.

Разница есть, но внутри каждого класса результаты гуляют от 185 до 210 см. Если бы вы измерили не этих двенадцать человек, а других двенадцать из тех же классов, средние сдвинулись бы на пару сантиметров сами по себе.

Проверка сводится к одному вопросу: разница между классами заметнее обычного разброса внутри класса или теряется в нем?

Критерий делит разницу средних на разброс внутри групп с поправкой на численность: чем меньше разброс, тем больше получается число и тем меньше шансов, что разница случайна.

Разница тонет в разбросе Разница больше разброса КГ ЭГ не достоверны, p > 0,05 группы накрывают друг друга КГ ЭГ достоверны, p < 0,05 группы почти не пересекаются
Одна и та же разница средних может быть случайной или достоверной: все решает разброс внутри групп

Итог сравнения выражают через p-значение. Представим, что разницы между группами нет вообще: тогда p это шанс все равно случайно получить такую разницу.

Пока p больше 0,05, различия считают недостоверными: риск принять случайность за эффект слишком велик.

Важно

В старых русскоязычных методичках по физкультуре и педагогике тот же порог часто записывают через доверительную вероятность: P ≥ 0,95, или «на 95-процентном уровне достоверности». Это обратная шкала к уровню значимости: записи «p < 0,05» и «P ≥ 0,95» для студенческого вывода означают один и тот же результат. Выбирайте ту запись, которая принята на вашей кафедре.

В дипломе обычно хватает трех уровней. Их записывают так:

Три уровня достоверности в записи через p и P

p P (доверительная вероятность) В таблицах Как читать
p ≤ 0,05 P ≥ 0,95 * различия достоверны, стандарт для дипломов
p ≤ 0,01 P ≥ 0,99 ** различия достоверны на высоком уровне
p ≤ 0,001 P ≥ 0,999 *** различия достоверны на самом строгом уровне
p > 0,05 P < 0,95 без звездочки или «н/д» различия не достоверны

Третий столбец это значки для таблицы в дипломе, «н/д» значит «не достоверно». Порог 0,05 называют уровнем значимостиПорог, ниже которого разницу перестают считать случайной., в методичках то же самое зовут уровнем достоверности; назначают его до расчета и не меняют после того, как увидели p.

«Достоверность различий» и «статистическая значимость» называют одно и то же: первый термин принят в методичках по педагогике, физкультуре и медицине, второй в психологии и международных публикациях; в одной работе лучше держаться одного из них. Расходится другая пара слов: «значимо» не равно «важно». Значение p показывает только, что разницу трудно списать на случайность, но не говорит, большая она или крошечная.

Критерий выбирают по данным

Критерий выбирают по трем признакам: сколько групп, одни и те же это люди или разные, как результаты легли вокруг среднего, кучкой или иначе (это и называют распределением).

Две независимые группы. Это разные люди, никто не попал в обе: ЭГ и КГ, юноши и девушки. Если результаты собраны кучкой вокруг среднего, это нормальное распределениеСредних результатов много, очень больших и очень маленьких мало., и берут t-критерий Стьюдента, иначе U Манна-Уитни.

Замер до и после. Одни и те же люди в двух замерах: парный t-критерий, а на баллах и местах в рейтинге T Вилкоксона.

Больше двух групп. Три группы или три замера подряд: дисперсионный анализДисперсия это мера разброса внутри группы, а дисперсионный анализ сравнивает сразу все группы., при ненормальном распределении H Краскела-Уоллиса.

Доли. Сдал норматив или нет: хи-квадрат Пирсона, а если хотя бы в одной клеткеТаблица «сдал или не сдал» по двум группам дает четыре клетки, в каждой стоит число человек. меньше 5 человек, точный критерий Фишера.

Ниже короткий подбор: ответьте на два вопроса, и он назовет критерий с калькулятором.

Подбор критерия

Как понять, какой критерий нужен

Выберите свою ситуацию. В конце появится метод и ссылка на калькулятор.

Сколько групп или замеров вы сравниваете?

Главная развилка со ссылками на калькуляторы:

Критерии достоверности различий и калькуляторы к ним

Ситуация Основной критерий Замена, если условия не выполнены
Две группы, разные люди: ЭГ и КГ, юноши и девушки t-критерий Стьюдента; при разных дисперсиях критерий Крамера-Уэлча U Манна-Уитни
Одни и те же люди, замер до и после парный t-критерий Стьюдента T Вилкоксона
Три группы и больше дисперсионный анализ, F H Краскела-Уоллиса
Доли: сдал или нет, есть признак или нет хи-квадрат Пирсона точный критерий Фишера при частотах меньше 5

Перед параметрическим критерием данные прогоняют через проверку нормальности по Шапиро-УилкуПроверка, похожи ли результаты на холм вокруг среднего.: она отвечает, можно ли считать распределение нормальным. Что выбрать в спорном случае, показывает сравнение Стьюдента и Манна-Уитни.

Осторожно

Критерий Стьюдента считают на измерениях: секундах, сантиметрах, баллах прямо из бланка методики, если они собраны вокруг среднего. На уровнях «низкий, средний, высокий» и на местах в рейтинге он не работает, там нужны ранговые критерии. Не годится он и там, где почти все набрали максимум: такое среднее уже ничего не показывает.

Условия t-критерия проверяют до расчета

На нормально распределенных данных t-критерий находит различия при меньшем числе людей, чем U Манна-Уитни. Методички по спортивной метрологии приводят именно его.

Но условий у него четыре, и к ним добавляется требование к числу людей в группе. Каждое условие проверяют расчетом: Шапиро-Уилк на форму распределения, тест ЛевенаПроверка, одинаково ли расходятся результаты в двух группах. на разброс в группах, численность групп.

  • Группы независимы: в каждой свои люди, никто не попал в обе. Чем связанные выборки отличаются от независимых, разобрано отдельно.
  • Шкала количественная: результат измерен в единицах и видно, на сколько люди отличаются: сантиметры, секунды, килограммы, баллы из бланка методики.
  • Распределение близко к нормальному: критерий Шапиро-Уилка дает p > 0,05 в каждой группе, то есть нет оснований считать распределение ненормальным.
  • Дисперсии однородны: в одной группе люди расходятся так же, как в другой, и тест Левена дает p > 0,05. Если нет, тот же t считают иначе: берут поправку УэлчаТот же t, пересчитанный с учетом разного разброса в группах; в российских методичках его аналог это критерий Крамера-Уэлча. или критерий Крамера-Уэлча, который часто требуют педагогические методички.
  • В группе не меньше 6 человек, а лучше от 10: на маленьких группах критерий часто не замечает реальную разницу, это и называют низкой чувствительностью.

До эксперимента тот же критерий решает обратную задачу: там доказывают однородность групп до эксперимента, и нужен p больше 0,05.

Условия выполнены. Дальше два пути: посчитать самому или отдать данные специалисту.

Пример расчета от таблицы до вывода

Кейс из диплома по физической культуре

Экспериментальная группа четыре месяца занималась по авторскому комплексу прыжковых упражнений, контрольная по обычной программе. В каждой группе по 12 мальчиков 14-15 лет. В конце всех измерили один раз: прыжок в длину с места.

Цифры вымышленные, взяты для примера, зато путь от таблицы с результатами до фразы в дипломе пройден целиком. Так устроен педагогический эксперимент с КГ и ЭГ, в котором достоверность различий проверяют чаще всего.

Результаты итогового среза, см

Группа Результаты 12 человек M ± m
КГ 192, 198, 185, 201, 195, 188, 203, 190, 197, 186, 194, 199 194,00 ± 1,70
ЭГ 201, 196, 208, 193, 204, 199, 210, 195, 191, 206, 202, 198 200,25 ± 1,73
Прыжок в длину с места, M ± m, см p < 0,05 185190195200205 194,0 ± 1,7 200,3 ± 1,7 КГ, n = 12 ЭГ, n = 12 ось начинается со 185 см, чтобы был виден разброс
Те же числа на рисунке для третьей главы

Слева результаты каждого участника и средние по группам, справа тот же итог рисунком. Разница средних 6,25 см видна на глаз, но одно это ничего не доказывает: дальше пять шагов, которые превращают ее в достоверный результат

Здесь M это среднее по группе, а m ошибка среднегоНасколько сдвинулось бы среднее, если набрать другую такую же группу.: стандартное отклонениеНасколько в среднем результаты отходят от среднего по группе. SD, деленное на корень из числа участников. SD в группах почти одинаковое, 5,89 и 6,00 см. Черточки на столбиках рисунка, усы, показывают ту же m. Ось там начата не с нуля, чтобы разница была видна: так можно, когда это оговорено на рисунке.

Разница средних 6,25 см в пользу ЭГ. Осталось доказать, что она не случайна.

Записать гипотезы

Записывают два предположения. Нулевая, H₀Предположение, что разницы нет: именно его и пытаются опровергнуть.: средние результаты ЭГ и КГ не различаются, разница в 6,25 см случайна. Альтернативная, H₁Предположение, что разница есть.: средние различаются.

Направление различий читают по средним, но только после того, как критерий дал p меньше 0,05.

Формулировки для разных схем сравнения и случай одностороннейКогда заранее уверены, в какую сторону будет разница. гипотезы собраны в разборе гипотез исследования H₀ и H₁.

Проверить условия

Шапиро-Уилк дал в КГ W = 0,964 и p = 0,834, в ЭГ W = 0,977 и p = 0,966. Правило здесь перевернутое: p больше 0,05 значит, что нет оснований считать распределение ненормальным, поэтому обе группы подходят для t-критерия. Само W просто идет в отчете.

Тест Левена: p = 0,948, разброс в группах одинаковый. Значит, подходит классический t-критерий.

Посчитать t

Формула из методичек по спортивной метрологии: разницу средних делят на ошибки средних обеих групп, сведенные в одно число. Как это считают, видно ниже.

t = (M₁ − M₂) / √(m₁² + m₂²)

M₁ − M₂ = 200,25 − 194,00 = 6,25
√(1,73² + 1,70²) = √5,88 = 2,43
t = 6,25 / 2,43 ≈ 2,57

df = n₁ + n₂ − 2
df = 12 + 12 − 2 = 22
Из чего складывается t M₁ − M₂ √(m₁² + m₂²) = 2,57 разница средних: 6,25 см ошибки средних: 1,73 и 1,70 Числитель растет: t растет. Знаменатель растет: t падает. Большая разница при малом разбросе дает большое t и маленькое p
Формула t наглядно: расстояние между средними делится на разброс внутри групп

Калькулятор критерия Стьюдента считает общую версию формулы, где разброс двух групп сводят в одно число: при равных по численности группах результат тот же, t = 2,574. Варианты для равных и разных дисперсий разложены в полном руководстве по критерию Стьюдента.

Как прочитать полученное t

Посчитанное t само по себе еще ничего не значит: его сравнивают с табличным и дополняют размером эффекта.

Сравнить с критическим значением

При df = 22 критические значения t равны 2,07 для p = 0,05, 2,82 для p = 0,01 и 3,79 для p = 0,001. Наше t = 2,57 больше 2,07, но меньше 2,82: различия достоверны при p < 0,05, а точное p равно 0,017.

Где оказалось наше t при df = 22 не достоверны p < 0,05 p < 0,01 p < 0,001 02,072,823,79 t крит 0,05t крит 0,01t крит 0,001 t эмп = 2,57 t больше 2,07 и меньше 2,82: различия достоверны при p < 0,05, но не при p < 0,01
Правило для t-критерия: эмпирическое значение должно быть больше критического. Чем дальше вправо, тем строже уровень
  • Фиолетовая метка: наше t = 2,57, правее 2,07 и левее 2,82: различия достоверны, но уровень p < 0,01 заявить нельзя.
  • Красная зона: сюда попадает t, когда разница средних не больше случайного разброса, и результат честно записывают как «не достоверны».

Для t, F и хи-квадрат различия достоверны, когда посчитанное число больше табличного порога. У U Манна-Уитни и T Вилкоксона наоборот: когда эмпирическое значение меньше или равно критическому.

Добавить размер эффекта и доверительный интервал

Значение p молчит о том, велика ли разница, поэтому рядом считают размер эффекта: d Коэна = 6,25 / 5,95 = 1,05, где 5,95 это объединенное стандартное отклонение, то есть средний разброс внутри двух групп, между 5,89 и 6,00. Приняты такие границы: 0,5 это средний эффект, 0,8 и выше большой. Значит, наш эффект большой.

Полезно привести и 95-процентный доверительный интервал разницы средних, промежуток, в котором лежит настоящая разница: от 1,2 до 11,3 см. Ноль в него не попадает, и это еще раз подтверждает достоверность. Но интервал честно показывает и другое: настоящая разница может оказаться не 6,25 см, а всего 1,2 см.

Итог примера
Различия достоверны: t = 2,57 больше критического 2,07, p = 0,017

Фраза для диплома: «Результат прыжка в длину с места в ЭГ достоверно выше, чем в КГ (t = 2,57; df = 22; p < 0,05), размер эффекта большой (d = 1,05)».

Если бы нормальность не подтвердилась, тот же вопрос решил бы U Манна-Уитни: U эмп = 34 при критическом 37 для групп по 12 человек, p = 0,028. У U правило обратное: достоверно, когда посчитанное число меньше табличного. Вывод не изменился, на нормальных данных ранговый критерий обычно дает то же решение, а расчет по шагам лежит в полном руководстве по критерию Манна-Уитни.

Чего расчет не показывает. Критерий не доказывает, что прибавку дала именно методика: он сравнивает два ряда чисел и о причинах не знает. Значение p молчит и о практической пользе 6,25 см для школьника.

При 12 участниках в группе результат неустойчив: мощностьШанс заметить разницу, если она есть: та же чувствительность, только выраженная числом. такого сравнения равна 0,69.

Критические значения t для двух групп

Таблица нужна при ручном счете и там, где по требованиям кафедры t крит стоит рядом с t эмп.

Нужное число стоит на пересечении: строку выбирают по df, столбец по уровню значимости. Для двух независимых групп df = n₁ + n₂ − 2, где n это число человек в группе, а два вычитают потому, что в расчете уже использованы два средних. При группах по 12 человек берут строку 22, а в ней 2,074 для p = 0,05.

Критерий двусторонний: это значит, что мы заранее не загадывали, чья группа окажется сильнее, и засчитывается перевес в любую сторону. Какая группа сильнее, видно потом по средним.

Наше t = 2,57 больше 2,074, но меньше 2,819, поэтому в работе пишут p < 0,05, а не p < 0,01.

Критические значения t-критерия Стьюдента, двусторонний

df p = 0,05 p = 0,01 p = 0,001
10 2,228 3,169 4,587
12 2,179 3,055 4,318
14 2,145 2,977 4,140
16 2,120 2,921 4,015
18 2,101 2,878 3,922
20 2,086 2,845 3,850
22 2,074 2,819 3,792
24 2,064 2,797 3,745
26 2,056 2,779 3,707
28 2,048 2,763 3,674
30 2,042 2,750 3,646
40 2,021 2,704 3,551
60 2,000 2,660 3,460
120 1,980 2,617 3,373
Совет

Нужного df в таблице может не оказаться: берите строку с ближайшим меньшим df, в таблице она расположена выше. Критическое значение получится чуть строже, а вывод от этого только надежнее. Как устроены такие таблицы и где взять их для других критериев, показывает разбор того, как читать таблицу критических значений.

Как записать результат в дипломе

В третьей главе результат стоит в двух местах: в таблице с показателем, M ± m по каждой группе, t, df и p, и в одной фразе под ней, где называют направление различий и уровень значимости.

Как это выглядит в тексте диплома: подпись к таблице до таблицы, подпись к рисунку после рисунка, затем фраза-вывод

Из чего состоит сама запись результата:

ЭГ 200,3 ± 1,7 КГ 194,0 ± 1,7 t = 2,57 df = 22 p = 0,017 среднее и ошибка среднего: m = SD / √n степени свободы: 12 + 12 − 2 значение критерия, t эмп точное p или запись p < 0,05
Из чего состоит запись результата: рецензент проверяет каждый из этих элементов

Готовые формулировки для текста:

  1. «После эксперимента результат прыжка в длину с места в ЭГ достоверно выше, чем в КГ: 200,3 ± 1,7 см против 194,0 ± 1,7 см (t = 2,57; p < 0,05)».
  2. «По бегу на 30 м различия между группами не достигли уровня достоверности (t = 1,33; p > 0,05), хотя средний результат ЭГ лучше на 0,08 с».
  3. Для кафедр со старой записью: «различия достоверны при P ≥ 0,95».

Недостоверный результат описывают так же спокойно, как достоверный: «не доказано» это не «не существует». Что делать дальше, показывает разбор случая, когда различия не значимы.

Звездочки и саму запись p оформляют по правилам из материала о том, как записывать p-значение, а формулировки для всей третьей главы собраны в разборе того, как описать результаты статистики.

Для планирования: сколько человек нужно, чтобы доказать различия

Этот раздел нужен, если вы еще только планируете исследование. Для оформления уже собранных данных обычно достаточно выбрать критерий, посчитать p и записать результат.

Критерий может не заметить реальную разницу, если людей мало: такой пропуск называют ошибкой второго рода. Нормой мощности для исследований считают 0,8, а растет она вместе с размером эффекта и числом людей в группах.

Шанс доказать реальную разницу (мощность) норма 0,8 00,20,40,60,81,0 102030405060 человек в каждой группе d = 0,8: большой эффект d = 0,5: средний эффект 26 чел. 64 чел.
Сколько человек в группе дает мощность 0,8 при большом и среднем эффекте, t-критерий для двух независимых групп
  • Большой эффект (d = 0,8) доказывается уже при 26 человеках в группе.
  • Средний эффект (d = 0,5) требует около 64 человек в каждой группе: типичным для диплома группам по 12-15 человек такой эффект чаще всего не по силам.

В нашем примере мощность 0,69: даже при большом эффекте каждое третье такое исследование различий не показало бы.

Поэтому число участников прикидывают заранее: калькулятор объема выборки назовет, сколько человек нужно под ожидаемый эффект.

Частые ошибки

Сравнили средние на глаз.

«В ЭГ результат выше на 6 см, значит методика работает»: без критерия это наблюдение, а не доказательство. Посчитайте критерий и приведите t, df и p рядом со средними.

Взяли Стьюдента для уровней и мест.

Уровни «низкий, средний, высокий» и места задают только порядок: расстояние между «низким» и «средним» не такое же, как между «средним» и «высоким», поэтому среднее по ним ничего не значит. Для порядковых данных берите U Манна-Уитни или T Вилкоксона.

Не проверили условия.

Ненормальное распределение или разный разброс в группах дают неверное p, и вывод может оказаться ложным в любую сторону. Перед t-критерием приведите результат Шапиро-Уилка и теста Левена.

Перепутали правило сравнения.

Для U и T достоверность наступает, когда посчитанное значение меньше табличного, а не больше. Сверяйтесь с правилом конкретного критерия или смотрите на p: оно читается одинаково везде.

Подогнали порог под результат.

Получили p = 0,08 и написали «различия достоверны при p < 0,1». Порог 0,05 назначен до расчета. Пишите «не достоверны» и приводите размер эффекта.

Считали «до и после» как две разные группы.

Одни и те же люди в двух замерах связаны, критерий для независимых групп здесь не подходит. Берите парный t-критерий или T Вилкоксона.

Написали «достоверность 95 %» без чисел.

Фраза без t и p ничего не доказывает. В таблице всегда стоят M ± m, t (или U), df и p.

Что делать, если условия не выполнены

Если условие не выполнено, это не тупик: замена для каждого случая стоит в таблице критериев выше, а рядом с выводом приводят размер эффекта и доверительный интервал.

В третьей главе называют и проверку, которая не прошла, и критерий, которым ее заменили: замена без объяснения выглядит как подгонка.

Частые вопросы

Что значит «различия достоверны при p < 0,05»?

Вероятность получить такую или большую разницу между группами случайно, когда различий нет, меньше 5 %. Этот риск считают приемлемым, поэтому различия признают реальными. Про сам показатель p подробнее в статье «Что такое p-значение».

Чем достоверность различий отличается от размера эффекта?

Достоверность отвечает, можно ли списать разницу на случайность, а размер эффекта на то, насколько она велика. Значение p не говорит о практической пользе прибавки, поэтому d Коэна ставят рядом с ним: в нашем примере 1,05 при пороге «большого» 0,8.

Можно ли доказать достоверность различий в Excel?

Функция ТТЕСТ возвращает p для двух нормальных групп, а t и df считают по формулам: разбор есть в статье про t-критерий Стьюдента в Excel. Для рангового критерия готовой функции в Excel нет, поэтому U Манна-Уитни проще посчитать в калькуляторе: он сразу выдаст U, p и вывод словами.

Сколько человек нужно в группах, чтобы различия стали достоверными?

Зависит от размера эффекта. При большом эффекте (d около 0,8) хватает 26 человек в группе, при среднем (d = 0,5) нужно около 64 в каждой, подробнее в разделе про мощность выше. Прикинуть объем заранее помогает калькулятор объема выборки.

Что делать, если p = 0,06?

Писать честно: различия не достигли уровня достоверности (p = 0,06). Дальше приводят размер эффекта и доверительный интервал: они покажут, что разница есть, но выборки не хватило, чтобы ее доказать. Округлять p до 0,05 или менять порог после расчета нельзя.

Короткий алгоритм

  1. Определите схему сравнения: две группы разных людей, одни и те же до и после, три и больше групп или доли «да и нет».
  2. Проверьте условия: Шапиро-Уилк на форму распределения и тест Левена на одинаковый разброс в группах, если берете параметрический критерий.
  3. Посчитайте критерий в калькуляторе и выпишите t, df и p (для рангового критерия U или T и p).
  4. Примените правило: t эмп больше t крит или p меньше 0,05, значит различия достоверны.
  5. Добавьте размер эффекта и доверительный интервал разницы, если группы меньше 20 человек.
  6. Запишите таблицу с M ± m, t, df и p и одну фразу с выводом. Недостоверный результат описывайте так же.

Если данные уже собраны, а критерий все еще под вопросом, загляните в базу методов или закажите консультацию: подберем критерий, посчитаем и оформим таблицу под требования вашей кафедры.

Помогу с расчетами лично

Я Андрей Лазарев, автор StatBlank. Подберу критерий под ваши данные, посчитаю статистику и оформлю таблицы с выводами для диплома. За качество расчета отвечаю лично.

Заказать консультацию