Разницу средних доказывает критерий, а не сами числа. Порог в дипломах p < 0,05. На ранговых шкалах Стьюдент не работает, на маленьких группах теряет чувствительность. Запись результата разобрана на примере.
Разница в шесть сантиметров между классами может оказаться случайной.
Расчет ниже верен для двух групп разных людей. Если вы измеряли одних и тех же до и после, нужен парный критерий?Статистический тест: расчет, который проверяет, случайна разница или нет. Парный считают для одних и тех же людей, измеренных дважды., а достоверность сдвига «до и после» доказывают иначе.
Итоговый выбор критерия и формулировку вывода согласуйте с научным руководителем: требования кафедр различаются.
В двух словах
Коротко для тех, кто уже собрал результаты и завтра сдает третью главу: чем достоверная разница отличается от случайной и какие числа должны стоять рядом с выводом.
Достоверность различий означает, что разница между группами больше, чем можно списать на случайный разброс?Насколько сильно результаты людей внутри одной группы отличаются друг от друга.. Порог в дипломах: p < 0,05, в старой записи P?Доверительная вероятность: тот же порог, записанный с другого конца шкалы. ≥ 0,95.
Выбор критерия по схеме сравнения. В методичках ее называют дизайном?Кого с кем сравнивают и сколько раз измеряли. исследования. Для двух групп разных людей берут t-критерий Стьюдента или U Манна-Уитни, для замеров «до и после» парный Стьюдент или T Вилкоксона.
Решение принимают по правилу: t эмп (число, которое выдал калькулятор) больше t крит (число из готовой таблицы в конце статьи), или p меньше 0,05, значит различия достоверны.
Пять чисел. В работу идут M ± m?M это среднее по группе, m показывает, насколько это среднее может гулять. по каждой группе, t, df?Степени свободы: сколько человек измерили в обеих группах вместе, минус два. По нему выбирают строку в таблице. и p. Если группы маленькие, к ним добавляют размер эффекта: он показывает, насколько разница велика.
Что значит «различия достоверны»
Два класса сдавали прыжок в длину с места. В одном среднее 194 см, в другом 200.
Разница есть, но внутри каждого класса результаты гуляют от 185 до 210 см. Если бы вы измерили не этих двенадцать человек, а других двенадцать из тех же классов, средние сдвинулись бы на пару сантиметров сами по себе.
Проверка сводится к одному вопросу: разница между классами заметнее обычного разброса внутри класса или теряется в нем?
Критерий делит разницу средних на разброс внутри групп с поправкой на численность: чем меньше разброс, тем больше получается число и тем меньше шансов, что разница случайна.
Одна и та же разница средних может быть случайной или достоверной: все решает разброс внутри групп
Итог сравнения выражают через p-значение. Представим, что разницы между группами нет вообще: тогда p это шанс все равно случайно получить такую разницу.
Пока p больше 0,05, различия считают недостоверными: риск принять случайность за эффект слишком велик.
Важно
В старых русскоязычных методичках по физкультуре и педагогике тот же порог часто записывают через доверительную вероятность: P ≥ 0,95, или «на 95-процентном уровне достоверности». Это обратная шкала к уровню значимости: записи «p < 0,05» и «P ≥ 0,95» для студенческого вывода означают один и тот же результат. Выбирайте ту запись, которая принята на вашей кафедре.
В дипломе обычно хватает трех уровней. Их записывают так:
Три уровня достоверности в записи через p и P
p
P (доверительная вероятность)
В таблицах
Как читать
p ≤ 0,05
P ≥ 0,95
*
различия достоверны, стандарт для дипломов
p ≤ 0,01
P ≥ 0,99
**
различия достоверны на высоком уровне
p ≤ 0,001
P ≥ 0,999
***
различия достоверны на самом строгом уровне
p > 0,05
P < 0,95
без звездочки или «н/д»
различия не достоверны
Третий столбец это значки для таблицы в дипломе, «н/д» значит «не достоверно». Порог 0,05 называют уровнем значимости?Порог, ниже которого разницу перестают считать случайной., в методичках то же самое зовут уровнем достоверности; назначают его до расчета и не меняют после того, как увидели p.
«Достоверность различий» и «статистическая значимость» называют одно и то же: первый термин принят в методичках по педагогике, физкультуре и медицине, второй в психологии и международных публикациях; в одной работе лучше держаться одного из них. Расходится другая пара слов: «значимо» не равно «важно». Значение p показывает только, что разницу трудно списать на случайность, но не говорит, большая она или крошечная.
Критерий выбирают по данным
Критерий выбирают по трем признакам: сколько групп, одни и те же это люди или разные, как результаты легли вокруг среднего, кучкой или иначе (это и называют распределением).
Две независимые группы. Это разные люди, никто не попал в обе: ЭГ и КГ, юноши и девушки. Если результаты собраны кучкой вокруг среднего, это нормальное распределение?Средних результатов много, очень больших и очень маленьких мало., и берут t-критерий Стьюдента, иначе U Манна-Уитни.
Замер до и после. Одни и те же люди в двух замерах: парный t-критерий, а на баллах и местах в рейтинге T Вилкоксона.
Больше двух групп. Три группы или три замера подряд: дисперсионный анализ?Дисперсия это мера разброса внутри группы, а дисперсионный анализ сравнивает сразу все группы., при ненормальном распределении H Краскела-Уоллиса.
Доли. Сдал норматив или нет: хи-квадрат Пирсона, а если хотя бы в одной клетке?Таблица «сдал или не сдал» по двум группам дает четыре клетки, в каждой стоит число человек. меньше 5 человек, точный критерий Фишера.
Ниже короткий подбор: ответьте на два вопроса, и он назовет критерий с калькулятором.
Подбор критерия
Как понять, какой критерий нужен
Выберите свою ситуацию. В конце появится метод и ссылка на калькулятор.
Сколько групп или замеров вы сравниваете?
Главная развилка со ссылками на калькуляторы:
Критерии достоверности различий и калькуляторы к ним
Перед параметрическим критерием данные прогоняют через проверку нормальности по Шапиро-Уилку?Проверка, похожи ли результаты на холм вокруг среднего.: она отвечает, можно ли считать распределение нормальным. Что выбрать в спорном случае, показывает сравнение Стьюдента и Манна-Уитни.
Осторожно
Критерий Стьюдента считают на измерениях: секундах, сантиметрах, баллах прямо из бланка методики, если они собраны вокруг среднего. На уровнях «низкий, средний, высокий» и на местах в рейтинге он не работает, там нужны ранговые критерии. Не годится он и там, где почти все набрали максимум: такое среднее уже ничего не показывает.
Условия t-критерия проверяют до расчета
На нормально распределенных данных t-критерий находит различия при меньшем числе людей, чем U Манна-Уитни. Методички по спортивной метрологии приводят именно его.
Но условий у него четыре, и к ним добавляется требование к числу людей в группе. Каждое условие проверяют расчетом: Шапиро-Уилк на форму распределения, тест Левена?Проверка, одинаково ли расходятся результаты в двух группах. на разброс в группах, численность групп.
Шкала количественная: результат измерен в единицах и видно, на сколько люди отличаются: сантиметры, секунды, килограммы, баллы из бланка методики.
Распределение близко к нормальному: критерий Шапиро-Уилка дает p > 0,05 в каждой группе, то есть нет оснований считать распределение ненормальным.
Дисперсии однородны: в одной группе люди расходятся так же, как в другой, и тест Левена дает p > 0,05. Если нет, тот же t считают иначе: берут поправку Уэлча?Тот же t, пересчитанный с учетом разного разброса в группах; в российских методичках его аналог это критерий Крамера-Уэлча. или критерий Крамера-Уэлча, который часто требуют педагогические методички.
В группе не меньше 6 человек, а лучше от 10: на маленьких группах критерий часто не замечает реальную разницу, это и называют низкой чувствительностью.
Экспериментальная группа четыре месяца занималась по авторскому комплексу прыжковых упражнений, контрольная по обычной программе. В каждой группе по 12 мальчиков 14-15 лет. В конце всех измерили один раз: прыжок в длину с места.
Цифры вымышленные, взяты для примера, зато путь от таблицы с результатами до фразы в дипломе пройден целиком. Так устроен педагогический эксперимент с КГ и ЭГ, в котором достоверность различий проверяют чаще всего.
Слева результаты каждого участника и средние по группам, справа тот же итог рисунком. Разница средних 6,25 см видна на глаз, но одно это ничего не доказывает: дальше пять шагов, которые превращают ее в достоверный результат
Здесь M это среднее по группе, а m ошибка среднего?Насколько сдвинулось бы среднее, если набрать другую такую же группу.: стандартное отклонение?Насколько в среднем результаты отходят от среднего по группе. SD, деленное на корень из числа участников. SD в группах почти одинаковое, 5,89 и 6,00 см. Черточки на столбиках рисунка, усы, показывают ту же m. Ось там начата не с нуля, чтобы разница была видна: так можно, когда это оговорено на рисунке.
Разница средних 6,25 см в пользу ЭГ. Осталось доказать, что она не случайна.
1Записать гипотезы
Записывают два предположения. Нулевая, H₀?Предположение, что разницы нет: именно его и пытаются опровергнуть.: средние результаты ЭГ и КГ не различаются, разница в 6,25 см случайна. Альтернативная, H₁?Предположение, что разница есть.: средние различаются.
Направление различий читают по средним, но только после того, как критерий дал p меньше 0,05.
Формулировки для разных схем сравнения и случай односторонней?Когда заранее уверены, в какую сторону будет разница. гипотезы собраны в разборе гипотез исследования H₀ и H₁.
2Проверить условия
Шапиро-Уилк дал в КГ W = 0,964 и p = 0,834, в ЭГ W = 0,977 и p = 0,966. Правило здесь перевернутое: p больше 0,05 значит, что нет оснований считать распределение ненормальным, поэтому обе группы подходят для t-критерия. Само W просто идет в отчете.
Тест Левена: p = 0,948, разброс в группах одинаковый. Значит, подходит классический t-критерий.
3Посчитать t
Формула из методичек по спортивной метрологии: разницу средних делят на ошибки средних обеих групп, сведенные в одно число. Как это считают, видно ниже.
Посчитанное t само по себе еще ничего не значит: его сравнивают с табличным и дополняют размером эффекта.
4Сравнить с критическим значением
При df = 22 критические значения t равны 2,07 для p = 0,05, 2,82 для p = 0,01 и 3,79 для p = 0,001. Наше t = 2,57 больше 2,07, но меньше 2,82: различия достоверны при p < 0,05, а точное p равно 0,017.
Правило для t-критерия: эмпирическое значение должно быть больше критического. Чем дальше вправо, тем строже уровень
Фиолетовая метка: наше t = 2,57, правее 2,07 и левее 2,82: различия достоверны, но уровень p < 0,01 заявить нельзя.
Красная зона: сюда попадает t, когда разница средних не больше случайного разброса, и результат честно записывают как «не достоверны».
Для t, F и хи-квадрат различия достоверны, когда посчитанное число больше табличного порога. У U Манна-Уитни и T Вилкоксона наоборот: когда эмпирическое значение меньше или равно критическому.
5Добавить размер эффекта и доверительный интервал
Значение p молчит о том, велика ли разница, поэтому рядом считают размер эффекта: d Коэна = 6,25 / 5,95 = 1,05, где 5,95 это объединенное стандартное отклонение, то есть средний разброс внутри двух групп, между 5,89 и 6,00. Приняты такие границы: 0,5 это средний эффект, 0,8 и выше большой. Значит, наш эффект большой.
Полезно привести и 95-процентный доверительный интервал разницы средних, промежуток, в котором лежит настоящая разница: от 1,2 до 11,3 см. Ноль в него не попадает, и это еще раз подтверждает достоверность. Но интервал честно показывает и другое: настоящая разница может оказаться не 6,25 см, а всего 1,2 см.
Итог примера
Различия достоверны: t = 2,57 больше критического 2,07, p = 0,017
Фраза для диплома: «Результат прыжка в длину с места в ЭГ достоверно выше, чем в КГ (t = 2,57; df = 22; p < 0,05), размер эффекта большой (d = 1,05)».
Если бы нормальность не подтвердилась, тот же вопрос решил бы U Манна-Уитни: U эмп = 34 при критическом 37 для групп по 12 человек, p = 0,028. У U правило обратное: достоверно, когда посчитанное число меньше табличного. Вывод не изменился, на нормальных данных ранговый критерий обычно дает то же решение, а расчет по шагам лежит в полном руководстве по критерию Манна-Уитни.
Чего расчет не показывает. Критерий не доказывает, что прибавку дала именно методика: он сравнивает два ряда чисел и о причинах не знает. Значение p молчит и о практической пользе 6,25 см для школьника.
При 12 участниках в группе результат неустойчив: мощность?Шанс заметить разницу, если она есть: та же чувствительность, только выраженная числом. такого сравнения равна 0,69.
Критические значения t для двух групп
Таблица нужна при ручном счете и там, где по требованиям кафедры t крит стоит рядом с t эмп.
Нужное число стоит на пересечении: строку выбирают по df, столбец по уровню значимости. Для двух независимых групп df = n₁ + n₂ − 2, где n это число человек в группе, а два вычитают потому, что в расчете уже использованы два средних. При группах по 12 человек берут строку 22, а в ней 2,074 для p = 0,05.
Критерий двусторонний: это значит, что мы заранее не загадывали, чья группа окажется сильнее, и засчитывается перевес в любую сторону. Какая группа сильнее, видно потом по средним.
Наше t = 2,57 больше 2,074, но меньше 2,819, поэтому в работе пишут p < 0,05, а не p < 0,01.
Критические значения t-критерия Стьюдента, двусторонний
df
p = 0,05
p = 0,01
p = 0,001
10
2,228
3,169
4,587
12
2,179
3,055
4,318
14
2,145
2,977
4,140
16
2,120
2,921
4,015
18
2,101
2,878
3,922
20
2,086
2,845
3,850
22
2,074
2,819
3,792
24
2,064
2,797
3,745
26
2,056
2,779
3,707
28
2,048
2,763
3,674
30
2,042
2,750
3,646
40
2,021
2,704
3,551
60
2,000
2,660
3,460
120
1,980
2,617
3,373
Совет
Нужного df в таблице может не оказаться: берите строку с ближайшим меньшим df, в таблице она расположена выше. Критическое значение получится чуть строже, а вывод от этого только надежнее. Как устроены такие таблицы и где взять их для других критериев, показывает разбор того, как читать таблицу критических значений.
Как записать результат в дипломе
В третьей главе результат стоит в двух местах: в таблице с показателем, M ± m по каждой группе, t, df и p, и в одной фразе под ней, где называют направление различий и уровень значимости.
Дипломная работа.docx
3.2. Сравнение групп после эксперимента
После итогового тестирования результаты контрольной и экспериментальной групп заносят в таблицу и обязательно дают ссылку в тексте: результаты представлены в таблице 7.
Таблица 7 — Сравнение групп после эксперимента, M ± m
Показатель
КГ (n = 12)
ЭГ (n = 12)
t
p
Прыжок в длину с места, см
194,0 ± 1,7
200,3 ± 1,7
2,57
0,017*
Бег 30 м, с
5,23 ± 0,05
5,15 ± 0,04
1,33
0,196
Примечание. * различия достоверны при p < 0,05.
Из таблицы видно, что по прыжку в длину с места среднее значение в ЭГ выше, чем в КГ; по бегу на 30 м различия уровня достоверности не достигли.
Результат, см
Группа
КГ
ЭГ
Рисунок 4 — Средние результаты прыжка в длину с места в КГ и ЭГ
На рисунке показано, что средний результат ЭГ выше результата КГ. Усы отражают ошибку среднего.
После эксперимента результат прыжка в длину с места в ЭГ достоверно выше, чем в КГ: 200,3 ± 1,7 см против 194,0 ± 1,7 см (t = 2,57; p < 0,05).
Как это выглядит в тексте диплома: подпись к таблице до таблицы, подпись к рисунку после рисунка, затем фраза-вывод
Из чего состоит сама запись результата:
Из чего состоит запись результата: рецензент проверяет каждый из этих элементов
Готовые формулировки для текста:
«После эксперимента результат прыжка в длину с места в ЭГ достоверно выше, чем в КГ: 200,3 ± 1,7 см против 194,0 ± 1,7 см (t = 2,57; p < 0,05)».
«По бегу на 30 м различия между группами не достигли уровня достоверности (t = 1,33; p > 0,05), хотя средний результат ЭГ лучше на 0,08 с».
Для кафедр со старой записью: «различия достоверны при P ≥ 0,95».
Недостоверный результат описывают так же спокойно, как достоверный: «не доказано» это не «не существует». Что делать дальше, показывает разбор случая, когда различия не значимы.
Для планирования: сколько человек нужно, чтобы доказать различия
Этот раздел нужен, если вы еще только планируете исследование. Для оформления уже собранных данных обычно достаточно выбрать критерий, посчитать p и записать результат.
Критерий может не заметить реальную разницу, если людей мало: такой пропуск называют ошибкой второго рода. Нормой мощности для исследований считают 0,8, а растет она вместе с размером эффекта и числом людей в группах.
Сколько человек в группе дает мощность 0,8 при большом и среднем эффекте, t-критерий для двух независимых групп
Большой эффект (d = 0,8) доказывается уже при 26 человеках в группе.
Средний эффект (d = 0,5) требует около 64 человек в каждой группе: типичным для диплома группам по 12-15 человек такой эффект чаще всего не по силам.
В нашем примере мощность 0,69: даже при большом эффекте каждое третье такое исследование различий не показало бы.
Поэтому число участников прикидывают заранее: калькулятор объема выборки назовет, сколько человек нужно под ожидаемый эффект.
Частые ошибки
Сравнили средние на глаз.
«В ЭГ результат выше на 6 см, значит методика работает»: без критерия это наблюдение, а не доказательство. Посчитайте критерий и приведите t, df и p рядом со средними.
Взяли Стьюдента для уровней и мест.
Уровни «низкий, средний, высокий» и места задают только порядок: расстояние между «низким» и «средним» не такое же, как между «средним» и «высоким», поэтому среднее по ним ничего не значит. Для порядковых данных берите U Манна-Уитни или T Вилкоксона.
Не проверили условия.
Ненормальное распределение или разный разброс в группах дают неверное p, и вывод может оказаться ложным в любую сторону. Перед t-критерием приведите результат Шапиро-Уилка и теста Левена.
Перепутали правило сравнения.
Для U и T достоверность наступает, когда посчитанное значение меньше табличного, а не больше. Сверяйтесь с правилом конкретного критерия или смотрите на p: оно читается одинаково везде.
Подогнали порог под результат.
Получили p = 0,08 и написали «различия достоверны при p < 0,1». Порог 0,05 назначен до расчета. Пишите «не достоверны» и приводите размер эффекта.
Считали «до и после» как две разные группы.
Одни и те же люди в двух замерах связаны, критерий для независимых групп здесь не подходит. Берите парный t-критерий или T Вилкоксона.
Написали «достоверность 95 %» без чисел.
Фраза без t и p ничего не доказывает. В таблице всегда стоят M ± m, t (или U), df и p.
Что делать, если условия не выполнены
Если условие не выполнено, это не тупик: замена для каждого случая стоит в таблице критериев выше, а рядом с выводом приводят размер эффекта и доверительный интервал.
В третьей главе называют и проверку, которая не прошла, и критерий, которым ее заменили: замена без объяснения выглядит как подгонка.
Частые вопросы
Что значит «различия достоверны при p < 0,05»?
Вероятность получить такую или большую разницу между группами случайно, когда различий нет, меньше 5 %. Этот риск считают приемлемым, поэтому различия признают реальными. Про сам показатель p подробнее в статье «Что такое p-значение».
Чем достоверность различий отличается от размера эффекта?
Достоверность отвечает, можно ли списать разницу на случайность, а размер эффекта на то, насколько она велика. Значение p не говорит о практической пользе прибавки, поэтому d Коэна ставят рядом с ним: в нашем примере 1,05 при пороге «большого» 0,8.
Можно ли доказать достоверность различий в Excel?
Функция ТТЕСТ возвращает p для двух нормальных групп, а t и df считают по формулам: разбор есть в статье про t-критерий Стьюдента в Excel. Для рангового критерия готовой функции в Excel нет, поэтому U Манна-Уитни проще посчитать в калькуляторе: он сразу выдаст U, p и вывод словами.
Сколько человек нужно в группах, чтобы различия стали достоверными?
Зависит от размера эффекта. При большом эффекте (d около 0,8) хватает 26 человек в группе, при среднем (d = 0,5) нужно около 64 в каждой, подробнее в разделе про мощность выше. Прикинуть объем заранее помогает калькулятор объема выборки.
Что делать, если p = 0,06?
Писать честно: различия не достигли уровня достоверности (p = 0,06). Дальше приводят размер эффекта и доверительный интервал: они покажут, что разница есть, но выборки не хватило, чтобы ее доказать. Округлять p до 0,05 или менять порог после расчета нельзя.
Короткий алгоритм
Определите схему сравнения: две группы разных людей, одни и те же до и после, три и больше групп или доли «да и нет».
Проверьте условия: Шапиро-Уилк на форму распределения и тест Левена на одинаковый разброс в группах, если берете параметрический критерий.
Посчитайте критерий в калькуляторе и выпишите t, df и p (для рангового критерия U или T и p).
Примените правило: t эмп больше t крит или p меньше 0,05, значит различия достоверны.
Добавьте размер эффекта и доверительный интервал разницы, если группы меньше 20 человек.
Запишите таблицу с M ± m, t, df и p и одну фразу с выводом. Недостоверный результат описывайте так же.
Если данные уже собраны, а критерий все еще под вопросом, загляните в базу методов или закажите консультацию: подберем критерий, посчитаем и оформим таблицу под требования вашей кафедры.
Помогу с расчетами лично
Я Андрей Лазарев, автор StatBlank. Подберу критерий под ваши данные, посчитаю статистику и оформлю таблицы с выводами для диплома. За качество расчета отвечаю лично.