Статистическая значимость: что значит p < 0,05
Что такое статистическая значимость простыми словами: какой уровень выбрать, чем «значимо» отличается от «важно» и как на вывод влияет размер выборки. С примерами и FAQ.
В дипломе почти всегда наступает момент, когда всё сводится к одной фразе: «различия статистически значимы». От неё зависит, подтвердилась гипотеза или нет.
Проблема в том, что за этой фразой обычно нет понимания. Студент видит p = 0,03, пишет «значимо» — и на защите не может объяснить, что именно он доказал. Разберём по существу: что такое значимость, какой уровень брать, почему она зависит от числа испытуемых и чем «значимое» различие отличается от «большого».
В двух словах
Статистическая значимость — это утверждение о том, что найденное различие или связь вряд ли объясняются случайностью выборки. И только об этом. Она не говорит, что эффект большой, важный и полезный на практике.
Работает это так: вы считаете критерий, получаете p-значение и сравниваете его с заранее выбранным порогом α (обычно 0,05). p меньше порога — результат значим, больше — значимых различий не выявлено.
Три вещи, которые нужно держать в голове одновременно: сам факт значимости (p), величина эффекта (d Коэна) и объём выборки. Порознь они врут.
Что такое статистическая значимость по существу
Вы измерили две группы и увидели разницу в средних. У этой разницы всегда две возможные причины:
- эффект реален — экспериментальная программа правда работает;
- это случайность выборки — вам просто попались такие люди.
Статистика не умеет выбирать между этими вариантами напрямую. Она делает другое: предполагает, что различий нет (это нулевая гипотеза H₀), и считает, насколько странно выглядят ваши данные при таком предположении. Мера «странности» — p-значение.
Если данные при H₀ выглядят слишком странно (p < 0,05), объяснение «это случайность» отбрасывают. Вот это и называется статистически значимым результатом.
Значимость — свойство не эффекта, а доказательства. Фраза «различия значимы» означает «у меня достаточно данных, чтобы не списывать эту разницу на случайность», а не «разница большая».
Из этого следует неприятное: значимость зависит не только от природы, но и от вас — от того, сколько человек вы измерили и какой порог назначили.
Уровни значимости: 0,05, 0,01 и 0,001
Уровень значимости α — это порог, который вы назначаете до расчёта. Он же — допустимая вероятность объявить эффект там, где его нет (ошибка первого рода).
- α = 0,05 — стандарт для дипломов и большинства работ по психологии, педагогике и физкультуре. Одна звёздочка в таблице.
- α = 0,01 — строгий уровень: берут, когда цена ложной находки высока (медицина, допуск к нагрузкам). Две звёздочки.
- α = 0,001 — очень высокая значимость, обычно не назначается заранее, а просто констатируется по факту. Три звёздочки.
Порог выбирают один раз и для всей работы. Менять его после расчёта («получилось 0,07, возьму α = 0,1») — подгонка, и на защите это видно сразу.
p = 0,051 и p = 0,049 различаются на ничто, но по формальному правилу дают противоположные выводы. Не делайте вид, что 0,051 — это «почти значимо, считаем значимым». Честнее написать «различия на уровне статистической тенденции» и привести размер эффекта.
Если вы работаете не с p-значением, а с таблицами критических значений, та же логика рисуется через ось значимости, а какое число с каким сравнивать — разобрано в статье «Эмпирическое и критическое значение».
«Значимо» — это не «важно»
Самая частая подмена в дипломах: студент получает p < 0,01 и пишет «выявлено существенное улучшение показателей». Слово «существенное» тут не из статистики — p об этом ничего не сказал.
За величину отвечает размер эффекта: d Коэна, r, η². Он показывает, насколько далеко разошлись группы, и не зависит от числа испытуемых. Значимость и размер эффекта — две независимые оси, и вместе они дают четыре разных вывода.
Опасны именно два боковых квадранта. Жёлтый — когда значимость выдают за практический успех. Фиолетовый — когда реальный эффект хоронят выводом «различий нет», хотя виновата мощность, а не методика.
Пример. В дипломе по физической культуре сравнивали прыжок в длину с места у двух групп по 8 человек. Разница средних 6 см, d = 0,7 — эффект солидный, но p = 0,17. Вывод «методика не работает» здесь неверен: при 8 испытуемых на группу критерий такую разницу просто не улавливает.
Ловушка размера выборки
Вот главное, что нужно понять про значимость: p зависит не только от величины различия, но и от того, сколько человек вы измерили. Одна и та же разница на разных выборках даёт разный вердикт.
Посмотрим на числах. Тест тревожности, разброс в группе около 5 баллов.
Как объём выборки меняет вывод при одной и той же разнице
| Выборка | Разница средних | d Коэна | t | p | Вывод |
|---|---|---|---|---|---|
| 12 + 12 | 2,0 балла | 0,40 | 0,98 | 0,34 | не значимо |
| 300 + 300 | 2,0 балла | 0,40 | 4,90 | < 0,001 | значимо |
| 300 + 300 | 0,8 балла | 0,16 | 2,02 | 0,044 | значимо |
Читайте таблицу по строкам. Средний по силе эффект (d = 0,40) на 12 испытуемых остаётся «незначимым», а на 300 даёт p < 0,001 — при этом сам эффект не изменился. А в последней строке значимой становится разница в 0,8 балла, которую на практике никто не заметит.
Отсюда рабочее правило: маленькая выборка — не спешите объявлять «различий нет», смотрите d. Большая выборка — не спешите радоваться звёздочкам, тоже смотрите d. Прикинуть нужное число участников заранее помогает калькулятор объёма выборки и статья «Сколько респондентов нужно для диплома».
Посчитать сам критерий и получить p вместе с размером эффекта можно здесь.
Если распределение не нормальное или шкала порядковая, тот же вывод о значимости даст критерий Манна-Уитни. Какой метод брать под ваши данные — разобрано в статье «Как выбрать статистический критерий».
Что писать в дипломе
Вывод о значимости — это не одна фраза, а связка чисел. Проверьте, что у вас есть всё перечисленное.
- Название критерия — «по t-критерию Стьюдента для независимых выборок».
- Эмпирическое значение статистики — t = 4,90 (или U, T, χ² — в зависимости от метода).
- Объём выборки или степени свободы — n = 24, df = 22.
- p-значение — точное (p = 0,034) либо порогом, если оно очень мало (p < 0,001).
- Размер эффекта — d = 0,40, и словами: малый, средний или большой.
- Направление различия — где показатель выше и на сколько единиц.
Готовые формулировки — подставьте свои числа.
- «Различия между контрольной и экспериментальной группами статистически значимы: t = 4,90; df = 598; p < 0,001. Размер эффекта средний (d = 0,40), прирост в экспериментальной группе составил 2,0 балла».
- «Статистически значимых различий не выявлено (U = 145; p = 0,34). При этом размер эффекта средний (d = 0,40), что при выборке 12 + 12 человек указывает на недостаточную мощность, а не на отсутствие эффекта».
- «Различие статистически значимо (p = 0,044), однако размер эффекта мал (d = 0,16), поэтому практическая ценность результата ограничена».
Как правильно оформлять само число p — с запятой, ведущим нулём и нужным числом знаков — показано в статье «Как записывать p-значение».
Частые ошибки
- «p > 0,05 — значит, различий нет». Отсутствие доказательства не равно доказательству отсутствия: вы просто не нашли эффект.Пишите «значимых различий не выявлено» и добавляйте размер эффекта с оценкой мощности.
- «p = 0,001 — значит, эффект в 50 раз сильнее, чем при p = 0,05». p измеряет надёжность вывода, а не величину различия.О величине судите только по d Коэна, r или η².
- Значимость выдают за практическую пользу. На выборке в 500 человек значимой становится разница, которую не увидит ни один тренер.Рядом с p всегда приводите размер эффекта и разницу в исходных единицах — секундах, баллах, сантиметрах.
- Порог назначают после расчёта. «Взял 0,1, потому что с 0,05 не получилось» — подгонка результата.Зафиксируйте α = 0,05 в методах исследования, до сбора данных.
- Считают десяток критериев и выбирают значимые. При 20 проверках одна «звёздочка» появится случайно даже на случайных данных.Заранее опишите проверяемые гипотезы, а при множественных сравнениях используйте поправку Бонферрони.
- «Достоверность» вместо «значимости». В студенческих работах эти слова смешивают, и получается «достоверность различий 95%».Пишите «статистически значимые различия» или «статистически достоверные различия (p < 0,05)» — без процентов уверенности.
Частые вопросы
Какой уровень значимости выбрать для диплома?
В подавляющем большинстве работ — 0,05. Уровень 0,01 берут, когда ложная находка дорого стоит: медицинские рекомендации, допуск к соревновательным нагрузкам. Если научный руководитель не требует иного, ставьте α = 0,05 и фиксируйте это в описании методов.
Значимость и достоверность — это одно и то же?
В студенческих работах эти слова используют как синонимы: «достоверные различия» = «статистически значимые различия». Строго говоря, «достоверность» — бытовое слово, а «статистическая значимость» — термин. Безопасный вариант для диплома — писать «статистически значимые различия (p < 0,05)».
Можно ли получить значимость на выборке в 10 человек?
Да, если эффект очень крупный: d порядка 1,2–1,5 ловится и на десяти испытуемых. Но такие эффекты в педагогике и психологии редки, поэтому на малых выборках чаще получается p > 0,05. Что с этим делать — в статье «Различия статистически не значимы».
Нужно ли писать размер эффекта, если научный руководитель не просит?
Да. Это две строки текста, которые страхуют вас на защите: и от вопроса «а насколько велики различия?», и от ситуации, когда значимости нет, а работу надо защитить. Обзор мер — в статье «Размер эффекта: d Коэна, r и η²».
Что делать, если p = 0,06?
Не округлять и не менять порог. Напишите, что различия не достигли уровня значимости, приведите точное p и размер эффекта и объясните вероятную причину — обычно это малая выборка. Такая формулировка выглядит грамотнее, чем натянутое «различия значимы».
Короткий алгоритм
- До расчёта зафиксируйте гипотезы H₀ и H₁ и уровень значимости α = 0,05.
- Выберите критерий под тип данных и посчитайте его в каталоге калькуляторов.
- Сравните полученное p с α: меньше — различия значимы, больше — значимых различий не выявлено.
- Посчитайте размер эффекта и оцените его словами — малый, средний, большой.
- Запишите вывод связкой: критерий, статистика, df или n, p, размер эффекта, направление различия.
- Если значимости нет — проверьте объём выборки и мощность, прежде чем писать «методика не работает».
Значимость отвечает на вопрос «это не случайность?», размер эффекта — «насколько велико?», а выборка определяет, услышите ли вы ответ вообще. В дипломе нужны все три числа.
Что ещё почитать
- Что такое p-значение простыми словами — как читать само число p.
- Размер эффекта: d Коэна, r и η² — чем измерить величину различия.
- Статистическая мощность — почему маленькая выборка «не видит» эффект.
- Ось значимости — как оформить вывод через критические значения.
- Различия не значимы: что делать — план действий при p > 0,05.
Не уверены, что ваш вывод о значимости сформулирован корректно, — посчитайте критерий в базе методов или закажите консультацию, проверим расчёт и формулировки.
Не хотите разбираться со статистикой сами?
Эксперт подберёт метод, посчитает и оформит таблицы по ГОСТ под вашу тему.
Заказать консультацию