Мощность статистического критерия — онлайн-калькулятор
«А хватило ли вам выборки?» — этот вопрос на защите звучит чаще любого другого статистического. Мощность критерия (1 − β) отвечает на него числом: с какой вероятностью ваш критерий обнаружил бы эффект заданной величины при том объёме выборки, который у вас есть. Вторая половина ответа не менее важна — минимальный обнаружимый эффект: что именно ваше исследование в принципе было способно заметить. Калькулятор считает обе величины для четырёх задач: две группы, замеры «до и после», корреляция и сравнение долей. Расчёт идёт через нецентральное t-распределение, а не нормальное приближение.
Мощность «по полученному p» считать нельзя — это методологическая ошибка
Если подставить в расчёт тот размер эффекта, который получился на ваших же данных, выйдет так называемая наблюдаемая (post-hoc) мощность. Она не содержит никакой новой информации: она однозначно связана с p-уровнем и всегда мала ровно тогда, когда p велико. Фраза «различий не найдено, потому что мощность оказалась низкой» — это то же самое, что «различий не найдено, потому что различий не найдено». Так и пишут в методических обзорах, и на защите за это спрашивают.
Правильный вопрос другой: «какой эффект моя выборка вообще была способна обнаружить?». На него отвечает минимальный обнаружимый эффект — калькулятор считает его ниже. Размер эффекта для расчёта берут не из своих данных, а из литературы или из содержательных соображений: какая разница была бы практически важна.
Поля заполнены примером
Типичная студенческая работа: по 12 человек в двух группах, ожидаемый эффект средней величины (d = 0,6) — такой разрыв по ситуативной тревожности по шкале Спилбергера-Ханина обычно и считают содержательно важным. Нажмите «Рассчитать» — и увидите, почему при таком объёме выборки различия чаще всего не находятся.
Разница средних, делённая на объединённое стандартное отклонение. Ориентиры Коэна: 0,2 — малый эффект, 0,5 — средний, 0,8 — большой.
Не знаете размер эффекта? Посчитайте из своих чисел
Числа берите из литературы или из пилотного замера. Подставлять сюда собственный результат ради «обоснования» задним числом — та самая ошибка, о которой сказано вверху страницы.
При 12 и 12 участниках в группах и α = 0,05 мощность составит 29,0 % — очень низкая. Такой эффект ваша выборка, скорее всего, пропустит.
Ползунок ничего не подгоняет под ваш результат — он показывает, как меняется способность критерия заметить эффект заданной величины при вашем объёме выборки.
Уровень значимости — допустимая вероятность ошибиться, признав различия там, где их нет (ошибка первого рода). Мощность отвечает за другую ошибку — вторую: пропустить эффект, который на самом деле есть. Ужесточая α, вы уменьшаете первую ошибку и одновременно увеличиваете вторую — мощность падает. Для педагогических и психологических исследований почти всегда достаточно 0,05. Подробнее: что такое p-значение и ось значимости.
От этого значения зависит минимальный обнаружимый эффект и требуемый объём выборки в результате. Коэн предложил 0,80 как разумный компромисс: ошибку второго рода допускают вчетверо чаще первой, потому что она дешевле.
Это не то же самое, что расчёт объёма выборки
Объём выборки — до сбора данных
«Сколько человек набрать, чтобы найти эффект такой-то величины». Задают эффект и мощность, получают n. Это планирование: калькулятор объёма выборки.
Мощность — эта страница
«Выборка уже такая, какая есть: что она могла обнаружить». Задают n и эффект, получают мощность и минимальный обнаружимый эффект. Это ответ на вопрос «а хватило ли вам выборки?» — и его задают на защите.
Ничего не понятно или не хотите разбираться?
Закажите расчёт у эксперта: он подберёт метод под вашу тему, посчитает мощность и объём выборки, напишет готовый вывод и оформит таблицы по ГОСТ.
Заказать расчёт у экспертаЧем мощность отличается от расчёта объёма выборки
Это два разных вопроса, и путать их — самая частая ошибка на этой теме. Расчёт объёма выборки решают ДО сбора данных: задают желаемую мощность и важный размер эффекта, получают необходимое n. Мощность считают ПОСЛЕ: выборка уже такая, какая набралась, и вопрос звучит иначе — что эта выборка могла обнаружить.
Если вы ещё планируете исследование и хотите узнать, сколько человек нужно набрать, вам на страницу расчёта объёма выборки — это калькулятор планирования. Если данные уже собраны, а научный руководитель просит обосновать достаточность выборки, вы на нужной странице.
Есть и третья связь: обратная задача на этой странице считает требуемый объём точно, через нецентральное t. Классическая формула объёма выборки с коэффициентами z даёт на студенческих объёмах чуть заниженное число — расхождение в несколько человек на группу. Обе цифры допустимы в работе, но точную защищать проще.
Два вопроса — две страницы
| Вопрос | Что задаёте | Что получаете | Где считать |
|---|---|---|---|
| Сколько человек набрать? | эффект и мощность | необходимое n | калькулятор объёма выборки (/calc/raschet-obema-vyborki) |
| Что моя выборка могла найти? | n и эффект | мощность и минимальный обнаружимый эффект | эта страница |
Формулы у задач общие, направление расчёта — противоположное.
Почему нельзя считать мощность по полученному p-уровню
Соблазн понятен: различий не нашлось, хочется написать «потому что мощность оказалась низкой». Но если подставить в расчёт тот размер эффекта, который получился на ваших же данных, выйдет так называемая наблюдаемая, или post-hoc, мощность. Она однозначно связана с p-уровнем: чем больше p, тем ниже такая «мощность», всегда и без исключений. Новой информации в ней ноль, и фраза превращается в «различий не найдено, потому что различий не найдено».
Про это написаны десятки методических работ, и на защите за такую формулировку спрашивают. Хуже того, наблюдаемая мощность при незначимом результате почти всегда выходит ниже 0,5 — просто по устройству формулы, а не из-за реальных свойств вашего плана.
Правильных путей два. Первый: считать мощность для того размера эффекта, который вы считаете содержательно важным, — взятого из литературы, из пилотного замера или из здравого смысла («разница меньше трёх баллов практического смысла не имеет»). Второй, ещё более честный: посчитать минимальный обнаружимый эффект и написать, что выборка позволяла надёжно выявить различия только начиная с такой величины. Калькулятор считает и то и другое.
Как понять результат
Мощность — это вероятность, число от 0 до 1. Значение 0,80 означает: если эффект заданной величины действительно существует, ваш критерий обнаружит его в 80 случаях из 100, а в 20 — пропустит. Пропуск существующего эффекта называют ошибкой второго рода, её вероятность β = 1 − мощность.
Порог 0,80 предложил Джейкоб Коэн: ошибку второго рода допускают вчетверо чаще первой, потому что она обычно дешевле. В клинических исследованиях требуют 0,90–0,95, в педагогике и психологии 0,80 считается нормой.
Низкая мощность не портит работу — она меняет формулировку вывода. Значимых различий нет и мощность 0,3? Тогда писать «эффекта не существует» нельзя: правильная формулировка — «полученные данные не позволяют отклонить нулевую гипотезу; при данном объёме выборки надёжно выявлялись бы лишь различия величиной от d = 1,20 и выше». Это и есть раздел «ограничения исследования», который на защите ценят.
Трактовка мощности критерия
| 1 − β | Оценка | Что писать в работе |
|---|---|---|
| ниже 0,50 | очень низкая | «Выборка не позволяла выявить эффект такой величины» |
| 0,50–0,79 | недостаточная | «Отсутствие различий не может считаться доказательством их отсутствия» |
| 0,80–0,94 | достаточная | «Объём выборки достаточен для выявления эффекта заявленной величины» |
| 0,95 и выше | высокая | «Мощность критерия высока, вероятность пропустить эффект мала» |
Границы условны и приведены по Коэну (1988): 0,80 — общепринятый минимум.
Размер эффекта: d, r и h
Мощность невозможно посчитать, не сказав, какой эффект вы хотите обнаружить, — и это главная трудность для студента. Для сравнения средних размер эффекта выражают в d Коэна: разница средних, делённая на стандартное отклонение. Ориентиры Коэна — 0,2 малый, 0,5 средний, 0,8 большой.
У связанных замеров «до и после» используют d_z, и это отдельная ловушка: делить надо на стандартное отклонение РАЗНОСТЕЙ, а не исходных значений. При сильной связи замеров разброс разностей заметно меньше, поэтому парный план мощнее независимого при том же числе людей — в этом и смысл повторных измерений.
У корреляции размером эффекта служит сам коэффициент r (0,1 малый, 0,3 средний, 0,5 большой). У долей — величина h Коэна: обычная разность процентов на эту роль не годится, потому что разрыв «5 % против 10 %» замечается куда легче, чем «45 % против 50 %», хотя разность одинакова. Калькулятор считает h из двух введённых процентов сам.
Как считает калькулятор
При верной альтернативной гипотезе статистика Стьюдента распределена не по обычному t-закону, а по нецентральному — со смещением δ, которое зависит от размера эффекта и объёма выборки. Мощность здесь считается именно через функцию распределения нецентрального t (алгоритм Ленса, AS 243) — тот же способ применяют пакет pwr в R и программа G*Power.
Простое нормальное приближение, по которому объём выборки считают вручную, на студенческих объёмах завышает мощность: при десяти участниках в группе расхождение доходит до нескольких процентных пунктов. Для критерия, весь смысл которого в честной оценке «хватило или нет», это существенно.
Исключения оговорены отдельно. У корреляции точного нецентрального распределения нет — применяется z-преобразование Фишера с поправкой на смещение (метод Коэна, он же в пакете pwr), но критическое значение r берётся точно, обращением t-распределения. У долей мощность считается через угловое преобразование: это не упрощение, а сам метод — арксинус как раз и нужен, чтобы разброс перестал зависеть от величины доли.
Как оформить результат в дипломе
Оценку мощности помещают в методическую часть (если считали до сбора данных) или в обсуждение результатов и ограничения исследования (если после). Готовая формулировка с подставленными числами появляется под расчётом — её остаётся скопировать.
Образец: «При объёме выборки n₁ = 12, n₂ = 12 и уровне значимости α = 0,05 мощность критерия в отношении эффекта средней величины (d = 0,60) составила 1 − β = 0,29. Минимальный размер эффекта, обнаруживаемый при данном объёме выборки с вероятностью 0,80, равен d = 1,20. Таким образом, отсутствие статистически значимых различий не может рассматриваться как доказательство отсутствия эффекта».
В таблицу для диплома идут объёмы групп, размер эффекта, α, мощность и минимальный обнаружимый эффект; рисунком показывают, как мощность растёт с объёмом выборки. И то и другое выгружается в Word одной кнопкой, диаграмма в файле остаётся редактируемой.