Расчёт размера выборки — сколько человек набрать
Помощник отвечает на вопрос, с которого начинается дипломная работа: сколько человек набрать, чтобы исследование вообще имело шанс что-то доказать. Расчёт делают до сбора данных — по ожидаемому размеру эффекта, уровню значимости и мощности. Здесь пять задач: сравнение двух групп, замеры «до и после», корреляция, сравнение долей и опрос. Отдельно учитываются поправка на непараметрические критерии (Манна-Уитни, Уилкоксон) и ожидаемый отсев участников. В конце вы получаете не только число, но и готовый абзац для главы «Организация исследования».
Это расчёт ДО сбора данных: сколько человек набрать
Помощник отвечает на вопрос, который научный руководитель задаёт первым: «а почему у вас именно столько человек?». Готовый ответ — число плюс три параметра, из которых оно получено. Если выборка у вас уже собрана и вопрос обратный («хватило ли её»), вам на страницу мощности критерия.
Три слова, без которых расчёт не сделать
Уровень значимости α
Риск поднять ложную тревогу: объявить различия там, где их нет. Обычно 0,05 — то есть один ложный вывод на двадцать.
Мощность 1 − β
Наоборот: вероятность НЕ проглядеть различия, если они действительно есть. 0,8 значит, что из десяти таких экспериментов восемь дадут значимый результат, а два — нет, просто по невезению.
Размер эффекта
Насколько сильные различия вы рассчитываете найти. Не «сколько единиц», а «во сколько разбросов»: тогда число не зависит от того, в чём меряли — в секундах, баллах или сантиметрах.
Житейская аналогия. Мощность — это острота зрения вашего исследования, а размер эффекта — величина буквы на таблице у окулиста. Крупную букву (большой эффект) видно и с плохим зрением, то есть на маленькой выборке. Мелкую (малый эффект) можно разглядеть, только если зрение хорошее — а «зрение» здесь покупается ровно одним: количеством людей. Отсюда и главный вывод расчёта: чем слабее ожидаемый эффект, тем больше нужна выборка, причём не пропорционально, а гораздо быстрее — вдвое меньший эффект требует вчетверо больше людей.
Поля заполнены примером
Самый частый план дипломной работы: экспериментальная и контрольная группы, ожидаемый эффект средней величины (d = 0,5). Такой разрыв по ситуативной тревожности по шкале Спилбергера-Ханина обычно и считают содержательно важным. Нажмите «Рассчитать» — и увидите, почему «по 15 человек в группе» почти всегда мало.
Разница средних, делённая на объединённое стандартное отклонение. Ориентиры Коэна: 0,2 — малый эффект, 0,5 — средний, 0,8 — большой.
Откуда взять размер эффекта
Это единственное число, которое калькулятор не может придумать за вас. Три законных источника, в порядке предпочтения:
- 1. Похожая работа. Найдите статью или диплом с той же методикой и посчитайте эффект по опубликованным средним и σ — поля ниже это сделают.
- 2. Содержательный минимум. Спросите себя: какая разница была бы практически важна? Прибавка 2 см в прыжке никого не интересует, 10 см — интересует. Считайте от неё.
- 3. Ориентиры Коэна. Если совсем не за что зацепиться, берут стандартные значения: d = 0,2 — малый, 0,5 — средний, 0,8 — большой. В педагогике и психологии по умолчанию закладывают средний.
Чего делать нельзя: подставлять сюда эффект, полученный на собственных данных, и выдавать расчёт за априорный. Такой «расчёт» всегда даёт объём, равный уже собранному, — это подгонка, и на защите её узнают сразу. Ориентиры малого / среднего / большого эффекта предложил Дж. Коэн (Cohen J. Statistical Power Analysis for the Behavioral Sciences, 1988) именно как заглушку на случай, когда своих данных нет.
Посчитать размер эффекта из ожидаемых средних
Чтобы обнаружить такой эффект, понадобится 64 чел. в каждой группе, 128 всего. Такой объём для дипломной работы реалистичен.
Подвигайте ползунок — и увидите главное свойство расчёта: объём растёт не линейно. Уменьшив эффект вдвое, вы увеличиваете выборку вчетверо.
Уровень значимости — допустимая вероятность ошибиться, признав различия там, где их нет. Ужесточая α, вы страхуетесь от ложной тревоги, но платите за это людьми: при α = 0,01 выборка вырастает примерно в полтора раза. Уровень выбирают до расчёта, а не подгоняют под желаемый объём. Подробнее: что такое p-значение и статистическая мощность.
Коэн предложил 0,80 как разумный компромисс: пропустить существующий эффект считается вчетверо менее дорогой ошибкой, чем объявить несуществующий. Для дипломной работы 0,80 берут почти всегда — 0,90 и 0,95 требуют заметно больше людей.
Считаете Манна-Уитни или Уилкоксоном? Людей нужно больше
Все таблицы объёма выборки — включая таблицы Коэна и расчёт выше — построены для параметрических критериев. Ранговый критерий работает не с самими значениями, а с их порядковыми номерами, и часть информации при этом теряется. Насколько именно — известно точно: асимптотическая относительная эффективность (ARE) критерия Манна-Уитни по отношению к t-критерию Стьюдента на нормальных данных равна 3/π ≈ 0,955. То же значение у критерия Уилкоксона для связанных выборок; у корреляции Спирмена против Пирсона — 9/π² ≈ 0,912. Значит, объём надо разделить на ARE, то есть увеличить примерно на 5 % (для Спирмена — на 10 %).
Три оговорки, без которых поправку применяют неправильно. Первая: 0,955 — это цена рангов на нормально распределённых данных, то есть в самом невыгодном для рангового критерия случае. На скошенных данных и при выбросах Манна-Уитни бывает эффективнее t-критерия, и поправка не нужна вовсе. Вторая: если закон распределения заранее неизвестен, берут не 0,955, а доказанную нижнюю границу ARE ≥ 0,864 (Ходжес и Леман, 1956) — отсюда известное правило «добавь к выборке 15 %», это третья кнопка. Третья: ARE — величина асимптотическая, то есть точная при больших объёмах; на выборке в 10–15 человек это ориентир, а не гарантия.
Если столько людей физически не набрать
Обычная ситуация: расчёт требует 128 человек, а в вашем распоряжении одна группа из двадцати. Выбрасывать расчёт не надо — есть четыре законных выхода, и все они лучше, чем молча набрать сколько получится.
Сменить план на «до и после»
Связанные замеры у одних и тех же людей требуют в разы меньше участников, потому что каждый человек сам себе контроль. Часто это единственная реальная возможность.
Взять более чувствительный показатель
Чем точнее измерение, тем меньше разброс и тем больше размер эффекта при той же разнице. Смена методики иногда экономит половину выборки.
Смягчить требования
Мощность 0,80 — соглашение, а не закон. При 0,70 людей нужно заметно меньше; главное — заявить это заранее и обосновать, а не подогнать потом.
Оставить как есть и описать ограничение
Посчитайте, какой эффект ваша выборка способна поймать, и напишите об этом в ограничениях. Комиссия ценит осознанность выше, чем красивое p.
Ничего не понятно или не хотите разбираться?
Закажите расчёт у эксперта: он подберёт план под вашу тему, обоснует объём выборки, напишет готовый абзац для главы «Организация исследования» и оформит таблицы по ГОСТ.
Заказать расчёт у экспертаЗачем считать размер выборки заранее
У маленькой выборки есть неприятное свойство: она не находит различий, даже когда они на самом деле есть. Студент честно провёл эксперимент, методика сработала, но в двух группах по двенадцать человек критерий показывает p = 0,21 — и работа заканчивается выводом «различия не выявлены». Причина не в методике, а в том, что людей было мало. Расчёт размера выборки нужен именно затем, чтобы это выяснить до эксперимента, а не после.
Второе применение чисто практическое. Научный руководитель почти наверняка спросит, почему выбрано столько-то человек, и «сколько было в группе» — плохой ответ. Хороший ответ звучит так: «объём определён априорным анализом мощности при α = 0,05, мощности 0,80 и среднем размере эффекта d = 0,5». За этой фразой стоит расчёт, который вы можете показать, и вопрос закрывается.
Есть и обратная ситуация: набрать вчетверо больше людей, чем нужно, — это лишние месяцы работы и лишние анкеты, которые ничего не добавят к выводу. Расчёт показывает разумный минимум с обеих сторон.
Три числа, без которых расчёт не сделать
Уровень значимости α — допустимый риск объявить различия там, где их нет. В педагогике и психологии берут 0,05. Мощность 1 − β — противоположная величина: вероятность НЕ проглядеть различия, если они действительно есть. Стандарт 0,80 предложил Джейкоб Коэн, и означает он вот что: из десяти таких экспериментов восемь дадут значимый результат, а два — нет, просто по невезению. Ниже 0,80 опускаться не принято, выше — можно, но каждый шаг стоит людей.
Третье число — размер эффекта, и оно единственное, которое калькулятор не может придумать за вас. Это не «на сколько единиц отличаются группы», а «на сколько разбросов»: разница средних, делённая на стандартное отклонение. Благодаря делению число не зависит от того, в чём вы мерили — в секундах, сантиметрах или баллах, — и его можно брать из чужих исследований.
Брать размер эффекта надо в таком порядке: сначала искать похожую работу с той же методикой и считать по её средним и σ; если такой нет — исходить из того, какая разница была бы практически важна; и только если совсем не за что зацепиться — брать типовые ориентиры Коэна из таблицы ниже. Чего делать нельзя — подставлять эффект, полученный на собственных данных: такой «расчёт» всегда выдаёт объём, равный уже собранному, и на защите это узнают сразу.
Ориентиры размера эффекта по Коэну и сколько человек они требуют
| Величина эффекта | d (две группы) | r (корреляция) | Нужно на группу при α = 0,05 и мощности 0,80 |
|---|---|---|---|
| Малый | 0,2 | 0,1 | 394 человека (d) / 782 наблюдения (r) |
| Средний | 0,5 | 0,3 | 64 человека (d) / 85 наблюдений (r) |
| Большой | 0,8 | 0,5 | 26 человек (d) / 29 наблюдений (r) |
Значения объёма — по таблицам Cohen J. (1988) и точному расчёту через нецентральное t-распределение. Видно главное свойство: эффект вдвое меньше требует выборки вчетверо больше.
Поправка на непараметрические критерии
Все таблицы объёма выборки, включая таблицы Коэна, построены для параметрических критериев — Стьюдента, Пирсона. Но студенческие данные часто ненормальны, и обрабатывают их Манна-Уитни или Вилкоксоном. Ранговый критерий работает не с самими значениями, а с их порядковыми номерами, поэтому часть информации теряется, и людей ему нужно больше.
Насколько именно — известно точно. Асимптотическая относительная эффективность (ARE) критерия Манна-Уитни по отношению к t-критерию Стьюдента на нормальных данных равна 3/π ≈ 0,955. То же значение у критерия Уилкоксона для связанных выборок. Значит, расчётный объём надо разделить на 0,955, то есть увеличить примерно на 5 %. У корреляции Спирмена против Пирсона эффективность ниже — 9/π² ≈ 0,912, добавлять надо около 10 %.
Три оговорки, без которых поправку применяют неправильно. Первая: 0,955 — это цена рангов на нормально распределённых данных, то есть в самом невыгодном для рангового критерия случае; на скошенных данных и при выбросах Манна-Уитни бывает эффективнее Стьюдента, и поправка не нужна вовсе. Вторая: если закон распределения заранее неизвестен, берут не 0,955, а доказанную нижнюю границу ARE ≥ 0,864 (Ходжес и Леман, 1956) — отсюда известное практическое правило «добавь к выборке 15 %». Третья: ARE — величина асимптотическая, точная при больших объёмах; на выборке в десять-пятнадцать человек это ориентир, а не гарантия.
Насколько увеличить выборку под ранговый критерий
| Метод обработки | Параметрический аналог | ARE | Прибавка к объёму |
|---|---|---|---|
| Критерий Манна-Уитни | t-критерий для независимых выборок | 3/π ≈ 0,955 | +4,7 % |
| Критерий Уилкоксона | парный t-критерий | 3/π ≈ 0,955 | +4,7 % |
| Корреляция Спирмена | корреляция Пирсона | 9/π² ≈ 0,912 | +9,7 % |
| Распределение неизвестно | нижняя граница Ходжеса-Лемана | ≥ 0,864 | +15,7 % |
Значения ARE — для нормально распределённых данных, то есть худший случай для рангового критерия. Калькулятор применяет поправку сам, если выбрать соответствующую кнопку.
Как понять результат
Результат показан тремя шагами, и это сделано специально: в дипломе пишут первое число, а набирают последнее. Чистая потребность — то, что даёт расчёт при выбранных α, мощности и размере эффекта. Дальше к ней прибавляется поправка на ранговый критерий, если вы собираетесь считать Манна-Уитни, и поправка на отсев — потому что кто-то заболеет, кто-то бросит, а часть анкет окажется испорченной. В работах со школьниками и студентами закладывают 10–20 %.
Рядом стоит фактическая мощность при найденном объёме — она всегда чуть выше заказанной, потому что людей нельзя набрать «шестьдесят три с половиной» и объём округляется вверх. Полученное число — минимум, а не рекомендация: наберёте больше, будет только лучше; наберёте меньше — сознательно соглашаетесь, что реальный эффект такой величины вы, скорее всего, не заметите.
Расчёт здесь идёт не по формуле из методичек, а точным перебором по нецентральному t-распределению — так же, как в программе G*Power и пакете pwr для R. Формула n = 2(zα + zβ)²σ²/Δ² подменяет t-распределение нормальным и на студенческих объёмах занижает потребность на одного-двух человек в группе.
Как оформить в работе и что делать, если столько не набрать
Готовый абзац калькулятор выдаёт сам — с подставленными α, мощностью, размером эффекта и итоговым числом людей. Его ставят в методическую часть, туда, где описывается выборка, обычно сразу после характеристики контингента. Отдельно выгружаются таблица расчёта и рисунок «объём выборки при разном размере эффекта» — оба в формате Word, с редактируемой диаграммой.
Частая ситуация: расчёт требует 128 человек, а в вашем распоряжении одна группа из двадцати. Выбрасывать расчёт не надо. Есть четыре законных выхода: перейти на план «до и после», где каждый участник сам себе контроль и людей нужно в разы меньше; взять более чувствительный показатель, у которого меньше разброс; заранее заявить мощность 0,70 вместо 0,80 и обосновать это; либо оставить выборку как есть и честно описать ограничение.
Последний вариант недооценивают. Если вы посчитали, какой эффект ваша выборка была способна обнаружить, и написали об этом в ограничениях исследования, — это сильная позиция на защите, а не слабая. Комиссия ценит осознанность выше, чем красивое p-значение. Посчитать эту величину можно на странице мощности критерия.