StatBlank
Практика23 июня 2026·9 мин чтения

Бутстрап в дипломе: доверительные интервалы на малых выборках

Что такое бутстрап (bootstrap), как методом ресемплинга построить доверительный интервал на маленькой выборке без предположения о нормальности, и что написать в дипломе. С примером и FAQ.

Андрей Лазарев
Андрей Лазарев
Эксперт по математической статистике, создатель StatBlank

У вас 12 испытуемых, распределение «кривое», а классическая формула доверительного интервала через t-критерий Стьюдента предполагает нормальность, которой нет. Что делать?

Бутстрап решает эту задачу честно: он строит доверительный интервал прямо из ваших данных, не требуя красивого колоколообразного распределения.

В двух словах

Бутстрап (bootstrap) — это метод ресемплинга: компьютер тысячи раз «пересобирает» вашу выборку с возвращением, каждый раз считает нужный показатель (среднее, медиану, корреляцию) и из разброса этих тысяч значений строит доверительный интервал.

Главное преимущество — бутстрапу не нужна нормальность распределения и большой объём. Он работает там, где классические формулы дают сбой: на малых и «кривых» выборках, а также для показателей, у которых вообще нет простой формулы интервала (медиана, коэффициент асимметрии, разность медиан).

Если же ваши данные нормальны и вам нужен интервал для обычного среднего — проще посчитать его классически в калькуляторе описательной статистики; бутстрап нужен именно для сложных случаев.

Что такое ресемплинг с возвращением

В основе бутстрапа лежит простая идея. Ваша выборка — это лучшее, что у вас есть, чтобы судить о генеральной совокупности. Так почему бы не «размножить» её саму из себя?

Ресемплинг с возвращением (resampling) работает так. Представьте, что числа вашей выборки лежат в мешке. Вы вытягиваете одно число, записываете и возвращаете обратно — и так n раз (где n — размер исходной выборки). Получается новая выборка того же размера, в которой какие-то значения попали дважды, а какие-то ни разу.

Такую «псевдовыборку» называют бутстрап-выборкой. Из неё считают интересующий показатель — например, среднее. Повторяют всё это много раз (обычно 1000–10 000), и получают облако оценок показателя.

Заметка

Слово bootstrap («вытягивать себя за шнурки от ботинок») — отсылка к барону Мюнхгаузену, который вытащил себя из болота за волосы. Метод словно «вытягивает» оценку точности из самой выборки, без внешних предположений.

Выборка n = 12 выборка 1 → M₁ выборка 2 → M₂ выборка K → M_K 95% ДИ из M₁…M_K
Рисунок 1 — Логика бутстрапа: из одной выборки получают тысячи псевдовыборок, по каждой считают показатель и из их разброса строят интервал

Когда брать бутстрап

Бутстрап стоит выбрать в этих ситуациях:

  • Распределение не нормальное. Проверка критерием Шапиро-Уилка показала, что нормальности нет, а выборку нельзя увеличить.
  • Выборка маленькая (примерно n < 30), и вы не уверены, что классическая t-формула корректна.
  • Нужен интервал для «неудобного» показателя — медианы, коэффициента асимметрии, разности медиан, отношения, для которых нет простой готовой формулы.
  • Есть выбросы, и вы хотите оценку точности, которая их честно учитывает, а не маскирует.

Пример. Вы измерили время реакции у 15 спортсменов. Распределение скошено вправо (несколько медленных значений), поэтому вместо среднего описываете медиану. Формулы доверительного интервала для медианы в учебнике нет — бутстрап даёт его за пару секунд.

Когда бутстрап не нужен

Не во всех случаях стоит усложнять:

  • Данные нормальны, показатель — среднее. Классический интервал через t-критерий проще, привычнее научнику и даёт почти тот же результат.
  • Выборка совсем крошечная (n < 8–10). Бутстрап не создаёт новой информации: если данных по-настоящему мало, интервал будет широким и неустойчивым — это честно, но «вытянуть» точность из воздуха метод не может.
  • Вам нужно проверить гипотезу о различиях, а не оценить точность одного показателя. Тогда берите Манна-Уитни или Вилкоксона — это профильные критерии.
Осторожно

Бутстрап не «лечит» плохие данные. Если выборка смещённая (например, опросили только лучших студентов), бутстрап повторит это смещение во всех псевдовыборках. Метод оценивает разброс оценки, но не исправляет ошибки сбора данных.

Как строят доверительный интервал

После того как получены K значений показателя (скажем, 5000 бутстрап-средних), интервал строят чаще всего перцентильным методом:

  1. Сортируют все K значений по возрастанию.
  2. Для 95% интервала берут 2,5-й и 97,5-й перцентили этого ряда.
  3. Эти два числа и есть нижняя и верхняя границы доверительного интервала.

То есть граница «отрезает» по 2,5% самых крайних бутстрап-оценок с каждого конца. Между ними остаётся 95% значений — это и есть правдоподобный диапазон.

Совет

Перцентильный метод — самый наглядный, его достаточно для диплома. Существуют и уточнённые версии (BCa — с поправкой на смещение и асимметрию), но для студенческой работы перцентильного интервала, как правило, хватает — главное указать, какой метод применяли.

Пример расчёта по шагам

Допустим, у вас выборка из n = 12 значений тревожности с заметной асимметрией. Среднее по ней M = 46. Нужен 95% доверительный интервал.

  1. Ресемплинг. Компьютер строит 5000 бутстрап-выборок по 12 значений каждая (с возвращением).
  2. Показатель. Для каждой считает среднее — получается 5000 чисел.
  3. Сортировка. Эти 5000 средних упорядочивают.
  4. Перцентили. Берут 2,5-й перцентиль (125-е значение по счёту) и 97,5-й (4875-е). Допустим, это 41,2 и 50,8.

Вывод: 95% бутстрап-интервал для среднего тревожности — [41,2; 50,8].

В таблице 1 показано, как растёт устойчивость интервала с числом повторений.

Таблица 1 — Влияние числа бутстрап-повторений на границы интервала (n = 12)

Число повторений K Нижняя граница Верхняя граница Стабильность
100 41,9 50,1 низкая, «дёргается»
1000 41,3 50,7 приемлемая
5000 41,2 50,8 хорошая
10 000 41,2 50,8 избыточно для диплома

Видно, что после 1000–5000 повторений границы практически перестают меняться — этого достаточно.

Чем отличается от классического интервала

Простыми словами — разница в том, откуда берётся информация о разбросе оценки.

  • Классический интервал опирается на формулу M ± t · (s / √n) и предполагает, что выборочные средние распределены нормально. На малых и «кривых» выборках это предположение шаткое (подробнее — в статье про доверительный интервал).
  • Бутстрап не предполагает ничего о форме распределения. Он эмпирически воссоздаёт разброс оценки прямо из данных, поэтому работает даже там, где формула неприменима.

Когда данные нормальны, оба метода дают почти одинаковый интервал. Расхождение проявляется именно на асимметрии и малых n — и тут бутстрап честнее.

Что писать в дипломе

Готовые формулировки, которые можно адаптировать:

«Поскольку распределение показателя отклонялось от нормального (критерий Шапиро-Уилка, p < 0,05), доверительный интервал для медианы был построен методом бутстрапа (перцентильный метод, 5000 повторений с возвращением)».

«95% доверительный интервал для среднего, полученный бутстрап-методом (5000 итераций), составил [41,2; 50,8], что подтверждает устойчивость оценки на малой выборке (n = 12)».

В методах исследования обязательно укажите три вещи: показатель (среднее / медиана), число повторений (например, 5000) и метод построения интервала (перцентильный или BCa). Этого достаточно для воспроизводимости.

Частые ошибки

  • Слишком мало повторений. 50–100 итераций дают «дёргающийся» интервал. Берите минимум 1000, лучше 5000.
  • Ресемплинг без возвращения. Если тянуть числа без возврата, получится просто исходная выборка в другом порядке — смысл теряется. Возвращение обязательно.
  • Бутстрап вместо проверки гипотезы. Бутстрап оценивает точность показателя, а не доказывает различия между группами — для этого нужны критерии различий.
  • Молчание о методе. Не написали «перцентильный, 5000 повторений» — рецензент не сможет оценить корректность. Указывайте параметры всегда.
  • Надежда «вытянуть» точность из 5 наблюдений. На сверхмалых выборках интервал будет очень широким — это не недостаток метода, а честное отражение нехватки данных.

Частые вопросы

Сколько повторений делать?

Для диплома берите 5000 — это надёжно и быстро на любом ноутбуке. Меньше 1000 не рекомендуется: границы будут заметно «плавать» при повторном запуске. Больше 10 000 для студенческой работы избыточно.

Можно ли бутстрапить медиану и корреляцию?

Да, в этом и сила метода. Бутстрап работает для любого показателя, который вы умеете считать на выборке: медианы, асимметрии, коэффициента корреляции, разности групп. Для каждой псевдовыборки просто считаете нужный показатель.

В чём отличие бутстрапа от перестановочного теста?

Бутстрап тянет значения с возвращением и оценивает точность одного показателя (строит интервал). Перестановочный тест перемешивает метки групп без возвращения и проверяет гипотезу о различиях. Это разные инструменты для разных задач.

Нужна ли проверка нормальности перед бутстрапом?

Нет, в этом и смысл: бутстрап не требует нормальности. Но проверку всё равно стоит сделать — именно её результат (нормальности нет) служит обоснованием, почему вы выбрали бутстрап, а не классическую формулу.

Чем считать бутстрап?

Бесплатно — в jamovi или JASP с соответствующим модулем, либо парой строк кода в R/Python. Вручную тысячи ресемплингов не делают — это работа для компьютера.

Короткий алгоритм

  1. Проверьте нормальность (Шапиро-Уилк). Если её нет, а выборка мала — бутстрап оправдан.
  2. Выберите показатель (среднее, медиана, корреляция) и число повторений (5000).
  3. Прогоните ресемплинг с возвращением, посчитайте показатель для каждой псевдовыборки.
  4. Возьмите 2,5-й и 97,5-й перцентили — это границы 95% интервала.
  5. В дипломе укажите показатель, число итераций и метод (перцентильный).

Что ещё почитать

Если сомневаетесь, подойдёт ли бутстрап под вашу задачу, загляните в базу методов или закажите консультацию — поможем подобрать корректный способ оценки.

Не хотите разбираться со статистикой сами?

Эксперт подберёт метод, посчитает и оформит таблицы по ГОСТ под вашу тему.