Бутстрап-доверительный интервал — калькулятор онлайн
Обычный доверительный интервал считают по формуле M ± t·σ/√n. Формула эта требует двух вещей: чтобы распределение было близко к нормальному и чтобы показателем было именно среднее. На дипломных выборках в 15–30 человек первое условие нарушается сплошь и рядом, а второе не выполняется вовсе, когда интервал нужен для медианы, для разности медиан или для коэффициента корреляции — простой формулы для них не существует. Бутстрап обходится без формулы: он много раз пересобирает вашу же выборку и смотрит, как гуляет результат. Калькулятор строит интервал шестью показателями и тремя способами сразу.
На сайте два калькулятора доверительного интервала. Этот считает без формулы, перевыборкой
Вам сюда: бутстрап
Выборка маленькая, распределение скошено или с выбросами — либо интервал нужен для того, для чего формулы нет вовсе: для медианы, стандартного отклонения, разности медиан, коэффициента корреляции. Бутстрап не требует нормальности и работает почти всегда.
Вам не сюда: интервал по формуле
Если нужен интервал среднего, разности средних или доли и данные распределены нормально, берите обычный доверительный интервал: формула M ± t·σ/√n короче, привычнее рецензенту и в этом случае точнее. Проверить нормальность — критерий Шапиро-Уилка.
Один столбец чисел — ваш показатель у всех участников. Бутстрап будет много раз собирать из этих же значений новую выборку такого же объёма и смотреть, как гуляет результат.
Строка — один участникВ клетке — значение показателя у этого участника: балл методики, секунды, сантиметры. Дробные числа пишите через запятую: 42,3.
Названия столбцов попадут в дипломПерепишите заголовки под свою работу — они уйдут и в результат, и в таблицу с рисунком для Word. Данные из Excel вставляются целиком: скопируйте диапазон и вставьте в первую ячейку.
Таблица заполнена примером
Чтобы вы посмотрели, как работает калькулятор. Это проба Штанге — задержка дыхания на вдохе (с) у 15 студентов. Распределение скошено: двое выносливых (68 и 72 с) тянут среднее вверх, поэтому среднее 46,4 с и медиана 43,2 с расходятся почти на четыре секунды. Именно в таких данных обычная формула и подводит.
| № | |
|---|---|
Названия можно переписать — они попадут в результат и в таблицу для диплома. Если столбцов много, таблица прокручивается вбок. Данные из Excel вставляются целиком: скопируйте диапазон и вставьте в первую ячейку.
Перевыборка — это не увеличение выборки. Десять тысяч перевыборок не превращают ваши 15 человек в 150 000: новых сведений о генеральной совокупности они не добывают ни одного. Программа просто много раз тасует те же самые значения — с возвращением, поэтому один участник может попасть в перевыборку дважды, а другой не попасть вовсе, — и смотрит, насколько сильно от этого меняется показатель. Именно этот разброс и становится шириной интервала. Значение по умолчанию — 10 000: этого хватает для любой дипломной работы, дальше меняются только четвёртые знаки. Зерно задаёт последовательность «случайных» чисел: при одном и том же зерне расчёт повторяется в точности, и рецензент, повторив его, получит ваши границы до последней цифры. Зерно указывают в тексте работы вместе с числом перевыборок.
Уровень доверия — надёжность самой процедуры: если повторить исследование много раз и каждый раз строить такой интервал, примерно такая доля интервалов накроет истинное значение. Для педагогических и психологических работ берут 95 % — тот же стандарт, что уровень значимости α = 0,05, только с другой стороны: уровень доверия = 1 − α. Уровень выбирают до расчёта, а не подгоняют под желаемый результат. Подробнее: что такое p-значение и ось значимости.
Все три считаются одновременно и показываются рядом — выбранный идёт в вывод и в файл для диплома. BCa рекомендуют авторы метода: он поправляет перекос облака перевыборок и потому попадает в заявленную надёжность там, где остальные промахиваются. Процентильный проще всего объяснить на защите: это буквально края облака. У базового есть неприятная особенность — он может вылезти за пределы шкалы показателя (например, дать верхнюю границу корреляции больше единицы), поэтому его берут редко.
Ничего не понятно или не хотите разбираться?
Закажите расчёт у эксперта: он определит, нужен ли здесь бутстрап или хватит обычной формулы, посчитает и напишет готовый вывод. Останется вставить в работу.
Заказать расчёт у экспертаЧто такое бутстрап простыми словами
Представьте, что вы измерили задержку дыхания у пятнадцати студентов и посчитали медиану — 43,2 секунды. Вопрос, ради которого и нужен доверительный интервал, звучит так: а если бы вам попались другие пятнадцать студентов из того же вуза, насколько другой вышла бы медиана? Честный ответ можно было бы получить, повторив исследование сто раз на новых людях. Никто этого, разумеется, не делает.
Бутстрап предлагает замену. Он берёт ваши пятнадцать значений и вытаскивает из них новую выборку — тоже пятнадцать чисел, но «с возвращением»: каждое вытащенное значение возвращается обратно, поэтому один участник может попасть в новую выборку дважды или трижды, а другой не попасть ни разу. Это как складывать пятнадцать карточек в мешок, доставать одну, записывать число и класть карточку обратно — и так пятнадцать раз.
На такой перевыборке снова считается медиана. Потом всё повторяется — десять тысяч раз. Получается десять тысяч слегка разных медиан: где-то 41,1, где-то 44,8. Это облако и есть ответ на исходный вопрос: вот настолько результат зависит от того, кто именно попал в выборку. Границы интервала просто отсекают от облака края — по 2,5 % с каждой стороны, если уровень доверия 95 %.
Никакой формулы во всём этом нет, и в этом весь фокус. Метод не спрашивает, как распределён показатель, и ему безразлично, среднее вы считаете, медиану или коэффициент корреляции: перевыборка устроена одинаково для чего угодно. Придумал метод Брэдли Эфрон в 1979 году, название — от английского «bootstrap», вытащить себя за шнурки от ботинок: выборка сама себя и вытаскивает.
Когда бутстрап нужен вместо обычной формулы
Обычный интервал по формуле проще объяснить на защите, поэтому там, где он работает, его и берут. Бутстрап включают в четырёх случаях:
- Для показателя нет формулы вовсе. Медиана, разность медиан, стандартное отклонение, коэффициент вариации, размер эффекта, площадь под ROC-кривой — для всего этого аналитического интервала либо нет, либо он выведен при таких допущениях, которых ваши данные не выполняют.
- Распределение скошено или есть выбросы. Один спортсмен-разрядник среди студентов тянет среднее вверх, и симметричный интервал M ± Δ уезжает не туда. Бутстрап-интервал получается несимметричным ровно настолько, насколько несимметричны данные.
- Выборка маленькая, а нормальность не доказана. Критерий Шапиро-Уилка на пятнадцати наблюдениях почти ничего не отвергает, но это не доказательство нормальности, а лишь нехватка силы. Бутстрап от этого допущения не зависит.
- Шкала ограничена сверху или снизу. У процентов, долей и коэффициента корреляции формула охотно выдаёт границы вроде «103 %» или «r = 1,17». Процентильный и BCa-интервалы такого не дают физически: их границы взяты из самих перевыборок и потому всегда лежат в области возможных значений.
Три способа построить границы
Облако перевыборок одно, а отсечь от него границы можно по-разному. Калькулятор считает все три способа сразу и показывает их в одной таблице: если они близки — облако симметрично и выбор не важен, если разошлись — это сам по себе диагноз.
Процентильный способ проще всех: берутся 2,5-й и 97,5-й процентили облака. Его легче всего объяснить на защите — это буквально края облака. Базовый (его же называют отражённым) переворачивает процентильный вокруг точечной оценки. Он опирается на то, что распределение ошибки одинаково по обе стороны, и потому иногда вылезает за пределы шкалы: верхняя граница корреляции может выйти больше единицы, и это не ошибка калькулятора, а известный дефект метода.
BCa (bias-corrected and accelerated, Эфрон, 1987) — рекомендуемый вариант и то, что по умолчанию считает пакет boot в R. Он вносит две поправки. Первая, z₀, учитывает, что облако перевыборок может быть сдвинуто относительно точечной оценки. Вторая, ускорение a, учитывает, что разброс показателя сам зависит от величины показателя — у скошенных данных так почти всегда. В итоге BCa отсекает от облака не по 2,5 % с каждой стороны, а несимметрично: скажем, 0,6 % снизу и 6,1 % сверху. Именно поэтому его интервал попадает в заявленную надёжность там, где остальные два промахиваются.
Какой способ выбрать
| Способ | Когда брать | Слабое место |
|---|---|---|
| BCa | По умолчанию, особенно на скошенных данных и малых выборках | Требует не меньше 2000 перевыборок, иначе поправка упирается в край облака |
| Процентильный | Когда облако симметрично и нужно объяснить метод в двух словах | Промахивается по надёжности, если есть смещение |
| Базовый | Для сверки с учебником, где приведён именно он | Может выйти за пределы шкалы показателя |
Все три интервала строятся по одному и тому же облаку перевыборок — пересчитывать ничего не нужно, калькулятор показывает их рядом.
Как понять результат
Главное число — пара границ. Читается она так же, как у обычного доверительного интервала: если повторить исследование много раз и каждый раз строить такой интервал, примерно 95 % таких интервалов накроют истинное значение показателя в генеральной совокупности. Говорить «показатель с вероятностью 95 % лежит внутри» неверно: истинное значение не случайно, случаен интервал.
Для разностей и корреляции важно, накрывает ли интервал ноль. Если накрывает — нулевое значение остаётся правдоподобным, и различия (или связь) статистически не доказаны; это тот же вывод, что дал бы p > 0,05. Если не накрывает — результат значим, но вдобавок видно, насколько велик эффект, а это ровно то, о чём спрашивают на защите после «а различия достоверны?».
Рядом калькулятор показывает диагностику. Бутстрап-стандартная ошибка — прямой аналог m = σ/√n, только полученный не по формуле, а перебором. Смещение — насколько середина облака отошла от точечной оценки; ориентир простой: если оно больше четверти стандартной ошибки, процентильному интервалу верить не стоит, нужен BCa. Ширина интервала падает пропорционально корню из объёма выборки: чтобы уполовинить её, людей нужно вчетверо больше.
Число перевыборок на ширину интервала почти не влияет — оно влияет только на устойчивость самих границ. Десять тысяч перевыборок для дипломной работы более чем достаточно: дальше меняются четвёртые знаки. А вот зерно генератора случайных чисел указывать обязательно, иначе расчёт невоспроизводим.
Чем бутстрап нельзя заменить: он не добавляет данных
Самое частое заблуждение звучит так: «у меня было 15 человек, я сделал 10 000 перевыборок — теперь у меня 150 000 наблюдений, и выборка стала достаточной». Это неверно полностью. Перевыборка не добывает ни одного нового сведения о генеральной совокупности: программа тасует те же самые пятнадцать чисел, которые вы измерили. Если в выборку не попал ни один левша, никакие десять тысяч перевыборок левшу в ней не создадут.
Из этого следуют два практических правила. Первое: бутстрап не лечит нерепрезентативную выборку. Если вы опросили только отличников, бутстрап-интервал честно покажет разброс медианы среди отличников — и промахнётся мимо истинного значения по всему курсу, причём уверенно и с красивыми границами. Второе: бутстрап не спасает от слишком маленькой выборки. На семи-восьми наблюдениях он работает, но интервал получится настолько широким, что содержательного вывода из него не сделать, и это не дефект метода, а честный отчёт о том, сколько вы на самом деле знаете.
Ещё одно ограничение — зависимые наблюдения. Обычная перевыборка предполагает, что наблюдения независимы. Если у вас замеры «до и после» у одних и тех же людей, тасовать их по отдельности нельзя: связь между парами разрушится, и интервал выйдет ложно узким. В калькуляторе это учтено для коэффициента корреляции — там перевыбираются строки целиком, а не столбцы порознь. Для замеров «до / после» посчитайте сначала разность у каждого участника, а потом стройте интервал уже для одного столбца разностей.
Наконец, бутстрап не годится для показателей, которые зависят от крайних значений выборки: минимума, максимума, размаха. Перевыборка не может выдать значение больше вашего максимума, поэтому интервал для максимума получается заведомо смещённым. Для медианы, средних и корреляций такой проблемы нет.
Можно ли посчитать бутстрап в Excel
Формулами — нет. В Excel нет ни функции перевыборки, ни готового бутстрап-интервала, и «Анализ данных» такой процедуры не содержит. Всё, что есть, — генератор случайных чисел, и на нём метод собирают вручную.
Схема выглядит так: функция СЛУЧМЕЖДУ(1; n) даёт номер строки, ИНДЕКС достаёт по этому номеру значение из вашего столбца — так получается одна перевыборка. Рядом считается нужный показатель, и вся конструкция копируется вниз на тысячи строк. Потом по столбцу показателей берутся ПРОЦЕНТИЛЬ.ВКЛ(диапазон; 0,025) и ПРОЦЕНТИЛЬ.ВКЛ(диапазон; 0,975) — это и есть процентильный интервал.
На практике так почти никто не делает, и вот почему. Файл на десять тысяч перевыборок при пятнадцати наблюдениях — это 150 000 формул, Excel начинает заметно тормозить. Результат пересчитывается при каждом изменении листа, потому что СЛУЧМЕЖДУ — волатильная функция: цифры в дипломе меняются сами собой, зафиксировать их можно только копированием со «специальной вставкой» значений. Зерно генератора в Excel задать нельзя вовсе, а значит, расчёт невоспроизводим — повторить ваши границы не сможет ни рецензент, ни вы сами. И главное: BCa в Excel не собрать разумными усилиями, а именно он рекомендован авторами метода.
Поэтому бутстрап считают либо в R (пакет boot, функции boot и boot.ci), либо в Python (scipy.stats.bootstrap), либо в этом калькуляторе — здесь зерно задаётся явно и печатается в отчёте, так что расчёт повторяется до последней цифры.
Как оформить результат в дипломе
В работе обязательно указывают четыре вещи, которых нет у обычного интервала: что применялся бутстрап, сколько сделано перевыборок, какое взято зерно генератора и каким способом построены границы. Без числа перевыборок и зерна расчёт невоспроизводим — это первое, к чему придирается дотошный рецензент. И отдельной фразой объясняют, почему выбран бутстрап, а не формула: «распределение отличается от нормального» или «аналитической формулы интервала для медианы не существует».
Готовая формулировка: «Доверительный интервал медианы построен методом бутстрапа (перевыборка с возвращением, 10 000 перевыборок, зерно генератора 2026, способ построения границ — BCa), поскольку аналитической формулы доверительного интервала для медианы не существует. Точечная оценка Me = 43,2 с, границы 95 % доверительного интервала: от 40,2 до 45,1 с (бутстрап-стандартная ошибка 1,59 с). Ширина интервала характеризует точность оценки при данном объёме выборки».
На рисунке бутстрап-интервал показывают так же, как обычный: столбцами с планками погрешностей. Для двух групп рисуют не разность, а сами группы, каждую со своим интервалом, — так читателю видно, перекрываются интервалы или нет. Для корреляции в работу идёт диаграмма рассеяния. Калькулятор отдаёт таблицу и рисунок прямо в файле Word, диаграмма остаётся редактируемой.
В таблице результатов приводят точечную оценку, обе границы и ширину интервала. Полезно вынести туда же все три способа построения границ: если они близки, это лишний аргумент в пользу устойчивости результата, и на защите такую таблицу оценят.