StatBlank
← Все методы

Логистическая регрессия — онлайн-калькулятор

Логистическая регрессия предсказывает вероятность бинарного исхода — да/нет, сдал/не сдал, болен/здоров — по одному или нескольким числовым признакам. В отличие от линейной регрессии здесь предсказывается не число, а вероятность события. Зависимая переменная Y должна быть закодирована как 0 и 1. Введите предикторы и исход ниже — калькулятор посчитает коэффициенты β и отношения шансов exp(β).

Предсказывает вероятность бинарного исхода (да/нет, сдал/не сдал, болен/здоров) по одному-двум числовым признакам. Зависимая переменная Y должна быть закодирована как 0 и 1. Для каждого предиктора выдаёт отношение шансов exp(β).

По одному значению в строке. i-я строка каждого X соответствует i-й строке Y. В Y должны быть только 0 и 1. Дробные предикторы — через запятую.

Когда применять логистическую регрессию

Она нужна, когда результат — это два взаимоисключающих исхода, а предсказывающие факторы числовые. Примеры из дипломов:

  • Предсказать, сдаст студент норматив (1) или нет (0), по числу тренировок.
  • Оценить, как возраст и стаж влияют на вероятность травмы (есть / нет).
  • Если исход — число (балл, время), а не да/нет, берите линейную регрессию.

Зачем Y кодируют как 0 и 1

Логистическая регрессия работает только с бинарным исходом, записанным двумя кодами: 0 — событие не наступило, 1 — наступило. Например, «здоров» = 0, «болен» = 1.

В столбце Y должны присутствовать оба значения — и нули, и единицы, иначе модель построить нельзя. Никаких других чисел (2, 3, «низкий/средний/высокий») быть не должно.

Отношение шансов exp(β) — главный результат

Сами коэффициенты β в логистической регрессии трудно интерпретировать напрямую. Поэтому их переводят в отношение шансов exp(β) — во сколько раз меняются шансы исхода при росте предиктора на единицу.

exp(β) = 1 — фактор не влияет; больше 1 — повышает шансы события; меньше 1 — снижает. Например, exp(β) = 2 означает, что при увеличении фактора на единицу шансы наступления события удваиваются.

Сходимость метода и объём данных

Коэффициенты подбираются итеративным методом максимального правдоподобия. Обычно он быстро сходится, и калькулятор пишет «сходимость достигнута».

Если метод не сошёлся, данные, скорее всего, полностью разделяются (один предиктор идеально предсказывает исход) или наблюдений слишком мало. Результат тогда ненадёжен — нужна большая выборка. Для устойчивой оценки желательно хотя бы 10 наблюдений каждого исхода на предиктор.

Частые вопросы

Связанные методы