Логистическая регрессия — онлайн-калькулятор
Логистическая регрессия предсказывает вероятность бинарного исхода — да/нет, сдал/не сдал, болен/здоров — по одному или нескольким числовым признакам. В отличие от линейной регрессии здесь предсказывается не число, а вероятность события. Зависимая переменная Y должна быть закодирована как 0 и 1. Введите предикторы и исход ниже — калькулятор посчитает коэффициенты β и отношения шансов exp(β).
Предсказывает вероятность бинарного исхода (да/нет, сдал/не сдал, болен/здоров) по одному-двум числовым признакам. Зависимая переменная Y должна быть закодирована как 0 и 1. Для каждого предиктора выдаёт отношение шансов exp(β).
По одному значению в строке. i-я строка каждого X соответствует i-й строке Y. В Y должны быть только 0 и 1. Дробные предикторы — через запятую.
Когда применять логистическую регрессию
Она нужна, когда результат — это два взаимоисключающих исхода, а предсказывающие факторы числовые. Примеры из дипломов:
- Предсказать, сдаст студент норматив (1) или нет (0), по числу тренировок.
- Оценить, как возраст и стаж влияют на вероятность травмы (есть / нет).
- Если исход — число (балл, время), а не да/нет, берите линейную регрессию.
Зачем Y кодируют как 0 и 1
Логистическая регрессия работает только с бинарным исходом, записанным двумя кодами: 0 — событие не наступило, 1 — наступило. Например, «здоров» = 0, «болен» = 1.
В столбце Y должны присутствовать оба значения — и нули, и единицы, иначе модель построить нельзя. Никаких других чисел (2, 3, «низкий/средний/высокий») быть не должно.
Отношение шансов exp(β) — главный результат
Сами коэффициенты β в логистической регрессии трудно интерпретировать напрямую. Поэтому их переводят в отношение шансов exp(β) — во сколько раз меняются шансы исхода при росте предиктора на единицу.
exp(β) = 1 — фактор не влияет; больше 1 — повышает шансы события; меньше 1 — снижает. Например, exp(β) = 2 означает, что при увеличении фактора на единицу шансы наступления события удваиваются.
Сходимость метода и объём данных
Коэффициенты подбираются итеративным методом максимального правдоподобия. Обычно он быстро сходится, и калькулятор пишет «сходимость достигнута».
Если метод не сошёлся, данные, скорее всего, полностью разделяются (один предиктор идеально предсказывает исход) или наблюдений слишком мало. Результат тогда ненадёжен — нужна большая выборка. Для устойчивой оценки желательно хотя бы 10 наблюдений каждого исхода на предиктор.