ROC-кривая и AUC: оценка диагностической точности методики
Как оценить точность теста или методики через ROC-кривую и площадь под ней (AUC): что значат чувствительность и специфичность, пороги AUC, выбор точки отсечения и фраза для диплома. С примерами и FAQ.
Вы разработали тест, шкалу или методику, которая должна отделять «больных» от «здоровых», «успешных» от «неуспешных», «группу риска» от нормы. Возникает вопрос: а насколько хорошо она это делает?
ROC-кривая и площадь под ней (AUC) — стандартный способ ответить. Они показывают, умеет ли ваша методика различать две группы, и помогают выбрать порог, по которому ставить «диагноз».
В двух словах
ROC-кривая — это график, который показывает, как меняется качество разделения двух групп при движении порога отсечения от строгого к мягкому. AUC (area under curve, площадь под кривой) — одно число от 0,5 до 1,0, которое сворачивает всю кривую в оценку точности: чем ближе к 1, тем лучше методика отличает одну группу от другой.
AUC = 0,5 — методика бесполезна (как подбрасывание монеты), AUC = 1,0 — идеальное разделение. На практике хороший прикладной тест даёт 0,7–0,9.
Считается ROC по двум столбцам: значение методики у каждого человека и его реальная принадлежность к группе (0 или 1). Связанные темы — чувствительность и специфичность, хи-квадрат для таблиц 2×2 и точечно-бисериальная корреляция.
Когда нужна ROC-кривая
ROC-анализ уместен, когда у вас есть количественная (или порядковая) методика и бинарный «золотой стандарт» — известная правильная классификация.
- Диагностический тест. Опросник тревожности (балл 0–60) и клинический диагноз «есть расстройство / нет». ROC покажет, с какого балла разумно бить тревогу.
- Прогностическая шкала. Тест физической готовности и факт «сдал / не сдал норматив». ROC оценит, предсказывает ли тест результат.
- Отбор / скрининг. Методика профотбора и реальная успешность сотрудника через год.
Пример. Вы измерили уровень выгорания у 80 педагогов (шкала 0–100) и отдельно знаете, кто из них уволился за год (1) и кто остался (0). ROC-кривая покажет, отличает ли шкала выгорания будущих «увольняющихся», и подскажет порог балла для группы риска.
Для ROC обязательно нужен внешний критерий истины — реальная принадлежность к группе. Если у вас только баллы методики и больше ничего, ROC построить не из чего: разделять не на что.
Когда ROC не подходит
- Сравниваете две группы по среднему. Если задача — «отличается ли группа А от группы Б», это критерий Стьюдента или Манна-Уитни, а не ROC.
- Исход не бинарный. Три и более группы или непрерывный исход — ROC в классическом виде не строится (нужны расширения).
- Очень маленькая выборка. На 10–15 наблюдениях AUC «прыгает» и доверительный интервал огромен — выводы ненадёжны.
Частая ошибка — строить ROC там, где нет «золотого стандарта», и называть им сам же тестовый балл. Тогда AUC получается искусственно близким к 1, потому что методику сравнивают саму с собой.
Чувствительность и специфичность: из чего собрана кривая
Чтобы понять ROC, нужно два понятия. Зафиксируем какой-то порог отсечения и посмотрим, кого методика поймала верно.
Чувствительность (sensitivity) — доля реально «больных», которых тест правильно отметил как «больных». Высокая чувствительность = тест мало кого пропускает.
Специфичность (specificity) — доля реально «здоровых», которых тест правильно отметил как «здоровых». Высокая специфичность = тест мало кого ложно обвиняет.
ROC-кривая строится так: берём все возможные пороги по очереди и для каждого считаем пару (чувствительность; 1 − специфичность). По вертикали откладывают чувствительность, по горизонтали — долю ложных тревог. Соединённые точки и дают кривую.
Чем сильнее кривая «прижимается» к левому верхнему углу, тем больше площадь под ней — и тем лучше методика. Диагональ из угла в угол — это случайное угадывание.
AUC: пороги и интерпретация
AUC сворачивает всю кривую в одно число. Содержательно AUC — это вероятность того, что случайно взятый «больной» получит по методике балл выше, чем случайно взятый «здоровый». Общепринятые ориентиры приведены в таблице 1.
Таблица 1 — Интерпретация площади под ROC-кривой (AUC)
| AUC | Качество разделения | Что писать в выводах |
|---|---|---|
| 0,90–1,00 | отличное | методика отлично различает группы |
| 0,80–0,90 | хорошее | методика хорошо различает группы |
| 0,70–0,80 | приемлемое | методика приемлемо различает группы |
| 0,60–0,70 | слабое | разделение слабое, на грани полезности |
| 0,50–0,60 | практически бесполезное | методика почти не отличает группы |
Как читать таблицу: AUC = 0,84 — это «хорошее» разделение, такую методику уже можно рекомендовать к применению. А вот AUC = 0,62 честнее описать как слабую: формально лучше монетки, но опираться на неё в реальных решениях рискованно.
AUC всегда дополняйте доверительным интервалом. AUC = 0,80 с интервалом [0,78; 0,82] — это надёжный результат, а тот же 0,80 с интервалом [0,58; 0,99] на маленькой выборке почти ни о чём не говорит: нижняя граница уходит в «бесполезно».
Как выбрать точку отсечения (порог)
ROC отвечает не только «хороша ли методика», но и «какой балл считать границей». Универсального правила нет — выбор зависит от цены ошибки.
Максимум индекса Юдена. Самый частый способ: ищут порог, где сумма (чувствительность + специфичность − 1) максимальна. Это точка кривой, наиболее удалённая от диагонали — баланс между пропусками и ложными тревогами.
Приоритет чувствительности. Если пропустить «больного» опаснее, чем перестраховаться (скрининг тяжёлых состояний), порог сдвигают так, чтобы поймать почти всех, мирясь с ложными тревогами.
Приоритет специфичности. Если ложное обвинение дорого (отказ в приёме, дорогая процедура), порог делают строгим.
В дипломе укажите не только сам порог, но и логику его выбора: «оптимальная точка отсечения по индексу Юдена составила 42 балла (чувствительность 0,81, специфичность 0,76)». Это показывает, что вы понимаете, что делаете, а не взяли число с потолка.
Что писать в дипломе
Готовые формулировки под результаты:
«Для оценки диагностической точности методики построена ROC-кривая. Площадь под кривой составила AUC = 0,84 (95% ДИ [0,76; 0,92]; p < 0,001), что соответствует хорошему качеству разделения групп.»
«Оптимальная точка отсечения определена по индексу Юдена и составила 42 балла. При данном пороге чувствительность методики равна 0,81, специфичность — 0,76.»
«Таким образом, методика приемлемо дифференцирует испытуемых группы риска от нормы и может применяться как скрининговый инструмент.»
Если результат слабый, не маскируйте: «AUC = 0,63 (95% ДИ [0,52; 0,74]) свидетельствует о слабой диагностической способности методики; её самостоятельное применение для классификации не рекомендуется».
Частые ошибки
- Нет золотого стандарта. ROC строят без внешнего критерия истины, выдавая за него сам тестовый балл — результат бессмыслен.
- AUC без доверительного интервала и p. Голое число 0,80 не показывает, отличается ли оно от 0,5 значимо.
- Порог «на глаз». Точку отсечения берут произвольно, без индекса Юдена или иной обоснованной логики.
- ROC на трёх группах. Классическая кривая — только для двух групп; для нескольких нужны отдельные методы.
- Маленькая выборка. На 10–15 наблюдениях AUC и порог нестабильны, выводы ненадёжны.
- Путают AUC и точность (accuracy). Это разные показатели: точность считается при одном фиксированном пороге, AUC — по всем сразу.
Частые вопросы
Чем AUC отличается от обычной точности (accuracy)?
Точность (accuracy) — доля верных классификаций при одном выбранном пороге, и она сильно зависит от баланса групп. AUC не привязана к конкретному порогу: она оценивает методику сразу по всем возможным точкам отсечения, поэтому устойчивее и информативнее как общая характеристика.
Может ли AUC быть меньше 0,5?
Формально да, но это значит, что методика «работает наоборот»: высокий балл чаще у здоровых, чем у больных. На практике в таком случае просто меняют направление шкалы (инвертируют), и AUC становится больше 0,5. AUC ниже 0,5 — почти всегда сигнал ошибки в кодировке групп.
Какая выборка нужна для надёжной ROC?
Жёсткого минимума нет, но ориентируйтесь на десятки наблюдений в каждой из двух групп. Чем меньше выборка, тем шире доверительный интервал AUC. На 15–20 испытуемых результат стоит подавать осторожно и обязательно с ДИ.
Как сравнить две методики по ROC?
Строят обе кривые на одних и тех же людях и сравнивают их AUC специальным тестом (например, методом ДеЛонга). Просто «у первой 0,82, у второй 0,79, значит первая лучше» — недостаточно: разница может быть случайной, нужна проверка значимости.
Короткий алгоритм
- Подготовьте два столбца: значение методики и реальную группу (0/1) для каждого человека.
- Постройте ROC-кривую и получите AUC с доверительным интервалом и p.
- Сверьте AUC с порогами из таблицы 1 и сделайте вывод о качестве разделения.
- Выберите точку отсечения (обычно по индексу Юдена), выпишите чувствительность и специфичность.
- Запишите результат в диплом готовой формулировкой — с AUC, ДИ и порогом.
Что ещё почитать
- Хи-квадрат для таблиц 2×2 — связь категориального теста и реального исхода.
- Точечно-бисериальная корреляция — связь шкалы с бинарным признаком.
- Точный критерий Фишера — когда групп мало и таблица 2×2 с малыми частотами.
- Что такое p-value — чтобы корректно прочитать значимость AUC.
Не уверены, подходит ли ROC под вашу задачу и как обосновать порог? Загляните в базу методов или возьмите консультацию — поможем подобрать корректный анализ.
Не хотите разбираться со статистикой сами?
Эксперт подберёт метод, посчитает и оформит таблицы по ГОСТ под вашу тему.