Критерий тренда Кохрана-Армитажа — онлайн-калькулятор
Критерий тренда Кохрана-Армитажа проверяет не «различия вообще», а направленный рост: становится ли признак чаще по мере роста фактора. Растёт ли доля травмированных с увеличением стажа занятий, увеличивается ли доля успевающих от курса к курсу, зависит ли доля осложнений от дозы. Обычный хи-квадрат на таких данных отвечает лишь «доли по группам различаются или нет» и порядок уровней не использует вовсе. Впишите частоты «есть признак / нет признака» по каждому уровню, задайте веса уровней — и калькулятор посчитает Z, χ² тренда, p-уровень, наклон линии и напишет готовую фразу для диплома.
Обычный хи-квадрат отвечает «различия есть», критерий тренда — «есть ли направленный рост»
Вам сюда: уровни фактора упорядочены
Стаж занятий, курс, доза, возрастная группа, квалификация — у таких уровней есть естественный порядок, и вопрос стоит так: «доля растёт ПО МЕРЕ роста фактора?». Растёт ли доля травмированных с ростом стажа, увеличивается ли доля успевающих от курса к курсу, зависит ли доля осложнений от дозы.
Вам не сюда: порядка у групп нет
Если группы неупорядочены (факультеты, виды спорта, юноши и девушки), «расти» доле не по чему — берите χ² по таблице сопряжённости. Если признак не «да/нет», а балл, и групп три и больше — это критерий Джонкира, тоже критерий тренда, но для числового показателя. А сравнение одного распределения с эталоном — это критерий согласия.
Строка — уровень фактора, а не человекУровни идут ПО ПОРЯДКУ, от меньшего к большему: стаж «до года / 2–3 года / 4–5 лет / 6 и более», курс с первого по четвёртый, доза от малой к большой. Строк столько, сколько уровней, а не сколько участников. Порядок строк — часть данных: если переставить их местами, критерий даст другой ответ (в отличие от обычного хи-квадрата).
Столбцы — «есть признак» и «нет признака»Признак дихотомический: травма была или не было, норматив сдан или нет, уровень высокий или не высокий. В левой клетке — сколько человек на этом уровне С признаком, в правой — сколько БЕЗ него. Сумма двух клеток равна числу обследованных на уровне. Проценты вписывать нельзя: критерий построен на количествах.
Таблица заполнена примером
Чтобы вы посмотрели, как работает калькулятор. Это спортивный травматизм у 116 занимающихся, разбитых по стажу тренировок: доля травмированных за сезон растёт с 15,6 % у новичков до 38,5 % у тех, кто занимается шестой год и дольше. Веса уровней — середины интервалов стажа в годах (1; 2,5; 4,5; 7), а не номера строк по порядку. О самом делении на группы по стажу и квалификации — в статье «Сравнение спортсменов по квалификации». На этих данных обычный хи-квадрат различий не находит (p = 0,17), а критерий тренда находит (p = 0,032) — ради этого он и нужен.
| Уровень фактора | ||
|---|---|---|
Названия можно переписать — они попадут в результат и в таблицу для диплома. Если столбцов много, таблица прокручивается вбок. Данные из Excel вставляются целиком: скопируйте диапазон и вставьте в первую ячейку.
Вес — это значение фактора, а не номер строки. По умолчанию 1, 2, 3… — так предполагается, что шаги между уровнями одинаковые. Если это не так («до 1 года», «2–3 года», «4–5 лет», «6 и более»), возьмите середины интервалов: 1; 2,5; 4,5; 7. Для дозы впишите саму дозу, для курса — номер курса. Сдвиг и растяжение шкалы результат не меняют: 1, 2, 3, 4 и 0, 1, 2, 3 и 2, 4, 6, 8 дают одно и то же значение критерия — важны только отношения расстояний между уровнями. Веса выбирают до расчёта и указывают в работе: подбирать их так, чтобы p стал поменьше, — та же ошибка, что подгонка уровня значимости.
Уровень значимости — это допустимая вероятность ошибиться, признав рост доли там, где его на самом деле нет. При α = 0,05 такая ошибка допускается не чаще чем в пяти случаях из ста. Для педагогических и психологических исследований этого почти всегда достаточно. От выбранного уровня зависит критическое значение: 1,960 для 0,05, 2,576 для 0,01 и 3,291 для 0,001. Выбирают уровень до расчёта, а не подгоняют под результат — это грубая ошибка, которую замечают на защите. Подробнее: что такое p-значение и ось значимости.
Ничего не понятно или не хотите разбираться?
Закажите расчёт у эксперта: он определит, упорядочен ли ваш фактор, подберёт веса уровней, посчитает и напишет готовый вывод. Останется вставить в работу.
Заказать расчёт у экспертаЧем критерий тренда отличается от обычного хи-квадрата
Оба метода работают с одной и той же таблицей: уровни фактора по строкам, «есть признак / нет признака» по столбцам. Разница в вопросе и в том, используется ли ПОРЯДОК уровней.
Обычный критерий χ² (страница /calc/hi-kvadrat) отвечает на вопрос «доли по группам вообще различаются?». Порядок строк для него не существует: переставьте уровни местами — значение критерия не изменится ни на сотую. Число степеней свободы у него k − 1, где k — число уровней, и вся эта «мощность» размазана по любым мыслимым различиям.
Критерий тренда отвечает на более узкий вопрос: «доля растёт (или падает) ПО МЕРЕ роста фактора?». Порядок уровней для него — часть данных, а вся проверка сводится к одной степени свободы: наклон линии отличается от нуля или нет. Проверять одну гипотезу одной степенью свободы выгоднее, чем много гипотез сразу, — поэтому там, где порядок уровней осмыслен, тренд заметно мощнее.
Практически это выглядит так. На пограничных данных обычный χ² часто не даёт значимости (p = 0,17), а критерий тренда даёт (p = 0,03) — именно такой пример стоит в форме калькулятора по умолчанию. Это не противоречие и не подгонка: критерии проверяют разные гипотезы. Обратное тоже случается: если доля растёт, а потом падает («горб»), тренда нет, а различия есть — и тогда честен именно обычный χ².
Единственное условие честности — упорядоченность фактора и веса уровней задуманы ДО расчёта, а не выбраны после того, как обычный хи-квадрат «не сошёлся». Порядок должен быть содержательным: стаж, курс, доза, возрастная группа, квалификация. Для факультетов и видов спорта никакого порядка нет, и критерий тренда там неприменим.
Обычный χ² и критерий тренда: чем различаются
| Критерий тренда (эта страница) | Обычный χ² (/calc/hi-kvadrat) | |
|---|---|---|
| Вопрос | «Доля растёт по мере роста фактора?» | «Доли по группам различаются?» |
| Порядок уровней | Часть данных, влияет на результат | Не используется вовсе |
| Степени свободы | 1 (всегда) | k − 1 |
| Нужны веса уровней | Да: числовая шкала фактора | Нет |
| Мощность | Выше, когда рост направленный | Выше, когда зависимость с перегибом |
| Что на выходе | Z со знаком, наклон в п. п. | χ², сила связи V Крамера |
Оба критерия считаются на одной и той же таблице, поэтому калькулятор показывает их рядом: так видно, какой из них на ваших данных сильнее и почему.
Когда применять критерий тренда
Метод нужен там, где есть упорядоченный фактор, дихотомический признак («да / нет») и содержательная гипотеза о направлении:
- Растёт ли доля травмированных с увеличением стажа занятий или спортивной квалификации.
- Увеличивается ли доля студентов, сдавших норматив, от первого курса к четвёртому.
- Зависит ли доля осложнений или побочных реакций от дозы нагрузки.
- Чаще ли встречается высокий уровень тревожности в старших возрастных группах.
- Снижается ли доля ошибок в технике по мере роста числа тренировочных занятий.
- Важно: признак должен быть «да / нет». Если у вас балл по методике и три и больше упорядоченных групп — это критерий Джонкира, страница /calc/kriteriy-dzhonkira. Если групп две — z-критерий для долей. Если порядка у групп нет — обычный χ².
Веса уровней — главная настройка метода
Вес уровня (в англоязычной литературе score) — это числовая шкала фактора, а не номер строки. По умолчанию берут 1, 2, 3…, и за этим стоит молчаливое допущение: шаги между уровнями одинаковые. Часто это неправда. Уровни «до 1 года», «2–3 года», «4–5 лет», «6 и более» разделены разными промежутками, и честнее взять середины интервалов: 1; 2,5; 4,5; 7.
Веса влияют на результат, поэтому их выбирают до расчёта и обязательно указывают в работе. Подбирать шкалу так, чтобы p стал поменьше, — та же грубая ошибка, что подгонка уровня значимости под результат, и на защите её замечают.
Хорошая новость: критерий инвариантен к сдвигу и растяжению шкалы. Веса 1, 2, 3, 4 и 0, 1, 2, 3 и 2, 4, 6, 8 дают одно и то же значение Z до последнего знака — значение имеют только отношения расстояний между уровнями. Поэтому спорить, начинать нумерацию с нуля или с единицы, бессмысленно.
Переворот порядка уровней меняет знак Z на противоположный, но двусторонний p-уровень остаётся прежним. Знак — это направление: плюс означает «доля растёт вместе с фактором», минус — «снижается».
Как выбрать веса уровней
| Фактор в работе | Разумные веса | Почему |
|---|---|---|
| Курс: 1, 2, 3, 4 | 1; 2; 3; 4 | шаги действительно равные |
| Стаж: до года, 2–3, 4–5, 6+ | 1; 2,5; 4,5; 7 | середины интервалов, шаги разные |
| Доза: 0, 5, 10, 20 мг | 0; 5; 10; 20 | сам фактор уже число |
| Квалификация: без разряда, II, I, КМС | 1; 2; 3; 4 | порядок есть, расстояний не знаем |
| Возраст: 7–9, 10–12, 13–15 лет | 8; 11; 14 | середины возрастных интервалов |
Если о расстояниях между уровнями ничего не известно, порядковые веса 1, 2, 3… — общепринятый и наименее спорный выбор.
Как понять результат
Главное число — p-уровень. Если p < 0,05, направленное изменение доли статистически значимо: его нельзя списать на случайность. Если p > 0,05, значимого тренда нет — и это тоже полноценный результат, его так и описывают.
Эмпирическое Z сравнивают с критическим: 1,960 при α = 0,05, 2,576 при 0,01 и 3,291 при 0,001. Правило прямое: тренд значим, когда |Z| БОЛЬШЕ критического. У критериев Манна-Уитни и Вилкоксона правило перевёрнутое, и на этом сбиваются чаще всего. Тот же результат часто печатают как χ² тренда — это просто Z в квадрате, всегда с одной степенью свободы; в SPSS он выводится строкой «Linear-by-Linear Association».
Содержательное число — наклон линии тренда: на сколько процентных пунктов меняется доля при увеличении фактора на единицу шкалы. Именно его пишут в выводе («доля растёт примерно на 4 п. п. за год стажа»), потому что само по себе Z ни о чём не говорит читателю.
Размер эффекта r = Z / √N — корреляция между шкалой фактора и наличием признака. Он нужен потому, что Z растёт вместе с объёмом выборки: на тысяче человек значимым становится почти любой наклон, а содержательно он может быть ничтожным.
Размер эффекта r (шкала Коэна)
| Значение |r| | Как трактовать |
|---|---|
| меньше 0,1 | эффект пренебрежимо мал |
| 0,1 — 0,3 | слабый эффект |
| 0,3 — 0,5 | средний эффект |
| 0,5 и больше | сильный эффект |
r = Z / √N, откуда χ² тренда = N · r². В отличие от самого Z, размер эффекта не зависит от объёма выборки, поэтому в дипломе его приводят рядом с p-уровнем.
Разложение χ²: тренд и отклонение от линейности
Общий χ² таблицы (без поправки Йейтса, df = k − 1) раскладывается ровно на два слагаемых: χ²общ = χ²тренда + χ²отклонения, где у тренда одна степень свободы, а у отклонения k − 2. Это тождество, а не приближение — суммы обязаны сойтись до последнего знака, и калькулятор показывает всю раскладку таблицей.
Первое слагаемое — то, что объясняется прямой линией по упорядоченному фактору. Второе — всё остальное: перегибы, скачки на отдельных уровнях, «горбы». Смотреть надо на оба.
Если отклонение от линейности незначимо, прямая описывает данные хорошо, и фразу «доля равномерно растёт» писать можно. Если значимо — зависимость есть, но она не линейная: доля растёт, а потом падает, или скачком меняется на одном уровне. Тогда о равномерном росте писать нельзя: описывают форму зависимости словами и при необходимости сравнивают уровни попарно.
Разложение полезно и как проверка себя: если тренд забрал почти весь общий χ², значит порядок уровней действительно объясняет данные, и выбор метода оправдан. Если тренд забрал малую долю, а общий χ² велик — различия есть, но они не направленные, и в работу идёт обычный хи-квадрат.
Как читать разложение
| Тренд | Отклонение от линейности | Что писать в работе |
|---|---|---|
| значим | незначимо | доля равномерно растёт (или снижается) с ростом фактора |
| значим | значимо | изменение направленное, но неравномерное — описать форму |
| незначим | значимо | различия есть, но не направленные — брать обычный χ² |
| незначим | незначимо | доля от уровня фактора не зависит |
Условия применимости и частые ошибки
Критерий опирается на нормальное приближение для одной суммы по всей таблице, поэтому к отдельным малым клеткам он устойчивее обычного χ². Ориентир простой: наблюдений с признаком и без признака должно быть не меньше пяти в целом по выборке, а ожидаемые частоты — не ниже единицы. Если это не так, объединяют соседние уровни или набирают больше данных.
Уровней должно быть не меньше трёх. Формально критерий считается и на двух, но тренда там нет: через две точки прямая проходит всегда, и статистика в точности совпадает с z-критерием для двух долей — привычнее взять его.
Самая частая ошибка — применить метод к неупорядоченному фактору. Факультеты, виды спорта, типы темперамента порядка не имеют, и «рост доли» по ним бессмыслен, каким бы значимым ни вышло Z. Вторая ошибка — молча оставить веса по умолчанию там, где шаги между уровнями заведомо разные. Третья — трактовать значимый тренд как доказанную причину: это связь, а не влияние.
Как оформить результат в дипломе
В работе приводят: объём выборки, число уровней и их названия, веса уровней с обоснованием, доли признака по уровням, эмпирическое и критическое Z, χ² тренда со степенью свободы, p-уровень, размер эффекта и наклон линии в процентных пунктах. Отдельной фразой — результат проверки отклонения от линейности.
Готовая формулировка: «Для проверки направленного изменения доли признака по уровням фактора применён критерий тренда Кохрана-Армитажа (k = 4 уровня, N = 116; веса уровней 1; 2,5; 4,5; 7 — середины интервалов стажа). Доля травмированных составила 15,6 % при стаже до одного года и 38,5 % при стаже шесть лет и более. Тренд статистически значим: Zэмп = 2,146 при Zкр = 1,960 (α = 0,05), χ²тренда = 4,606 при df = 1, p = 0,032; размер эффекта r = 0,20 — слабый. Доля травмированных закономерно возрастает с ростом стажа — в среднем на 4,00 процентного пункта на год. Отклонение от линейности незначимо (χ² = 0,423, df = 2, p = 0,809), то есть линейная модель тренда правомерна. Для сравнения: обычный критерий χ², не учитывающий порядок уровней, даёт χ² = 5,029 при df = 3, p = 0,170».
Рисунок к этому абзацу — доли по уровням в процентах со столбцами наблюдаемых и «трендовых» значений. Проценты, а не «сколько человек»: уровни обычно разного объёма. Калькулятор выгружает три таблицы (доли по уровням, результаты критерия, разложение χ²) и диаграмму в файл Word, где всё редактируется под требования кафедры.