StatBlank
Руководства2 августа 2026·17 мин чтения

T-критерий Крамера-Уэлча: формула, пример расчёта и таблица

Разбор T-критерия Крамера-Уэлча: формула Новикова, критические значения 1,96 и 2,58, пример расчёта педагогического эксперимента и чем он отличается от Стьюдента.

Андрей Лазарев
Андрей Лазарев
Эксперт по математической статистике, создатель StatBlank

T-критерий Крамера-Уэлча — самый короткий путь сравнить две группы по средним. Нужны три числа на группу: объём, среднее и дисперсия. Критическое значение при этом всегда одно и то же — 1,96.

За простоту приходится платить. Критерий опирается на нормальное приближение, и при объёмах меньше 30 человек он начинает находить различия там, где строгий расчёт их не признаёт. Разберём формулу, посчитаем пример и покажем, где критерий обманывает.

🧮Онлайн-калькулятор критерия Крамера-УэлчаПосчитайте свои данные за пару минут — нажмите, чтобы открыть

В двух словах

Крамера-Уэлча сравнивает средние двух независимых групп и не требует, чтобы разброс в них совпадал. Эмпирическое T сравнивают с постоянным числом: 1,96 при уровне 0,05, 2,58 при 0,01, 3,29 при 0,001. Больше — различия значимы.

Берите Крамера-Уэлча, если групп две, данные числовые, в каждой группе от 30 человек, а разброс в контрольной и экспериментальной заметно разный. Если хоть одна группа меньше 30 — считайте критерием Стьюдента в варианте Уэлча: он учитывает объём выборки, а Крамера-Уэлча — нет.

Что считает критерий

Формула в записи Д. А. Новикова («Статистические методы в педагогических исследованиях», 2004) — та, что печатают в вузовских методичках:

T = √(N · M) · |x̄ − ȳ| / √(M · Dx + N · Dy)

где N и M — объёмы групп, x̄ и ȳ — средние, Dx и Dy — выборочные дисперсии с делителем n − 1.

Та же величина в более удобной записи — через ошибки средних:

T = |M₁ − M₂| / √(D₁/n₁ + D₂/n₂)

Формулы тождественны, на нашем примере они разошлись в четырнадцатом знаке после запятой. Во второй сразу видно, что критерий делит разницу средних на её собственную погрешность.

Главное — в знаменателе каждая дисперсия делится на свой объём. Классический Стьюдент вместо этого усредняет их в одну «общую» и потому требует, чтобы разброс в группах был примерно одинаковым. Крамера-Уэлча такого требования не предъявляет.

M = 74,1 · SD = 6,2 M ± SD ЭГ (n = 32) M = 66,0 · SD = 13,4 M ± SD КГ (n = 30) 40 50 60 70 80 90 баллы
Данные разобранного ниже примера: серая полоса — весь размах группы, цветная — M ± SD. Дисперсия контрольной группы в 4,7 раза больше
Заметка

Разный разброс в группах — не редкость, а норма педагогического эксперимента. Обучение подтягивает отстающих, поэтому в экспериментальной группе значения сжимаются, а в контрольной остаются растянутыми. Именно из-за этого критерий Крамера-Уэлча в педагогике встречается чаще Стьюдента.

Когда брать Крамера-Уэлча

Условий четыре, и выполнены они должны быть все.

  • Групп ровно две и они независимые — разные люди в контрольной и экспериментальной, юноши и девушки, две школы. Замеры «до и после» сюда не годятся.
  • Признак измерен в числах — баллы теста, секунды, сантиметры, количество ошибок. Для рангов и мест надёжнее критерий Манна-Уитни.
  • В каждой группе не меньше 30 наблюдений — нормальное приближение начинает работать примерно с трёх десятков человек.
  • Проверять нормальность и равенство дисперсий не нужно — ни Шапиро-Уилк, ни тест Левена перед расчётом не требуются.

Пример. В ВКР по педагогике проверяли методику обучения решению текстовых задач. Итоговое тестирование по 100-балльной шкале: экспериментальная группа — 32 семиклассника, контрольная — 30. Разброс в контрольной явно шире. Условия выполнены — считаем T.

Когда брать критерий Стьюдента

Критерий Стьюдента в варианте Уэлча решает ту же задачу и той же формулой, но сравнивает результат не с числом 1,96, а с таблицей t-распределения при подсчитанных степенях свободы. Переходите на него, если:

  • Хотя бы в одной группе меньше 30 человек. Главный и самый частый повод: на малых выборках Крамера-Уэлча завышает значимость.
  • Нужно точное p-значение или размер эффекта. d Коэна и доверительный интервал разности средних приводят рядом со Стьюдентом.
  • Работа не по педагогике. В психологии, медицине и спортивной науке рецензенты ждут t-критерий: за пределами отечественной педагогической школы название «Крамера-Уэлча» почти не встречается.

Пример. В магистерской по адаптивной физкультуре сравнивали силу кисти у 14 детей с ДЦП и 16 здоровых сверстников. Объёмы меньше 30, поэтому расчёт сделан t-критерием Стьюдента с поправкой Уэлча.

🧮Онлайн-калькулятор критерия СтьюдентаПосчитайте свои данные за пару минут — нажмите, чтобы открыть

Чем отличаются по сути

Крамера-Уэлча и Стьюдент на одной задаче

Что сравниваем T Крамера-Уэлча t Стьюдента (Уэлча)
Как считается отношение одинаково одинаково
С чем сравнивают с числом 1,96 с таблицей по степеням свободы
Степени свободы не считаются дробные, по Уэлчу-Саттертуэйту
Минимум в группе 30 3
Равенство дисперсий не требуется не требуется в варианте Уэлча
Размер эффекта, интервал нет в стандартном изложении d Коэна, ДИ разности

Числитель и знаменатель у критериев совпадают. Расходятся они только в последнем шаге — и чем меньше группы, тем сильнее.

Две независимые группы, сравниваем средние Данные — числа, а не ранги? да нет U-критерий Манна-Уитни В каждой группене меньше 30 человек? да нет Стьюдент с поправкойУэлча Разброс в группахразличается в разы? да нет Классический Стьюдент T-критерий Крамера-Уэлча
Три вопроса, после которых понятно, каким критерием считать две группы

Разбор примера: считаем T руками

Возвращаемся к эксперименту с методикой обучения. Итоговый тест, 100 баллов, ряды упорядочены по возрастанию.

Результаты итогового тестирования, баллы

Группа Значения признака
Экспериментальная (n = 32) 65, 65, 66, 66, 66, 67, 67, 68, 69, 69, 69, 71, 72, 72, 74, 74, 75, 76, 77, 77, 77, 77, 77, 79, 80, 81, 81, 81, 81, 83, 84, 85
Контрольная (n = 30) 38, 46, 51, 51, 51, 53, 56, 57, 58, 59, 59, 60, 63, 63, 63, 63, 67, 68, 69, 71, 71, 73, 74, 81, 83, 85, 86, 86, 87, 88

Шаг 1. Средние: M₁ = 74,09 и M₂ = 66,00 балла. Разность — 8,09 балла в пользу экспериментальной группы.

Шаг 2. Дисперсии: D₁ = 38,35 (SD = 6,19) и D₂ = 180,00 (SD = 13,42). Отношение большей к меньшей — 4,69: разброс в контрольной группе почти впятеро шире, и это ровно тот случай, ради которого критерий и создан.

Шаг 3. Делим каждую дисперсию на свой объём: 38,35 / 32 = 1,198 и 180,00 / 30 = 6,000. Сумма 7,198, корень 2,683 — это стандартная ошибка разности средних.

Шаг 4. Делим разность на ошибку: Tэмп = 8,09 / 2,683 = 3,02.

Шаг 5. Сравниваем с таблицей: 3,02 больше 2,58, но меньше 3,29, значит достигнутый уровень — p ≤ 0,01. Точное p — 0,0026.

Критические значения T-критерия Крамера-Уэлча

Уровень значимости Tкр Что это значит
0,10 1,64 тенденция, для диплома не годится
0,05 1,96 обычный порог, пишут p ≤ 0,05
0,01 2,58 высокая значимость, p ≤ 0,01
0,001 3,29 p ≤ 0,001

Таблица короткая, потому что это не таблица критерия, а квантили нормального закона: они не зависят ни от объёмов групп, ни от степеней свободы. Все четыре числа перед вами — многостраничные приложения открывать не нужно.

Tэмп = 3,02 различия не доказаны p ≤ 0,05 p ≤ 0,01 p ≤ 0,001 1,96 2,58 3,29 0
Куда попадает эмпирическое значение: 3,02 перешагнуло порог 2,58, но не дотянуло до 3,29
Совет

Сверьте вывод вторым способом. Тот же пример по Стьюденту-Уэлчу даёт t = 3,02 при 40,2 степенях свободы и p = 0,0044 — вывод тот же. Совпадение двух расчётов на защите снимает половину вопросов.

Важное замечание: на малых группах критерий завышает значимость

Это главная ловушка метода. Критерий сравнивает T с числом 1,96 независимо от того, 300 человек в группах или 8. А правильный порог при малых объёмах заметно выше: при 12 степенях свободы — 2,18, при 6 — 2,45. Разрыв между 1,96 и настоящим порогом и есть зона, где критерий объявляет значимым то, чего нет.

Критическое значение при α = 0,05, двусторонний Крамера-Уэлча: порог всегда 1,96 Стьюдент-Уэлч: порог зависит от объёма жёлтая зона — здесь Крамера-Уэлча объявляет различия там, где их нет наш пример: n = 10 и 10, tкр = 2,17 4 10 20 30 40 60 степени свободы (примерно равны объёму групп) 2,0 2,2 2,4 2,6 2,8
Порог 1,96 честен только на больших выборках: при десяти наблюдениях в группе правильное критическое значение выше на 11 %

Как это выглядит на данных.

Пример-ловушка. В ВКР по педагогике сравнивали технику чтения у 10 второклассников из экспериментального класса и 10 из контрольного, слова в минуту. Экспериментальная группа: 70, 71, 72, 74, 75, 75, 77, 81, 82, 83 — M = 76,0 при SD = 4,64. Контрольная: 54, 56, 61, 61, 68, 73, 75, 76, 80, 83 — M = 68,7 при SD = 10,22.

Разность средних 7,3, стандартная ошибка 3,55, Tэмп = 2,06. Это больше 1,96 — и автор пишет «различия статистически значимы, p ≤ 0,05».

Тот же расчёт по Стьюденту-Уэлчу: t = 2,06 при 12,6 степенях свободы, критическое значение 2,17. 2,06 меньше 2,17 — различия не значимы, точное p = 0,061. Вывод перевернулся.

Осторожно

Ошибка тут не в арифметике: оба расчёта дали одно и то же T = 2,06. Ошибка в пороге. При n = 10 приближение нормальным законом ещё не работает, и постоянное число 1,96 оказывается слишком мягким. Значимость «на грани» — 2,0–2,2 — на малых выборках почти всегда ложная.

Важно

Правило простое: меньше 30 человек в группе — не опирайтесь на 1,96. Считайте критерием Стьюдента, он сам подберёт порог под ваш объём. Наш калькулятор делает оба расчёта сразу и предупреждает, когда выводы разошлись.

Что писать в дипломе

Готовая формулировка с числами из разобранного примера — подставьте свой показатель и названия групп:

Для сравнения результатов итогового тестирования в экспериментальной (n = 32) и контрольной (n = 30) группах применён T-критерий Крамера-Уэлча. Средний балл составил 74,09 ± 6,19 в экспериментальной группе и 66,00 ± 13,42 в контрольной. Эмпирическое значение Tэмп = 3,02 превышает критическое Tкр = 2,58 (α = 0,01), нулевая гипотеза о равенстве средних отклоняется: различия статистически значимы на уровне p ≤ 0,01.

Если различий не нашлось:

Tэмп = 1,42 не превышает критического значения Tкр = 1,96 (α = 0,05), нулевая гипотеза сохраняется: статистически значимых различий между группами не выявлено. Результат может объясняться недостаточным объёмом выборки, поэтому вывод об эквивалентности методик не делается.

Одну фразу добавьте обязательно: «нормальность распределения не проверялась, поскольку критерий опирается на объём выборки, а не на форму распределения». Иначе вопрос про Шапиро-Уилка прозвучит на защите. Как оформлять числа — в статье «Как записывать M, SD, Me и квартили».

Частые ошибки

  • Считают Крамера-Уэлча по группам из 10–15 человек. Порог 1,96 при таких объёмах слишком мягкий, и значимость получается ложной.Возьмите критерий Стьюдента: он подбирает критическое значение под объём выборки.
  • Сравнивают замеры «до» и «после» у одних и тех же людей. Критерий существует только для независимых групп, парного варианта у него нет.Для связанных замеров — парный Стьюдент или критерий Вилкоксона; разница разобрана в статье о связанных и независимых выборках.
  • Берут смещённую дисперсию с делителем n. В формуле Новикова Dx и Dy — выборочные дисперсии с делителем n − 1.Проверьте формулу в Excel: нужна ДИСП.В, а не ДИСП.Г.
  • Проводят три попарных сравнения для трёх групп. Уровень значимости при этом раздувается, и «находки» появляются из воздуха.Для трёх и более групп — дисперсионный анализ или критерий Краскела-Уоллиса.
  • Пишут «различий нет», получив T меньше 1,96. Критерий доказывает наличие различий, а не их отсутствие.Формулируйте «различия не выявлены» и упоминайте объём выборки — подробнее в статье о статистической мощности.

Частые вопросы

Крамера-Уэлча и поправка Уэлча к Стьюденту — это одно и то же?

Отношение считается одинаково, дальше пути расходятся: Крамера-Уэлча сравнивает его с постоянным числом из нормального закона, Стьюдент-Уэлч — с квантилем t-распределения при дробных степенях свободы. От нескольких десятков наблюдений ответы совпадают, на малых выборках расходятся, и прав там Стьюдент.

Нужно ли проверять нормальность перед расчётом?

Нет. Критерий обходится без предположения о форме распределения за счёт объёма выборки: при 30 и более наблюдениях средние распределены приблизительно нормально независимо от исходных данных. Шапиро-Уилк здесь не нужен — разница между подходами разобрана в статье о параметрических и непараметрических критериях.

Откуда взялось название и почему его нет в западных учебниках?

В отечественную педагогику критерий пришёл через книгу Д. А. Новикова «Статистические методы в педагогических исследованиях (типовые случаи)» (М.: МЗ-Пресс, 2004), где он дан как готовый рецепт без предварительных проверок. В англоязычной литературе та же статистика называется просто Welch's t-test, а нормальное приближение считают допустимым упрощением для больших выборок.

Можно ли посчитать размер эффекта?

Да, и в магистерских работах это спрашивают. Стандартный показатель — d Коэна: разность средних делится на объединённое стандартное отклонение. Критерий отвечает только на вопрос «различия есть?», а насколько они велики — отдельная величина.

Короткий алгоритм

  1. Проверьте условия: две независимые группы, числовые данные, от 30 наблюдений в каждой.
  2. Посчитайте объём, среднее и дисперсию (делитель n − 1) по каждой группе.
  3. Разделите каждую дисперсию на свой объём, сложите, извлеките корень — это ошибка разности средних.
  4. Разделите модуль разности средних на эту ошибку: получилось Tэмп.
  5. Сравните с порогом: 1,96 при 0,05, 2,58 при 0,01, 3,29 при 0,001. Больше — различия значимы.
  6. В группе меньше 30 человек — перепроверьте вывод критерием Стьюдента: порог 1,96 там обманывает.

Что ещё почитать

Все методы с онлайн-расчётом собраны в базе. Если статистика в работе не складывается — напишите, разберём вашу задачу на консультации.

Не хотите разбираться со статистикой сами?

Эксперт подберёт метод, посчитает и оформит таблицы по ГОСТ под вашу тему.

Заказать консультацию