Пока таблица не проверена, любой критерий посчитает красивое и неверное число.
Порядок ниже одинаков для диплома по физкультуре, психологии и педагогике: везде на входе бланки, на выходе первая таблица главы. Что делать после нее, разобрано в маршруте обработки результатов исследования: там выбор критерия, расчет и оформление.
Мы показываем общий порядок обработки. Итоговый состав шагов и формулировки для главы согласуйте с научным руководителем: требования кафедр различаются.
В двух словах
Коротко о том, что происходит с данными между сбором бланков и первым критерием. Сверьтесь с этими пунктами, если таблица уже собрана, а уверенности, что она готова к расчетам, нет.
- Семь шагов до первого критерия. Проверить бланки, свести таблицу, поймать ошибки ввода, закрыть пропуски, разобрать выбросы, перевести баллы в шкальные, посчитать описательные показатели.
- Граница проходит по слову «предположение». Первичная обработка описывает то, что собрано. Вторичная проверяет гипотезу. Как только в работе появилось p, первичная обработка закончилась.
- Чистка идет до расчета, а не после. В учебном примере одно значение 42 см среди остальных от 5 до 16 раздуло стандартное отклонение с 3,2 до 9,4 см, а медианаЗначение ровно посередине упорядоченного ряда: половина участников набрала меньше, половина больше. не сдвинулась.
- Формат показателей задает шкала. Для сантиметров и секунд M ± SD, для баллов опросника Me [Q1; Q3], для уровней и долей число человек и проценты.
- Каждое решение попадает в текст главы. Сколько бланков выбраковано, сколько пропусков закрыто и по какому правилу: это пишут в параграфе про организацию исследования.
Что входит в первичную обработку
Первичная обработка это все, что происходит с данными между сбором и первым критерием. Она ничего не доказывает. Ее задача привести сырые бланки в состояние, в котором с ними вообще можно считать.
В методичках этап называют по-разному: первичная обработка, подготовка данных, первичный анализ. Содержание одно и то же и укладывается в семь шагов.
- Слева: шаги, после которых в таблице не остается пустых клеток, опечаток и чужих единиц измерения.
- Желтая метка: рубеж, на который ссылается научный руководитель, когда спрашивает, на каком этапе обработки вы находитесь.
Частая путаница. Первичную обработку постоянно путают с описательной статистикой. Описательная статистика это только последний, седьмой шаг: средние и медианы считают по уже вычищенной таблице. Шесть шагов до нее в нее не входят, а без них она посчитает мусор. Как оформить сами показатели, разобрано в статье про описательную статистику в дипломе.
Проверка бланков и таблица данных
Учебный пример на всю статью: диплом по физической культуре, наклон вперед сидя и опросник школьной тревожности у девятиклассниц. Собрано 28 бланков.
Проверить бланки
Пересчитайте бланки и сверьте со списком участников: сколько человек тестировали, столько и должно лежать на столе. Дальше три проверки на каждом бланке:
- Заполнены обе стороны, ни один лист не потерян.
- Отмечены все пункты методики, а не первая половина.
- Ответы не одинаковые подряд: сплошные «да» или один и тот же балл в каждой строке значит, что бланк заполняли не читая.
В примере из 28 бланков два оказались без второй страницы и еще два со сплошными одинаковыми ответами. В обработку пошли 24 бланка, по 12 в каждой группе.
Выбраковку записывают сразу. Число собранных и число обработанных бланков потом стоит в главе, и восстановить его через месяц по памяти уже нельзя.
Свести данные в таблицу
Дальше все бланки переносят в один файл. Правило раскладки: одна строка это один человек, один столбец это один показатель.
- Номер вместо фамилии. Фамилии в дипломе не публикуют, а нумерация заодно упрощает возврат к бланку.
- Группа и замер отдельными столбцами. Со значениями «КГ» и «ЭГ», «до» и «после». Два листа вместо двух столбцов усложнят любое сравнение.
- Числа числами. Если Excel показывает значение прижатым к левому краю ячейки, это текст, и он не попадет ни в одну формулу.
- Одна единица на столбец. Сантиметры во всем столбце или секунды во всем столбце, но не вперемешку.
- Ответы на отдельные пункты на втором листе. Они понадобятся, если руководитель попросит посчитать альфу Кронбаха и доказать надежность методики.
Как почистить таблицу
Сырая таблица почти всегда содержит три дефекта: описки при переносе, пустые клетки и значения, которые выбиваются из ряда. Разбирают их именно в этом порядке.
Поймать ошибки ввода
Отсортируйте каждый числовой столбец по возрастанию и посмотрите на оба края. Описка вылезает именно туда: лишний ноль, потерянная запятая, цифра из соседней строки. На сортировку всей таблицы у вас уйдет минута.
Второй прием. Сравните минимум и максимум столбца с возможным диапазоном. У опросника из 20 пунктов с оценкой до 4 баллов максимум равен 80, и балл 112 в таблице означает ошибку подсчета по ключу, а не рекорд.
Закрыть пропуски
Пустая клетка не ноль. Ноль отжиманий результат, а незаполненная ячейка отсутствие результата, и считать их одинаково нельзя.
Дальше два пути. Если пропусков единицы, ориентир до 5% строк, и выборка не маленькая, строку удаляют целиком. Если выборка маленькая и терять человека жалко, пропуск закрывают медианой по столбцу, а категориальный признак самым частым значением.
В примере одна девочка пропустила замер наклона. Один пропуск на 24 строки это 4%, строку можно было бы удалить, но при 12 участницах в группе потеря заметна, поэтому клетку закрыли медианой. Разбор обоих путей с готовыми формулировками лежит в статье про пропуски в данных.
Если из второго замера выпали именно слабые участники, пропуск неслучаен, и замена медианой искусственно улучшит результат «после». Такой пропуск в работе честно оговаривают, а не латают.
Разобрать выбросы
Выброс это значение, которое резко выбивается из ряда. Ищут его правилом 1,5 × IQR: считают первую и третью квартилиДва значения, которые отрезают нижнюю и верхнюю четверть упорядоченного ряда: между ними лежит средняя половина участников., берут их разность и отступают от квартилей по полторы такие разности в обе стороны.
В экспериментальной группе наклон вперед дал такой ряд, в сантиметрах: 5, 8, 9, 10, 11, 12, 12, 13, 14, 15, 16, 42. Первая квартиль равна 9,5, третья 14,5, межквартильный размах 5. Верхняя граница равна 14,5 + 1,5 × 5 = 22, и значение 42 за нее выходит.
Решает бланк. Дальше вопрос не в математике, а в записи участника.
Бланк показал те же 42 см: девочка много лет занимается художественной гимнастикой. Значение реальное, удалять его нельзя.
Зато считать по нему среднее бессмысленно. Без этого значения среднее по группе равно 11,4 см при стандартном отклоненииНасколько в среднем результаты участников отходят от среднего по группе. Чем оно больше, тем сильнее люди разбросаны. 3,2 см, вместе с ним 13,9 см при отклонении 9,4 см. Медиана в обоих случаях равна 12 см: она смотрит только на середину ряда. Поэтому группу с таким участником описывают медианой и квартилями, а сравнивают ранговым критерием. Подробный разбор трех способов поиска выбросов лежит в статье про выбросы в данных.
Удалять значения, которые мешают получить нужный результат, нельзя: это фальсификация, и на защите она вскрывается одним вопросом про объем выборки. Любое удаление описывают в тексте: сколько наблюдений и по какому правилу убрали.
Перевод баллов в шкальные
Шестой шаг нужен только там, где вы работали с методикой. Сырой балл это просто сумма по ключу, и сам по себе он не читается: 34 балла по одной шкале высокий уровень, по другой середина.
Перевод делают по таблице норм из руководства к методике, а не формулой. В учебном примере сырые 34 балла по нормам методики дали 65 Т-баллов, и это уже повышенный уровень. Чаще всего встречаются две шкалы: Т-баллы со средним 50 и стандартным отклонением 10 и стены от 1 до 10 со средним 5,5.
Важная тонкость. Для сравнения групп между собой перевод не обязателен: критерий одинаково посчитает и сырые баллы, и Т-баллы. Шкальные баллы нужны там, где в работе есть слова «высокий уровень» и «норма», то есть в интерпретации. Все шкалы и порядок перевода разобраны в статье про сырые баллы, стены и Т-баллы, а десятибалльную шкалу считает калькулятор перевода в стены. Весь путь от бланка опросника до вывода, вместе с ключами и критерием, разобран отдельно: как обработать результаты опросника.
Описательные показатели по группам
Седьмой шаг закрывает первичную обработку. Показатели считают по каждой группе отдельно: если смешать КГ и ЭГ в один массив, разница между ними растворится еще до всякого критерия.
Набор показателей выбирают не по вкусу, а по типу шкалы.
Какие показатели приводить при разных типах данных
| Что измеряли | Показатель | Как записывают |
|---|---|---|
| Сантиметры, секунды, килограммы | среднее и стандартное отклонение | M ± SD |
| Баллы опросника, уровни, ранги | медиана и квартили | Me [Q1; Q3] |
| Доли: сдал или не сдал, есть признак или нет | число человек и процент | n и % |
| Ряд с выбросом, который решили оставить | медиана и квартили | Me [Q1; Q3] |
Для экспериментальной группы из примера в работу идет запись Me = 12 [9,5; 14,5] см: медиана и обе квартили уже посчитаны на пятом шаге. Что означает каждое обозначение и в каком порядке их пишут, разобрано в статье про запись M ± SD и Me с квартилями. Когда методик несколько, показатели по всем сразу сводят в одну сводную таблицу результатов.
Первый взгляд на форму. Вместе с показателями строят гистограмму или ящик с усами. Это еще не проверка нормальностиПохожи ли результаты на симметричный холм вокруг среднего. От ответа зависит, какую ветку критериев брать дальше., а быстрый осмотр: форма ряда сразу говорит, чего ждать дальше.
Где кончается первичная обработка
Граница простая. Первичная обработка описывает то, что собрано: столько-то человек, такая-то медиана, такой-то разброс. Вторичная обработка проверяет предположение: различаются ли группы, связаны ли показатели, достоверен ли сдвиг.
Технический признак еще проще. Появилось в работе p, значит первичная обработка закончилась. До этого момента никакой гипотезы не проверяют, и слова «достоверно» в тексте быть не может.
Проверка нормальности стоит ровно на границе, и кафедры относят ее по-разному: где-то к последнему шагу первичной обработки, где-то к первому шагу вторичной. Спорить бесполезно, спросите на своей кафедре. Проверка нормальности дает свое p, но о ваших гипотезах это p не говорит ничего: оно только выбирает ветку критериев. Как его проводят, разобрано в статье про проверку нормальности распределения.
Чего она не показывает. Первичная обработка не отвечает ни на один вопрос исследования. Даже если медиана в ЭГ выше, чем в КГ, это еще не результат: разницу между группами доказывает критерий, подобранный под тип ваших чисел, а не сравнение двух медиан глазами.
В тексте главы первичная обработка занимает один абзац в параграфе про организацию исследования. Готовая формулировка по учебному примеру: «Собрано 28 бланков, из них 4 выбраковано по критериям неполноты и однотипности ответов; в обработку включены данные 24 участниц. Одно пропущенное значение заменено медианой по показателю. Показатель наклона вперед описан медианой и квартилями, поскольку распределение в экспериментальной группе несимметрично».
Частые ошибки
Все шесть ошибок ниже обнаруживаются на защите, когда переделывать уже поздно.
Критерий посчитан по сырой таблице.
Одна описка вроде 420 вместо 42 смещает среднее и стандартное отклонение, и вывод «различия достоверны» может оказаться артефактом опечатки. Сначала семь шагов, потом критерий: порядок в схеме в начале статьи.
Пустая клетка посчитана как ноль.
Ноль занижает среднее по всей группе, причем незаметно. Перед расчетом замените нули, которые означают «нет ответа», на пустые ячейки.
Выброс удален без обращения к бланку.
Вместе с неудобным числом из выборки уходит реальный участник. Сверьте значение с бланком: исправляют только описку, реальное значение остается.
Описательные показатели посчитаны по всей выборке сразу.
КГ и ЭГ смешались в один массив, и разница между ними исчезла до всякого критерия. Считайте показатели отдельно по каждой группе и каждому замеру.
Среднее у баллов опросника с выбросом.
Одно крайнее значение сдвигает M ± SD, и таблица перестает описывать группу. Для баллов и рядов с выбросами берите Me [Q1; Q3].
Решения по чистке нигде не записаны.
Через месяц никто не помнит, почему в одной таблице n = 24, а в другой 23. Ведите отдельный лист правок: строка, что изменили, почему.
Что делать, если данные испорчены
Иногда первичная обработка упирается в то, что исправить уже нельзя. Три частых случая и выход из каждого.
Бланки недоступны. Вернуться к первоисточнику невозможно, а в таблице есть подозрительное значение. Тогда его не исправляют наугад: либо оставляют как есть и переходят на медиану, либо помечают как пропуск и закрывают по правилам четвертого шага. Оба решения описывают в работе.
Слишком много пропусков. Если пусто больше 10-15% значений столбца, такой показатель ненадежен, и латать его заменами бессмысленно: разброс станет искусственно маленьким. Честный выход убрать показатель из анализа и назвать причину, а не строить на нем главу.
Шкала переполнена. Почти все набрали максимум, разброса нет, среднее ничего не показывает. Сравнивать группы по такому показателю бесполезно: переводите ваши данные в доли «достиг максимума или нет» и считайте хи-квадрат.
Самая дешевая страховка от всего этого занимает полчаса. Сразу после переноса данных возьмите наугад каждый пятый бланк и сверьте его со строкой в таблице. Ошибки ввода кучкуются: если нашлась одна, рядом почти всегда есть вторая.
Частые вопросы
Первичная обработка и описательная статистика это одно и то же?
Нет. Описательная статистика это последний, седьмой шаг первичной обработки. До нее идут проверка бланков, сборка таблицы, чистка от описок, пропусков и выбросов и перевод баллов в шкальные.
Обязательно ли переводить сырые баллы в стены и Т-баллы?
Только если в работе есть слова про уровни: «высокий», «средний», «норма». Для сравнения групп критерий одинаково посчитает и сырые баллы, так что ради одной таблицы сравнения перевод не нужен.
Куда в дипломе писать про чистку данных?
В параграф про организацию и методы исследования, одним абзацем: сколько бланков собрано, сколько выбраковано и почему, что сделали с пропусками и выбросами. Готовая формулировка есть в разделе про границу выше.
Можно ли сделать первичную обработку в Excel?
Да, для дипломной выборки хватает Excel или калькулятора описательной статистики: он сразу выдаст медиану, квартили и межквартильный размах для правила 1,5 × IQR. SPSS нужен только если его требует кафедра.
Сколько времени занимает первичная обработка?
На 24 бланка и две методики перенос в таблицу занимает около часа, чистка и описательные показатели еще час. Основное время уходит не на расчеты, а на возврат к бланкам при сверке.
Короткий алгоритм
- Пересчитайте бланки и выбракуйте неполные и однотипные, записав оба числа: сколько собрано и сколько пошло в обработку.
- Сведите все в одну таблицу: строка это человек, столбец это показатель, группа и замер отдельными столбцами.
- Отсортируйте каждый столбец и сверьте края с возможным диапазоном шкалы: описки вылезают именно туда.
- Закройте пропуски: до 5% строк удаляют, на маленькой выборке ставят медиану по столбцу.
- Проверьте выбросы правилом 1,5 × IQR и сверьте каждого кандидата с бланком: исправляют только описку.
- Посчитайте показатели по каждой группе отдельно: M ± SD для измерений, Me [Q1; Q3] для баллов. После этого первичная обработка закончена и можно [выбирать критерий](/blog/kak-vybrat-statisticheskiy-kriteriy).
Готовые расчеты для всех семи шагов собраны в базе методов. Если таблица уже собрана, а решение по выбросам и пропускам вызывает сомнения, приходите на консультацию.