StatBlank
Семь шагов до первого критерия 1 2 3 4 5 6 7 СЫРАЯ ТАБЛИЦА Группа Наклон, см Тревожность 1ЭГ1244 2ЭГ951 3ЭГ38 4ЭГ42047 5ЭГ15112 пропуск, лишний ноль и балл выше максимума ПОСЛЕ ПЕРВИЧНОЙ ОБРАБОТКИ Строк в работе n = 24 Медиана наклона 12 см Квартили 9,5 и 14,5 можно считать критерий
Основы7 сентября 202615 мин чтения

Как провести первичную обработку данных

Андрей Лазарев
Эксперт по мат. статистике, пишу работы на заказ

Первичная обработка это семь шагов между стопкой бланков и первой таблицей главы. Критерии начинаются после них: выбор критерия и расчет в первичную обработку не входят.

Пока таблица не проверена, любой критерий посчитает красивое и неверное число.

Порядок ниже одинаков для диплома по физкультуре, психологии и педагогике: везде на входе бланки, на выходе первая таблица главы. Что делать после нее, разобрано в маршруте обработки результатов исследования: там выбор критерия, расчет и оформление.

🧮Онлайн-калькулятор описательной статистикиПосчитайте свои данные за пару минут — нажмите, чтобы открыть

Мы показываем общий порядок обработки. Итоговый состав шагов и формулировки для главы согласуйте с научным руководителем: требования кафедр различаются.

В двух словах

Коротко о том, что происходит с данными между сбором бланков и первым критерием. Сверьтесь с этими пунктами, если таблица уже собрана, а уверенности, что она готова к расчетам, нет.

  • Семь шагов до первого критерия. Проверить бланки, свести таблицу, поймать ошибки ввода, закрыть пропуски, разобрать выбросы, перевести баллы в шкальные, посчитать описательные показатели.
  • Граница проходит по слову «предположение». Первичная обработка описывает то, что собрано. Вторичная проверяет гипотезу. Как только в работе появилось p, первичная обработка закончилась.
  • Чистка идет до расчета, а не после. В учебном примере одно значение 42 см среди остальных от 5 до 16 раздуло стандартное отклонение с 3,2 до 9,4 см, а медианаЗначение ровно посередине упорядоченного ряда: половина участников набрала меньше, половина больше. не сдвинулась.
  • Формат показателей задает шкала. Для сантиметров и секунд M ± SD, для баллов опросника Me [Q1; Q3], для уровней и долей число человек и проценты.
  • Каждое решение попадает в текст главы. Сколько бланков выбраковано, сколько пропусков закрыто и по какому правилу: это пишут в параграфе про организацию исследования.

Что входит в первичную обработку

Первичная обработка это все, что происходит с данными между сбором и первым критерием. Она ничего не доказывает. Ее задача привести сырые бланки в состояние, в котором с ними вообще можно считать.

В методичках этап называют по-разному: первичная обработка, подготовка данных, первичный анализ. Содержание одно и то же и укладывается в семь шагов.

Первичная обработка описываем то, что собрали Вторичная обработка проверяем предположение 1. Проверить бланки на полноту 2. Свести данные в одну таблицу 3. Поймать ошибки ввода 4. Закрыть пропуски 5. Разобрать выбросы 6. Перевести баллы в шкальные 7. Посчитать описательные показатели Выбрать критерий под данные Посчитать критерий и получить p Добавить размер эффекта Записать вывод и построить рисунок граница: первая таблица главы
Первичная обработка заканчивается таблицей с описательными показателями, и только после нее в работе появляется первый критерий
  • Слева: шаги, после которых в таблице не остается пустых клеток, опечаток и чужих единиц измерения.
  • Желтая метка: рубеж, на который ссылается научный руководитель, когда спрашивает, на каком этапе обработки вы находитесь.

Частая путаница. Первичную обработку постоянно путают с описательной статистикой. Описательная статистика это только последний, седьмой шаг: средние и медианы считают по уже вычищенной таблице. Шесть шагов до нее в нее не входят, а без них она посчитает мусор. Как оформить сами показатели, разобрано в статье про описательную статистику в дипломе.

Проверка бланков и таблица данных

Учебный пример на всю статью: диплом по физической культуре, наклон вперед сидя и опросник школьной тревожности у девятиклассниц. Собрано 28 бланков.

Проверить бланки

Пересчитайте бланки и сверьте со списком участников: сколько человек тестировали, столько и должно лежать на столе. Дальше три проверки на каждом бланке:

  1. Заполнены обе стороны, ни один лист не потерян.
  2. Отмечены все пункты методики, а не первая половина.
  3. Ответы не одинаковые подряд: сплошные «да» или один и тот же балл в каждой строке значит, что бланк заполняли не читая.

В примере из 28 бланков два оказались без второй страницы и еще два со сплошными одинаковыми ответами. В обработку пошли 24 бланка, по 12 в каждой группе.

Выбраковку записывают сразу. Число собранных и число обработанных бланков потом стоит в главе, и восстановить его через месяц по памяти уже нельзя.

Свести данные в таблицу

Дальше все бланки переносят в один файл. Правило раскладки: одна строка это один человек, один столбец это один показатель.

  • Номер вместо фамилии. Фамилии в дипломе не публикуют, а нумерация заодно упрощает возврат к бланку.
  • Группа и замер отдельными столбцами. Со значениями «КГ» и «ЭГ», «до» и «после». Два листа вместо двух столбцов усложнят любое сравнение.
  • Числа числами. Если Excel показывает значение прижатым к левому краю ячейки, это текст, и он не попадет ни в одну формулу.
  • Одна единица на столбец. Сантиметры во всем столбце или секунды во всем столбце, но не вперемешку.
  • Ответы на отдельные пункты на втором листе. Они понадобятся, если руководитель попросит посчитать альфу Кронбаха и доказать надежность методики.

Как почистить таблицу

Сырая таблица почти всегда содержит три дефекта: описки при переносе, пустые клетки и значения, которые выбиваются из ряда. Разбирают их именно в этом порядке.

Поймать ошибки ввода

Отсортируйте каждый числовой столбец по возрастанию и посмотрите на оба края. Описка вылезает именно туда: лишний ноль, потерянная запятая, цифра из соседней строки. На сортировку всей таблицы у вас уйдет минута.

Второй прием. Сравните минимум и максимум столбца с возможным диапазоном. У опросника из 20 пунктов с оценкой до 4 баллов максимум равен 80, и балл 112 в таблице означает ошибку подсчета по ключу, а не рекорд.

Группа Наклон, см Тревожность 1ЭГ1244 2ЭГ951 3ЭГ38 4ЭГ42047 5ЭГ15112 Пустая клетка: это пропуск, шаг 4 Лишний ноль при вводе: должно быть 42 Выше максимума шкалы, а он равен 80
Три типичных дефекта сырой таблицы: описка при вводе видна по краям столбца, пропуск по пустой клетке, ошибка подсчета по выходу за границы шкалы

Закрыть пропуски

Пустая клетка не ноль. Ноль отжиманий результат, а незаполненная ячейка отсутствие результата, и считать их одинаково нельзя.

Дальше два пути. Если пропусков единицы, ориентир до 5% строк, и выборка не маленькая, строку удаляют целиком. Если выборка маленькая и терять человека жалко, пропуск закрывают медианой по столбцу, а категориальный признак самым частым значением.

В примере одна девочка пропустила замер наклона. Один пропуск на 24 строки это 4%, строку можно было бы удалить, но при 12 участницах в группе потеря заметна, поэтому клетку закрыли медианой. Разбор обоих путей с готовыми формулировками лежит в статье про пропуски в данных.

Осторожно

Если из второго замера выпали именно слабые участники, пропуск неслучаен, и замена медианой искусственно улучшит результат «после». Такой пропуск в работе честно оговаривают, а не латают.

Разобрать выбросы

Выброс это значение, которое резко выбивается из ряда. Ищут его правилом 1,5 × IQR: считают первую и третью квартилиДва значения, которые отрезают нижнюю и верхнюю четверть упорядоченного ряда: между ними лежит средняя половина участников., берут их разность и отступают от квартилей по полторы такие разности в обе стороны.

В экспериментальной группе наклон вперед дал такой ряд, в сантиметрах: 5, 8, 9, 10, 11, 12, 12, 13, 14, 15, 16, 42. Первая квартиль равна 9,5, третья 14,5, межквартильный размах 5. Верхняя граница равна 14,5 + 1,5 × 5 = 22, и значение 42 за нее выходит.

Решает бланк. Дальше вопрос не в математике, а в записи участника.

Значение за границей 1,5 × IQR В бланке стоит то же число? нет да Ошибка ввода: исправить по бланку Значение реальное: оставить и перейти на медиану
Решение по выбросу принимают не по величине числа, а по тому, что записано в бланке участника

Бланк показал те же 42 см: девочка много лет занимается художественной гимнастикой. Значение реальное, удалять его нельзя.

Зато считать по нему среднее бессмысленно. Без этого значения среднее по группе равно 11,4 см при стандартном отклоненииНасколько в среднем результаты участников отходят от среднего по группе. Чем оно больше, тем сильнее люди разбросаны. 3,2 см, вместе с ним 13,9 см при отклонении 9,4 см. Медиана в обоих случаях равна 12 см: она смотрит только на середину ряда. Поэтому группу с таким участником описывают медианой и квартилями, а сравнивают ранговым критерием. Подробный разбор трех способов поиска выбросов лежит в статье про выбросы в данных.

Осторожно

Удалять значения, которые мешают получить нужный результат, нельзя: это фальсификация, и на защите она вскрывается одним вопросом про объем выборки. Любое удаление описывают в тексте: сколько наблюдений и по какому правилу убрали.

Перевод баллов в шкальные

Шестой шаг нужен только там, где вы работали с методикой. Сырой балл это просто сумма по ключу, и сам по себе он не читается: 34 балла по одной шкале высокий уровень, по другой середина.

Перевод делают по таблице норм из руководства к методике, а не формулой. В учебном примере сырые 34 балла по нормам методики дали 65 Т-баллов, и это уже повышенный уровень. Чаще всего встречаются две шкалы: Т-баллы со средним 50 и стандартным отклонением 10 и стены от 1 до 10 со средним 5,5.

Сырые 34 балла по таблице норм методики дают 65 Т-баллов пониженный средний повышенный 20 40 60 80 65 Т-баллов границы зон у каждой методики свои, берите их из руководства, а не из общей таблицы
Сырой балл превращается в уровень только через нормы конкретной методики: одно и то же число по разным шкалам попадает в разные зоны

Важная тонкость. Для сравнения групп между собой перевод не обязателен: критерий одинаково посчитает и сырые баллы, и Т-баллы. Шкальные баллы нужны там, где в работе есть слова «высокий уровень» и «норма», то есть в интерпретации. Все шкалы и порядок перевода разобраны в статье про сырые баллы, стены и Т-баллы, а десятибалльную шкалу считает калькулятор перевода в стены. Весь путь от бланка опросника до вывода, вместе с ключами и критерием, разобран отдельно: как обработать результаты опросника.

Описательные показатели по группам

Седьмой шаг закрывает первичную обработку. Показатели считают по каждой группе отдельно: если смешать КГ и ЭГ в один массив, разница между ними растворится еще до всякого критерия.

Набор показателей выбирают не по вкусу, а по типу шкалы.

Какие показатели приводить при разных типах данных

Что измеряли Показатель Как записывают
Сантиметры, секунды, килограммы среднее и стандартное отклонение M ± SD
Баллы опросника, уровни, ранги медиана и квартили Me [Q1; Q3]
Доли: сдал или не сдал, есть признак или нет число человек и процент n и %
Ряд с выбросом, который решили оставить медиана и квартили Me [Q1; Q3]

Для экспериментальной группы из примера в работу идет запись Me = 12 [9,5; 14,5] см: медиана и обе квартили уже посчитаны на пятом шаге. Что означает каждое обозначение и в каком порядке их пишут, разобрано в статье про запись M ± SD и Me с квартилями. Когда методик несколько, показатели по всем сразу сводят в одну сводную таблицу результатов.

Первый взгляд на форму. Вместе с показателями строят гистограмму или ящик с усами. Это еще не проверка нормальностиПохожи ли результаты на симметричный холм вокруг среднего. От ответа зависит, какую ветку критериев брать дальше., а быстрый осмотр: форма ряда сразу говорит, чего ждать дальше.

Холм по центру среднее и SD работают Хвост вправо надежнее медиана и квартили Два горба внутри скрыты две разные группы
Форма ряда подсказывает формат записи заранее: два горба почти всегда означают, что в один столбец попали мальчики и девочки или новички и разрядники

Где кончается первичная обработка

Граница простая. Первичная обработка описывает то, что собрано: столько-то человек, такая-то медиана, такой-то разброс. Вторичная обработка проверяет предположение: различаются ли группы, связаны ли показатели, достоверен ли сдвиг.

Технический признак еще проще. Появилось в работе p, значит первичная обработка закончилась. До этого момента никакой гипотезы не проверяют, и слова «достоверно» в тексте быть не может.

Важно

Проверка нормальности стоит ровно на границе, и кафедры относят ее по-разному: где-то к последнему шагу первичной обработки, где-то к первому шагу вторичной. Спорить бесполезно, спросите на своей кафедре. Проверка нормальности дает свое p, но о ваших гипотезах это p не говорит ничего: оно только выбирает ветку критериев. Как его проводят, разобрано в статье про проверку нормальности распределения.

Чего она не показывает. Первичная обработка не отвечает ни на один вопрос исследования. Даже если медиана в ЭГ выше, чем в КГ, это еще не результат: разницу между группами доказывает критерий, подобранный под тип ваших чисел, а не сравнение двух медиан глазами.

В тексте главы первичная обработка занимает один абзац в параграфе про организацию исследования. Готовая формулировка по учебному примеру: «Собрано 28 бланков, из них 4 выбраковано по критериям неполноты и однотипности ответов; в обработку включены данные 24 участниц. Одно пропущенное значение заменено медианой по показателю. Показатель наклона вперед описан медианой и квартилями, поскольку распределение в экспериментальной группе несимметрично».

Частые ошибки

Все шесть ошибок ниже обнаруживаются на защите, когда переделывать уже поздно.

Критерий посчитан по сырой таблице.

Одна описка вроде 420 вместо 42 смещает среднее и стандартное отклонение, и вывод «различия достоверны» может оказаться артефактом опечатки. Сначала семь шагов, потом критерий: порядок в схеме в начале статьи.

Пустая клетка посчитана как ноль.

Ноль занижает среднее по всей группе, причем незаметно. Перед расчетом замените нули, которые означают «нет ответа», на пустые ячейки.

Выброс удален без обращения к бланку.

Вместе с неудобным числом из выборки уходит реальный участник. Сверьте значение с бланком: исправляют только описку, реальное значение остается.

Описательные показатели посчитаны по всей выборке сразу.

КГ и ЭГ смешались в один массив, и разница между ними исчезла до всякого критерия. Считайте показатели отдельно по каждой группе и каждому замеру.

Среднее у баллов опросника с выбросом.

Одно крайнее значение сдвигает M ± SD, и таблица перестает описывать группу. Для баллов и рядов с выбросами берите Me [Q1; Q3].

Решения по чистке нигде не записаны.

Через месяц никто не помнит, почему в одной таблице n = 24, а в другой 23. Ведите отдельный лист правок: строка, что изменили, почему.

Что делать, если данные испорчены

Иногда первичная обработка упирается в то, что исправить уже нельзя. Три частых случая и выход из каждого.

Бланки недоступны. Вернуться к первоисточнику невозможно, а в таблице есть подозрительное значение. Тогда его не исправляют наугад: либо оставляют как есть и переходят на медиану, либо помечают как пропуск и закрывают по правилам четвертого шага. Оба решения описывают в работе.

Слишком много пропусков. Если пусто больше 10-15% значений столбца, такой показатель ненадежен, и латать его заменами бессмысленно: разброс станет искусственно маленьким. Честный выход убрать показатель из анализа и назвать причину, а не строить на нем главу.

Шкала переполнена. Почти все набрали максимум, разброса нет, среднее ничего не показывает. Сравнивать группы по такому показателю бесполезно: переводите ваши данные в доли «достиг максимума или нет» и считайте хи-квадрат.

Совет

Самая дешевая страховка от всего этого занимает полчаса. Сразу после переноса данных возьмите наугад каждый пятый бланк и сверьте его со строкой в таблице. Ошибки ввода кучкуются: если нашлась одна, рядом почти всегда есть вторая.

Частые вопросы

Первичная обработка и описательная статистика это одно и то же?

Нет. Описательная статистика это последний, седьмой шаг первичной обработки. До нее идут проверка бланков, сборка таблицы, чистка от описок, пропусков и выбросов и перевод баллов в шкальные.

Обязательно ли переводить сырые баллы в стены и Т-баллы?

Только если в работе есть слова про уровни: «высокий», «средний», «норма». Для сравнения групп критерий одинаково посчитает и сырые баллы, так что ради одной таблицы сравнения перевод не нужен.

Куда в дипломе писать про чистку данных?

В параграф про организацию и методы исследования, одним абзацем: сколько бланков собрано, сколько выбраковано и почему, что сделали с пропусками и выбросами. Готовая формулировка есть в разделе про границу выше.

Можно ли сделать первичную обработку в Excel?

Да, для дипломной выборки хватает Excel или калькулятора описательной статистики: он сразу выдаст медиану, квартили и межквартильный размах для правила 1,5 × IQR. SPSS нужен только если его требует кафедра.

Сколько времени занимает первичная обработка?

На 24 бланка и две методики перенос в таблицу занимает около часа, чистка и описательные показатели еще час. Основное время уходит не на расчеты, а на возврат к бланкам при сверке.

Короткий алгоритм

  1. Пересчитайте бланки и выбракуйте неполные и однотипные, записав оба числа: сколько собрано и сколько пошло в обработку.
  2. Сведите все в одну таблицу: строка это человек, столбец это показатель, группа и замер отдельными столбцами.
  3. Отсортируйте каждый столбец и сверьте края с возможным диапазоном шкалы: описки вылезают именно туда.
  4. Закройте пропуски: до 5% строк удаляют, на маленькой выборке ставят медиану по столбцу.
  5. Проверьте выбросы правилом 1,5 × IQR и сверьте каждого кандидата с бланком: исправляют только описку.
  6. Посчитайте показатели по каждой группе отдельно: M ± SD для измерений, Me [Q1; Q3] для баллов. После этого первичная обработка закончена и можно [выбирать критерий](/blog/kak-vybrat-statisticheskiy-kriteriy).

Готовые расчеты для всех семи шагов собраны в базе методов. Если таблица уже собрана, а решение по выбросам и пропускам вызывает сомнения, приходите на консультацию.

Помогу с расчетами лично

Я Андрей Лазарев, автор StatBlank. Подберу критерий под ваши данные, посчитаю статистику и оформлю таблицы с выводами для диплома. За качество расчета отвечаю лично.

Заказать консультацию