Среднее по вариантам ответа посчитать можно, но оно ничего не значит.
Речь про свою анкету с готовыми вариантами ответа. Стандартный опросник с ключом и нормами обрабатывают иначе, по ключу и шкалам, а свободные ответы сначала переводят в категории. Ниже путь от стопки бланков до строки в третьей главе.
Мы объясняем, как устроена обработка, и показываем расчет. Итоговый выбор критерия и формулировку вывода согласуйте с научным руководителем: требования кафедр различаются.
В двух словах
Перед подробным разбором коротко о том, что происходит со стопкой заполненных бланков по дороге в третью главу. Этого хватит, чтобы понять, какие расчеты вам вообще нужны.
- Ответы сначала кодируют. Каждому варианту дают свой номер, и анкета превращается в таблицу, где строка это один человек, а столбец один вопрос.
- Первый результат это частоты и проценты. Доля считается так: число ответов делят на число опрошенных и умножают на 100.
- Что считать, решает тип шкалы. По вариантам «да» и «нет» берут частоты и модуСамый популярный вариант ответа: тот, который выбрали чаще остальных., по градациям «никогда, иногда, часто» медиану, по суммарному баллу шкалы среднее M ± m.
- Критерий нужен не каждому вопросу. Он появляется там, где вы сравниваете группы или замеры. Для долей это хи-квадрат, а при малых ожидаемых частотах точный критерий Фишера.
- В главу идут три вещи: таблица частот с процентами, рисунок к главному вопросу и фраза с выводом.
Чем анкета отличается от опросника
Слова похожи, а обработка разная, и путаница здесь стоит целой главы.
Опросник. Это готовая методика: чужие вопросы, чужой ключ, часто нормы по возрасту. Ключ сам говорит, какой пункт сколько стоит и в какую шкалу идет, поэтому на выходе сразу получаются баллы.
Анкета. Это собственный набор вопросов под тему конкретной работы. Ключа у нее нет: числа придется завести самому, и от того, как они заведены, зависит все остальное. Как собрать такую анкету, разобрано в материале про составление анкеты.
Отсюда главная ошибка. В опроснике цифра рядом с вариантом это балл, его складывают. В анкете это ярлык, и складывать его бессмысленно: «мужской» и «женский» не дают в среднем «полтора».
Кодировка и сводная таблица
Анкета про мотивацию к занятиям физкультурой. Раздали 64 бланка первокурсникам, вернулись 62, две заполнены наполовину и в обработку не пошли. Осталось 60 анкет: 30 юношей и 30 девушек. В анкете 18 пунктов: 12 шкальных по Лайкерту от 1 до 5, 4 закрытых с выбором одного варианта и 2 открытых.
Числа здесь условные, взяты для примера, зато путь от бланка до фразы в дипломе пройден целиком.
Кодировка. Вариантам одного вопроса раздают номера по порядку и записывают решение отдельным листом:
- Пол: 1 юноша, 2 девушка.
- Спорт в школе: 1 да, 0 нет.
- Частота занятий: 1 реже раза в неделю, 2 один-два раза, 3 три и более.
Лист кодировки нужен не для красоты: через месяц вы сами не вспомните, что значила двойка в седьмом столбце.
Одна строка на человека. Сводную таблицу собирают в Excel или Google Таблицах по жесткому правилу: строка это респондент, столбец это вопрос, клетка это код его ответа. Первым столбцом идет номер анкеты, дальше паспортичка, дальше пункты по порядку.
Фрагмент сводной таблицы анкеты, первые четыре респондента
| № анкеты | Пол | Спорт в школе | Частота занятий | Сумма по шкале |
|---|---|---|---|---|
| 1 | 1 | 1 | 2 | 44 |
| 2 | 2 | 0 | 1 | 37 |
| 3 | 1 | 1 | 3 | 51 |
| 4 | 2 | 0 | 1 | 33 |
Последний столбец собран не из кода, а из баллов: 12 шкальных пунктов дают сумму от 12 до 60, и обратные пункты в ней уже перевернуты по правилу прямых и обратных вопросов.
Пустую клетку не заполняют нулем: ноль это ответ «нет», и он утянет вниз все доли. Пропуск оставляют пустым или помечают отдельным кодом вроде 99, который потом исключают из расчета. Что с ними делать дальше, разобрано в материале про пропуски в данных.
Частоты и проценты по вопросу
Первый настоящий результат обработки это частотаСколько человек выбрали этот вариант ответа. Ее считают по столбцу сводной таблицы простым подсчетом одинаковых кодов. по каждому варианту ответа. В Excel ее дает функция СЧЁТЕСЛИ по столбцу вопроса, в Google Таблицах она называется так же.
Частоту переводят в долю, чтобы результат не зависел от размера выборки:
P = f / N × 100%
P = 27 / 60 × 100% = 45,0%
Здесь f это число выбравших вариант, N число опрошенных. Проценты округляют до десятых и обязательно подписывают базу: от скольких человек считали. Доли по всем вариантам одного закрытого вопроса складываются в 100,0%, и это первая проверка на арифметику.
Частота занятий спортом вне учебных занятий, все опрошенные
| Вариант ответа | f | Доля, % |
|---|---|---|
| Реже раза в неделю | 27 | 45,0 |
| Один-два раза | 21 | 35,0 |
| Три и более | 12 | 20,0 |
| Всего | 60 | 100,0 |
Слева таблица с частотами и долями, справа тот же вопрос столбиками. Почти половина первокурсников занимается реже раза в неделю, и это уже готовый вывод по вопросу, без всякого критерия
После каждой такой таблицы в дипломе идет предложение словами: не «данные представлены в таблице», а «реже раза в неделю занимаются 27 человек, то есть 45,0% опрошенных». Доли и средние сразу по всем столбцам считает калькулятор описательной статистики.
Что считать по каждой шкале
Набор чисел задает не вопрос, а тип шкалы, в которой записан ответ. Классификацию из четырех шкал предложил С. Стивенс в 1946 году, и на нее опираются все методички: разбор с примерами лежит в статье про шкалы измерения.
Что можно посчитать по ответу в зависимости от типа шкалы
| Тип шкалы | Как выглядит в анкете | Что считают | Чего не считают |
|---|---|---|---|
| Номинальная | пол, факультет, «да» и «нет», выбор варианта | частоты, проценты, моду | среднее, медиану |
| Порядковая | «никогда, иногда, часто», «низкий, средний, высокий» | частоты, проценты, медиануСерединное значение: половина опрошенных ответила не выше него, половина не ниже., квартили | среднее по кодам вариантов |
| Суммарный балл шкалы | сумма по нескольким пунктам Лайкерта | среднее M ± m, медиану, разброс | моду отдельного пункта |
| Количественная | возраст, стаж, часы в неделю | среднее M ± m, медиану, квартили | ничего из перечисленного |
Строка про суммарный балл важнее остальных. Отдельный пункт «согласен или нет» это порядок, и среднее по нему спорно, а вот сумма по 12 пунктам ведет себя как измерение, и среднее по ней принято считать. Именно этот спор разбирает материал про обработку шкалы Лайкерта.
Среднее по кодам формально посчитается: Excel сложит коды вопроса про частоту занятий и честно выдаст 1,75. Только это число ничего не измеряет. Перенумеруйте те же три варианта в обратном порядке, и среднее станет 2,25, хотя ни один человек ответ не поменял.
В учебной анкете суммарный балл мотивации у юношей составил 41,3 ± 1,4, у девушек 38,6 ± 1,5 при возможном размахе от 12 до 60. Как оформляют такую запись, показано в разборе того, как описать выборку.
Когда анкете нужен критерий
Критерий нужен не всегда, и это главное, чего не знают на защите. Если задача работы описать группу, хватит частот, процентов и одного предложения на каждый вопрос. Критерий появляется ровно в двух случаях: вы сравниваете две и более группы между собой либо один и тот же человек отвечал дважды.
Для закрытых вопросов сравнение идет по таблице сопряженностиТаблица, где строки это одни категории, столбцы другие, а в клетках стоит количество человек, попавших сразу в обе.: строки это группы, столбцы варианты ответа, в клетках число человек. Как ее собрать, показано в разборе таблицы сопряженности.
Занимались ли спортом в школе, число человек
| Группа | Да | Нет | Всего |
|---|---|---|---|
| Юноши | 22 | 8 | 30 |
| Девушки | 13 | 17 | 30 |
| Всего | 35 | 25 | 60 |
Доля «да» у юношей 73,3%, у девушек 43,3%, разрыв 30 процентных пунктов. Проверяет его критерий хи-квадрат: он сравнивает эти частоты с ожидаемымиСколько человек попало бы в клетку, если бы ответ вообще не зависел от группы., то есть с тем, что получилось бы при полном отсутствии связи.
Ожидаемая частота = итог строки × итог столбца / N
E(юноши, да) = 30 × 35 / 60 = 17,5
Расхождение в каждой клетке: |O − E| = 4,5
(4,5 − 0,5)² = 16
χ² = Σ (|O − E| − 0,5)² / E
χ² = 16 / 17,5 + 16 / 12,5 + 16 / 17,5 + 16 / 12,5 = 4,39
df = (строк − 1) × (столбцов − 1) = 1
Критическое значение при df = 1 и p = 0,05 равно 3,84. Наше χ² = 4,39 больше, значит различия достоверны, точное p = 0,036.
Откуда взялась «минус 0,5». В таблице два на два расхождение в каждой клетке уменьшают на 0,5: это поправка Йейтса на непрерывность, она делает вывод осторожнее. Без нее то же сравнение дает χ² = 5,55 и p = 0,018.
Оба числа верные, это две строки одного расчета: в SPSS одна называется Continuity Correction, другая Pearson Chi-Square. Напишите в работе, какую взяли, иначе числа не сойдутся с расчетом руководителя.
Сила связи V Крамера равна 0,30, нижняя граница средней связи: разрыв реальный, но пол объясняет далеко не все. Ее считают от χ² без поправки, поэтому Йейтс ее не двигает.
- Синие числа: сколько человек в каждой клетке насчитали по анкетам.
- Серые числа: сколько было бы, если бы юноши и девушки отвечали одинаково.
У критерия свое условие применимости, правило Кокрана: в таблице два на два все четыре ожидаемые частоты должны быть не меньше 5. Здесь минимальная равна 12,5, условие выполнено.
Если бы оно нарушилось, вместо хи-квадрата брали бы точный критерий Фишера, а для сравнения одной доли в двух группах годится угловое преобразование Фишера. Выбор критерия по типу шкалы подробно разобран у Е. В. Сидоренко в книге «Методы математической обработки в психологии», издательство «Речь», 2000 год.
Чего расчет не показывает. Хи-квадрат отвечает только на вопрос, связан ли ответ с полом, и ничего не говорит о причине: школьный спорт мог быть доступнее юношам, а мог просто чаще запоминаться. И он растет вместе с выборкой, поэтому рядом всегда приводят силу связи.
Как записать анкету в главе
В третьей главе обработанная анкета занимает три места: таблица с частотами и процентами, рисунок к главному вопросу и фраза с выводом. Перед таблицей в тексте ставят ссылку на нее, после таблицы предложение о том, что из нее видно.
Готовые формулировки, подставьте свои числа:
- «В обработку вошли 60 анкет: 30 юношей и 30 девушек. Две анкеты исключены из-за неполного заполнения».
- «Реже раза в неделю занимаются спортом 27 человек (45,0% опрошенных), один-два раза 21 человек (35,0%), три и более 12 человек (20,0%)».
- «Доля занимавшихся спортом в школе среди юношей составила 73,3%, среди девушек 43,3%; различия достоверны: χ² = 4,39 с поправкой Йейтса, df = 1, p < 0,05».
- «Средний суммарный балл мотивации составил 41,3 ± 1,4 у юношей и 38,6 ± 1,5 у девушек».
- «Ответы на открытые вопросы обработаны методом контент-анализа, распределение по категориям приведено в таблице».
Фраза для диплома: «Доля респондентов, занимавшихся спортом в школе, среди юношей достоверно выше, чем среди девушек: 73,3% против 43,3%. Различия достоверны: χ² = 4,39 с поправкой Йейтса, df = 1, p < 0,05; сила связи средняя, V Крамера 0,30».
Недостоверный результат описывают так же спокойно: «различия между юношами и девушками не достигли уровня достоверности». Остальные формулировки для главы собраны в разборе того, как описать результаты статистики.
Частые ошибки
Считают среднее по кодам вариантов.
«Средний пол 1,50» и «средняя частота занятий 1,75» это числа без смысла: коды заданы произвольно. По номинальным вопросам считайте частоты, проценты и моду.
Проценты без базы.
«Так ответили 40%» непонятно от чего: от всех опрошенных, от ответивших на этот вопрос или от числа упоминаний. В подписи к таблице ставьте n и указывайте, от чего считается доля.
Пропуски заменяют нулями.
Ноль это осмысленный ответ, и он занижает и доли, и средние. Оставляйте клетку пустой и уменьшайте N по этому вопросу.
Критерий считают там, где его не просили.
Одна группа, один замер, описательная задача: сравнивать не с чем, а хи-квадрат все равно посчитан. Оставьте частоты и проценты, а критерий приберегите для сравнения групп.
Хи-квадрат считают по процентам.
Критерий построен на количестве человек, и от подмены частот процентами результат меняется в разы. Переведите проценты обратно в число человек и только потом считайте.
Что делать с неудобной анкетой
Не каждая анкета ложится в схему, и почти на каждую неприятность есть готовый ход.
Вопрос с несколькими ответами. Если разрешали отметить несколько вариантов, каждый вариант заводят отдельным столбцом «выбрал или нет», а доли считают от числа людей. Сумма долей тогда превышает 100,0%, и это подписывают прямо в таблице.
Мало людей в клетке. При выборке в 25-30 человек таблица из шести вариантов дает клетки по два-три человека. Редкие варианты объединяют в одну содержательную категорию до расчета, а не после того, как увидели результат.
Почти все ответили одинаково. Если 95,0% выбрали один вариант, критерий ничего не покажет, да и незачем: такой перекос сам по себе результат, его описывают словами.
Шкала не сошлась. Прежде чем считать сумму по 12 пунктам, проверьте, что они действительно про одно и то же: это делает коэффициент альфа Кронбаха. Требование к надежности авторской шкалы разбирает А. Д. Наследов в пособии «Математические методы психологического исследования», издательство «Речь», 2004 год.
Частые вопросы
Сколько анкет нужно для диплома
Единой нормы нет: в одной методичке порог 30 человек, в другой 50. Для описательной задачи хватает и 30, но для сравнения групп критерием считайте по группам: при 15 анкетах на группу таблица сопряженности почти гарантированно нарушит условие по ожидаемым частотам.
Можно ли обработать анкету в Excel
Да, и для анкеты этого обычно достаточно. Частоты дает СЧЁТЕСЛИ, доли считаются делением, сводные таблицы строят встроенным инструментом. Хи-квадрат в Excel есть в виде функции ХИ2.ТЕСТ, но она возвращает только p, поэтому само χ² и ожидаемые частоты проще взять в калькуляторе хи-квадрата.
Что делать с открытыми вопросами
Их обрабатывают отдельно: читают все ответы, сводят близкие формулировки в 4-7 категорий и дальше считают такие же частоты и проценты. Вся процедура разобрана в отдельном материале про обработку открытых вопросов анкеты.
Нужно ли проверять нормальность распределения
Для частот и процентов нет: хи-квадрат непараметрический, распределение ему не нужно. Проверка понадобится только суммарному баллу шкалы, если вы собираетесь сравнивать группы критерием Стьюдента: тогда сначала идет проверка нормальности.
Как показать результаты анкеты на рисунке
Столбиками по долям для закрытого вопроса и сгруппированными столбиками, когда сравниваете две группы. Круговая диаграмма годится только для одного вопроса с двумя-тремя вариантами: на семи вариантах она нечитаема.
Короткий алгоритм
- Отбракуйте неполные бланки и запишите, сколько анкет вошло в обработку: в примере из 64 розданных осталось 60.
- Составьте лист кодировки и сведите анкеты в таблицу, где строка это человек, а столбец вопрос.
- Посчитайте частоты и доли по каждому вопросу: P = f / N × 100%, округление до десятых, сумма по вариантам 100,0%.
- Возьмите числа по типу шкалы: номинальная дает моду, порядковая медиану, суммарный балл среднее M ± m.
- Подключайте критерий, только если сравниваете группы или замеры, и проверяйте ожидаемые частоты: все четыре клетки от 5.
- Соберите главу: таблица с процентами, рисунок и фраза с выводом. Проверить условия и подобрать критерий поможет база методов.
Если анкета уже собрана, а числа из нее никак не складываются в главу, закажите консультацию: подберем расчет под ваши вопросы и оформим таблицы под требования кафедры.