StatBlank
Практика21 июля 2026·25 мин чтения

Метод экспертных оценок: как провести и обработать

Кого звать в эксперты, сколько их нужно, какую процедуру выбрать — ранжирование, парные сравнения или Дельфи — и как посчитать согласованность и веса. С примером и FAQ.

Андрей Лазарев
Андрей Лазарев
Эксперт по математической статистике, создатель StatBlank

Иногда измерить объект напрямую нечем: нет прибора, нет теста, нет цифры. Тогда «измерительным инструментом» становится человек, который в теме, — эксперт.

Метод экспертных оценок превращает мнения специалистов в числа, с которыми уже можно работать статистически. Разберём, как провести процедуру так, чтобы на защите к ней не было вопросов.

В двух словах

  • Суть метода. Несколько компетентных специалистов оценивают одни и те же объекты по одной процедуре, а вы обрабатываете их оценки количественно.
  • Ключевой шаг обработки — доказать, что эксперты согласны между собой. Для этого считают коэффициент конкордации Кендалла W (калькулятор, подробное руководство).
  • Что идёт в диплом: число экспертов и критерии их отбора, вид процедуры, средние ранги, W с проверкой значимости и итоговый рейтинг с весами.

Без проверки согласованности экспертная оценка — это просто чьи-то мнения. С W и p-значением — уже результат исследования.

Когда метод уместен, а когда нет

Экспертная оценка — не «запасной вариант, когда лень собирать данные». У неё своя ниша.

Метод уместен, когда:

  • Показатель не измеряется прибором. Артистичность выступления, качество урока, техника выполнения упражнения, культура общения тренера.
  • Нужно расставить приоритеты. Какие факторы важнее для успеха, какие проблемы решать первыми, какие качества ключевые для профессии.
  • Оцениваете разработанный продукт. Вы сделали программу, комплекс упражнений, методичку — эксперты оценивают её на пригодность до внедрения.
  • Данных объективно мало. Редкая выборка, новое явление, прогноз — статистики по ним просто нет.

Метод не подходит, когда:

  • Есть прямое измерение. Если время бега можно замерить секундомером, странно спрашивать у тренеров, кто быстрее.
  • Нужен факт, а не суждение. Успеваемость, посещаемость, антропометрия — берите документы и приборы.
  • Экспертов найти негде. Три случайных однокурсника — не эксперты, и на защите это увидят сразу.
Что оцениваем? Можно измеритьприбором? да Метод не нужен:берите прибор нет Нужен факт издокументов? да Берите справки,журналы, замеры нет Есть признанныеспециалисты? нет Метод неприменим:нет экспертов да Экспертная оценка уместна
Нужен ли вам метод экспертных оценок — короткий алгоритм
Осторожно

Самая частая ошибка диплома — назвать «экспертами» научного руководителя и двух знакомых учителей, а потом не описать, почему именно они компетентны. Отбор экспертов надо обосновывать так же строго, как выборку испытуемых.

Сколько нужно экспертов и как их отобрать

Количество. Рабочий минимум для студенческой работы — 5–7 экспертов, комфортный диапазон — 7–15. Меньше пяти — оценка неустойчива: уход одного мнения резко меняет картину. Больше двадцати в дипломе редко нужно и трудно организовать.

Важно: для расчёта конкордации экспертов должно быть минимум три. Если их всего двое, согласованность считают через ранговую корреляцию — Спирмена или Кендалла τ.

Критерии компетентности. В работе нужно перечислить формальные признаки, по которым вы отбирали людей. Обычно берут три-четыре из списка:

  • Стаж работы по профилю — как правило, от 5 лет.
  • Образование и квалификация — профильный диплом, категория, звание, учёная степень.
  • Практический опыт именно с объектом оценки — работал с этой возрастной группой, вёл этот предмет, готовил спортсменов этой квалификации.
  • Публикации или методические разработки по теме — для вузовских экспертов.
  • Отсутствие конфликта интересов — эксперт не оценивает собственную разработку.

Пример формулировки. «В качестве экспертов выступили 7 специалистов: 4 учителя физической культуры высшей категории со стажем от 8 лет и 3 преподавателя кафедры теории и методики физического воспитания (2 кандидата педагогических наук). Все эксперты имеют опыт работы с учащимися среднего школьного возраста».

Самооценка компетентности. Продвинутый вариант — попросить эксперта оценить свою осведомлённость по теме от 0 до 1 и посчитать средний коэффициент компетентности группы. Не обязательно, но на защите выглядит солидно.

Виды процедур: что предложить эксперту

Процедура — это то, что физически делает эксперт с вашим списком. Она задаёт всю дальнейшую математику: под каждую форму ответа заточен свой калькулятор, и перескочить с одной на другую после сбора данных уже нельзя. Поэтому форму опроса выбирают заранее, под тот вопрос, на который отвечает работа.

Ранжирование. Эксперт расставляет объекты по местам: 1 — самый важный, n — наименее важный. Самая частая процедура в дипломах: понятна, быстро заполняется и сразу даёт материал для согласия. Оптимально 5–15 объектов, каждое место — только один раз. Согласие трёх и более экспертов меряют коэффициентом конкордации Кендалла (W); если экспертов ровно двое — ранговой корреляцией Спирмена или Кендалла τ.

Оценка баллами по шкале. Эксперт ставит каждому объекту балл — от 1 до 5 или до 10. Просто и быстро, когда объектов много, и, в отличие от рангов, сохраняет «силу» оценки: между 2 и 5 видно расстояние. Дальше два разных вопроса. Если нужны веса и рейтинг объектов — это метод непосредственной оценки, где согласие оценивают через разброс баллов. Если же балл — это измерение (эксперт работает как «прибор», и важно, насколько его показания воспроизводимы), берут внутриклассовую корреляцию (ICC).

Парное сравнение. Объекты показывают по два — и здесь развилка по тому, что именно спрашивают. Если только «какой из двух важнее» — это классический метод парных сравнений: из ответов строится матрица предпочтений и итоговый порядок. Если эксперт ещё и указывает интенсивность («важнее в 3 раза») по шкале 1–9 — это метод анализа иерархий Саати: он даёт веса в долях и проверяет логичность самих сравнений. Точнее ранжирования, но число пар растёт быстро: для 10 объектов их уже 45.

Отнесение к категориям. Эксперт не ранжирует, а навешивает метку: «годен / не годен», «низкий / средний / высокий», диагноз, тип. Порядка между объектами тут нет, поэтому и ранги, и корреляция бессмысленны — согласие меряют семейством каппа-коэффициентов. Какой именно взять, зависит от числа экспертов и наличия порядка между категориями (разбор — в следующем разделе).

Оценка с пропусками. Житейская ситуация: часть экспертов оценила не все объекты — кто-то пропустил незнакомое, кто-то не дошёл до конца. Большинство методов такую таблицу просто не примет. Альфа Криппендорфа — единственный, кто штатно работает с дырами и с любой шкалой (номинальной, порядковой, числовой), поэтому его держат как универсальный запасной вариант.

Метод Дельфи — надстройка, а не отдельная форма. Дельфи не заменяет ранжирование или баллы, а оборачивает любую из этих форм в несколько туров: эксперты оценивают анонимно, видят обобщённый результат тура и оценивают заново, зная мнение группы. Обычно хватает 2–3 туров. Цель — сблизить позиции без давления авторитетов. В дипломе показывают рост согласия по турам — например, W с 0,42 до 0,78; посчитать сходимость помогает калькулятор метода Дельфи.

Разброс оценок сужается, согласие растёт 1-й тур W = 0,42 2-й тур W = 0,63 3-й тур W = 0,78
Метод Дельфи: разброс мнений сужается от тура к туру

Какую процедуру опроса выбрать

Процедура Что делает эксперт Когда брать
Ранжирование Расставляет по местам 1…n Объектов 5–15, нужен приоритет — самый частый случай в дипломах
Оценка баллами Ставит балл каждому Объектов много, важна «сила» оценки, а не только порядок
Парное сравнение Сравнивает по два Объектов мало, нужна точность
Категории Навешивает метку Оценка качественная: «годен / не годен», тип, уровень
Дельфи Оценивает в 2–3 тура Тема спорная, с первого раза согласия не ждёшь
Совет

Если сомневаетесь — берите ранжирование. Оно понятно эксперту, быстро заполняется и даёт готовый материал для расчёта конкордации.

Как составить анкету эксперта

Анкета эксперта — не то же самое, что анкета респондента. Здесь важна не искренность, а точность инструкции. Общие правила составления опросников разобраны в статье «Как составить анкету», а специфика экспертной такая:

  1. Шапка с данными эксперта — ФИО (или код), должность, стаж, категория, степень. Это доказательство компетентности, оно идёт в приложение.
  2. Короткое пояснение цели — что за объекты и зачем их оценивать. Два-три предложения без теории.
  3. Однозначная инструкция. «Расставьте 6 факторов по степени важности: 1 — самый важный, 6 — наименее важный. Каждый номер используйте только один раз».
  4. Список объектов с местом для ранга — таблицей, а не сплошным текстом.
  5. Поле для комментария — эксперт может дописать фактор, который вы забыли. Это ценно для обсуждения результатов.
  6. Дата и подпись — если оценка идёт в приложение как документ.
Важно

Прямо запретите одинаковые места («не ставьте два первых места»). Связанные ранги не смертельны — их можно обработать с поправкой, — но они усложняют расчёт и снижают W.

Чем считать: развилка по форме ответов

Форма, в которой эксперты дали ответы, жёстко определяет математику. Ранги нельзя обработать формулой для категорий — там нет порядка; баллы нельзя свести к рангам без потери величины различий. Поэтому выбирать метод обработки не нужно: он уже выбран за вас тем, как вы задали вопрос.

Подбор метода за 2–3 вопроса

В какой форме эксперты дали ответы?

Форма ответов жёстко определяет расчёт: ранги нельзя обработать формулой для категорий, и наоборот.

Расставил по местамранжирование Поставил баллыпо шкале Сравнил попарно+ во сколько раз (1–9) Сравнил попарнотолько «кто лучше» Отнёс к категориямметки, классы Оценил не всехв таблице пропуски Конкордация Кендалла (W) Непосредственная оценка / ICC Метод Саати (AHP) Метод парных сравнений Каппы: Коэна, Флейса, взвешенная Альфа Криппендорфа
Какой метод под какую форму ответов
Как эксперты отвечали Чем считать
Расставили по местам, экспертов 3+ Коэффициент конкордации Кендалла (W)
Расставили по местам, экспертов ровно 2 Корреляция Спирмена или Кендалла τ
Поставили баллы — нужны веса объектов Метод непосредственной оценки
Поставили баллы — нужна надёжность измерения Внутриклассовая корреляция (ICC)
Сравнивали попарно и указывали, во сколько раз Метод анализа иерархий Саати
Сравнивали попарно, только «кто лучше» Метод парных сравнений
Категории, экспертов 2, порядка между ними нет Каппа Коэна
Категории упорядочены («низкий — средний — высокий») Взвешенная каппа Коэна
Категории, экспертов 3 и больше Каппа Флейса
В таблице есть пропуски — оценили не всех Альфа Криппендорфа
Опрос шёл в несколько туров Метод Дельфи: сходимость
Надо доказать компетентность самих экспертов Коэффициент компетентности

Какой показатель согласия выбрать

Развилка выше приводит к конкретному калькулятору, но за каждым стоит свой показатель и своя логика чтения. Ниже — коротко, что даёт каждый метод. Конкордацию, каппу Коэна, коэффициент компетентности и Дельфи мы уже разобрали, поэтому здесь только остальные.

Метод анализа иерархий (Саати). Попарные сравнения с интенсивностью 1–9. На выходе — веса объектов в долях (сумма равна 1) и отношение согласованности CR: если CR ≤ 0,10, сравнения непротиворечивы; выше — эксперт где-то сам себе противоречит, и матрицу пересобирают. Берут, когда нужны обоснованные веса критериев и защита от нелогичных суждений.

Пример. В дипломе по менеджменту эксперт сравнивал критерии выбора поставщика: «цена важнее сроков умеренно» — это 3, «качество важнее цены сильно» — 7. Метод выдал веса и проверил, что оценки не противоречат друг другу.

🧮Калькулятор метода СаатиВведите парные сравнения — получите веса и проверку согласованности

Метод парных сравнений. Тот же попарный опрос, но без интенсивности — только «кто лучше». Проще для эксперта; на выходе веса объектов и подсветка противоречивых троек (A > B, B > C, но C > A). Берут, когда объектов немного, а оценить «во сколько раз» эксперт не берётся.

Пример. В работе по профориентации восемь педагогов сравнивали пять качеств будущего инженера попарно — «что важнее: усидчивость или пространственное мышление?». Метод собрал ответы в рейтинг и нашёл двух экспертов, кто себе противоречил.

🧮Калькулятор парных сравненийМатрица предпочтений → веса объектов и поиск противоречий

Метод непосредственной оценки. Эксперты выставляют баллы, метод переводит их в веса объектов и проверяет согласие через коэффициент вариации по каждому объекту: маленький разброс — эксперты единодушны, большой — мнения расходятся. Берут, когда важна «сила» оценки, а не только порядок.

Пример. В дипломе по физической культуре семь тренеров оценивали важность физических качеств для юного пловца по 10-балльной шкале. Выносливость получила 9,1 при разбросе 6 % — тренеры единодушны; гибкость 5,4 при разбросе 34 % — мнения разошлись, и это отдельно отметили в выводах.

🧮Калькулятор непосредственной оценкиБаллы экспертов → веса объектов и коэффициент вариации

Внутриклассовая корреляция (ICC). Для случая, когда эксперт — измерительный инструмент, а оценка — число (баллы техники, секунды, миллиметры). ICC от 0 до 1 показывает, какая доля разброса объясняется реальными различиями объектов, а не расхождением экспертов; читается примерно как каппа. Берут, чтобы доказать надёжность методики измерения.

Пример. В работе по спортивной гимнастике три судьи выставляли баллы за технику прыжка у 15 спортсменов. ICC = 0,86 доказал, что судейство надёжно, а не зависит от того, кто именно судит.

🧮Калькулятор внутриклассовой корреляции (ICC)Числовые оценки экспертов → надёжность измерения

Каппа Флейса. То же, что каппа Коэна, но для трёх и более экспертов, оценивающих по категориям без порядка. Даёт один κ на всю группу с поправкой на случайные совпадения. Берут, когда судей больше двух, а метки неупорядочены (тип, диагноз, «годен / не годен»).

Пример. В логопедическом дипломе три специалиста относили нарушения речи 40 детей к типам (дислалия, дизартрия, ринолалия). Каппа Флейса показала, насколько согласованно они ставят диагноз по одним и тем же критериям.

🧮Калькулятор каппы ФлейсаСогласие трёх и более экспертов по категориям

Взвешенная каппа Коэна. Для двух экспертов и упорядоченных категорий («низкий — средний — высокий»). В отличие от обычной каппы, учитывает величину расхождения: спутать «низкий» с «высоким» хуже, чем с «средним», и штраф за это больше. Берут для порядковых шкал, где промах на одну ступень не так страшен.

Пример. В психологическом дипломе два эксперта оценивали уровень тревожности учеников как низкий, средний или высокий. Взвешенная каппа не наказывала за расхождение «средний против высокого» так же строго, как за «низкий против высокого».

🧮Калькулятор взвешенной каппы КоэнаУпорядоченные категории с учётом величины расхождения

Альфа Криппендорфа. Самый гибкий показатель: любое число экспертов, любая шкала и — главное — допускаются пропуски в таблице. Значение читается как каппа. Берут, когда данные неполные или когда хочется один универсальный коэффициент на разные типы шкал.

Пример. В контент-анализе сочинений часть работ проверил один эксперт, часть — другой, и лишь треть — оба. Из-за пропусков каппа не считается, а альфа Криппендорфа справилась с неполной таблицей.

🧮Калькулятор альфы КриппендорфаЛюбая шкала и любое число экспертов, допускает пропуски

Показатели κ, W, ICC и α измеряются в одной шкале от 0 до 1 и читаются по близким порогам — примерно так:

Согласие экспертов: W, каппа, ICC, α слабое умеренное хорошее почти полное 00,40,60,81,0 ниже 0,4 — согласия по сути нет: процедуру пересматривают или проводят ещё тур
Шкала согласия экспертов: как трактовать значения

Саати и парные сравнения легко перепутать — оба про «попарно», но отличаются глубиной вопроса:

Саати и парные сравнения: в чём разница

Парные сравнения Метод Саати (AHP)
Вопрос эксперту Кто из двух лучше Лучше и во сколько раз (1–9)
Сложность для эксперта Ниже Выше
Результат Порядок и веса Веса в долях
Контроль логики Противоречивые тройки Отношение согласованности CR
Когда брать Быстрый приоритет Обоснованные веса критериев

Как обработать результаты: пример с числами

Разберём типичный сюжет. Пять экспертов ранжировали шесть факторов успешности внедрения оздоровительной программы в школе.

Ранги шести факторов от пяти экспертов и суммы мест

Фактор Э1 Э2 Э3 Э4 Э5 Сумма Rᵢ Средний ранг
Материальная база 4 3 4 5 4 20 4,0
Квалификация педагога 1 2 1 1 2 7 1,4
Мотивация учащихся 2 1 2 2 1 8 1,6
Поддержка родителей 5 5 3 4 5 22 4,4
Объём часов в расписании 3 4 5 3 3 18 3,6
Медико-педагогический контроль 6 6 6 6 6 30 6,0

Шаг 1. Суммы и средние ранги

Складываем ранги по строкам — это суммы Rᵢ. Контроль: общая сумма должна равняться m·n·(n + 1)/2 = 5·6·7/2 = 105. У нас 20 + 7 + 8 + 22 + 18 + 30 = 105, всё сошлось.

Чем меньше сумма — тем важнее фактор. Итоговый рейтинг: квалификация педагога (7) → мотивация учащихся (8) → объём часов (18) → материальная база (20) → поддержка родителей (22) → медико-педагогический контроль (30).

Шаг 2. Согласованность: коэффициент конкордации W

Средняя сумма рангов = 105 / 6 = 17,5. Отклонения каждой суммы от неё: 2,5; −10,5; −9,5; 4,5; 0,5; 12,5. Сумма их квадратов S = 383,5.

W = 12·S / [m²·(n³ − n)] = 12·383,5 / [25·(216 − 6)] = 4602 / 5250 ≈ 0,88.

Проверяем значимость через хи-квадрат: χ² = m·(n − 1)·W = 5·5·0,88 ≈ 21,9 при df = 5. Критическое значение для p = 0,05 равно 11,07, наше больше — согласованность статистически значима (p < 0,01).

Механику расчёта и все нюансы со связанными рангами подробно разбирает статья «Коэффициент конкордации Кендалла», а посчитать свою матрицу можно в калькуляторе конкордации.

Вывод

W = 0,88 — согласие сильное. Значит, рейтинг факторов не случаен, на него можно опираться в выводах и практических рекомендациях.

Шаг 3. Весовые коэффициенты

Если нужно не просто расставить факторы, а показать их «вклад» в долях, ранги переводят в баллы: балл = (n + 1) − ранг. Затем сумму баллов фактора делят на общую сумму баллов (у нас тоже 105).

Весовые коэффициенты факторов

Фактор Сумма баллов Вес wᵢ
Квалификация педагога 28 0,27
Мотивация учащихся 27 0,26
Объём часов в расписании 17 0,16
Материальная база 15 0,14
Поддержка родителей 13 0,12
Медико-педагогический контроль 5 0,05

Сумма весов равна 1,00 — это удобная проверка. Теперь можно сказать: два ведущих фактора забирают больше половины общего веса (0,53).

1. Отборэкспертов 2. Анкетаи процедура 3. Сбороценок 4. Проверкасогласия(W, p) 5. Рейтинг,весаи выводы низкий W — назад к шагу 3 (ещё один тур Дельфи)
Пять этапов метода экспертных оценок

Что писать в дипломе

Экспертная оценка описывается в двух местах: в методах — процедура, в результатах — цифры. Готовые формулировки:

  • «Для определения значимости факторов применялся метод экспертных оценок. В опросе приняли участие 5 экспертов — учителей физической культуры со стажем работы от 8 лет. Экспертам предлагалось проранжировать 6 факторов по степени важности».
  • «Согласованность мнений экспертов оценивалась коэффициентом конкордации Кендалла: W = 0,88 при χ² = 21,9; df = 5; p < 0,01, что свидетельствует о статистически значимой согласованности оценок».
  • «По результатам ранжирования наиболее значимыми признаны квалификация педагога (средний ранг 1,4; весовой коэффициент 0,27) и мотивация учащихся (1,6; 0,26)».
  • «Полученный экспертный рейтинг положен в основу практических рекомендаций (глава 3)».

В приложение выносят бланк анкеты эксперта, список экспертов с их квалификацией и сводную матрицу рангов.

Частые ошибки

  • Не проверили согласованность. Средние ранги без W — половина работы; рецензент спросит, а согласны ли эксперты вообще.Посчитайте коэффициент конкордации W и проверьте его значимость по хи-квадрату.
  • Мало экспертов. Трое — формальный минимум для расчёта, но выводы на них шаткие.Привлеките 5–7 специалистов разного места работы, чтобы мнение не было цеховым.
  • Не обосновали компетентность. Нет стажа, категории, профиля — нет доказательства, что это эксперты.Приведите таблицу экспертов со стажем и квалификацией, вынесите её в приложение.
  • Список объектов слишком длинный. 25 факторов человек не ранжирует осмысленно: последние места он расставит наугад.Сократите список до 7–10 объектов или сгруппируйте близкие факторы.
  • Спутали согласие с истиной. Высокий W означает единодушие экспертов, а не их правоту.Подкрепите экспертный рейтинг объективными данными, где они есть.

Частые вопросы

Можно ли брать в эксперты студентов старших курсов?

Как правило, нет — у них нет практического стажа. Исключение: если объект оценки — сама студенческая среда (удобство расписания, качество методички), тогда они носители опыта, но назвать их лучше «респондентами», а процедуру — групповым ранжированием.

Что делать, если W получился низким?

Низкий и незначимый W — это тоже результат, который честно описывают: единого мнения нет. Дальше два пути: провести второй тур по методу Дельфи, показав экспертам обобщённые результаты, либо разобрать причину расхождений (например, эксперты из разных сфер оценивают по-разному) и описать её в обсуждении.

Нужно ли считать конкордацию, если эксперты ставили баллы, а не места?

Да, но сначала баллы каждого эксперта переводят в ранги внутри его собственного столбца. Как это делается, разобрано в статье «Ранжирование данных». Калькулятор делает такой перевод автоматически.

Метод Дельфи обязателен?

Нет. Для дипломной работы обычно достаточно одного тура ранжирования с расчётом W. Дельфи берут, когда согласия с первого раза не получилось или когда тема прогнозная и мнения заведомо разойдутся.

Экспертная оценка — это качественный или количественный метод?

Это количественная обработка качественных суждений. В методах его так и описывают: «метод экспертных оценок с последующей математико-статистической обработкой (коэффициент конкордации Кендалла)».

Короткий алгоритм

  1. Убедитесь, что показатель нельзя измерить напрямую, — иначе метод не нужен.
  2. Отберите 5–7 экспертов и запишите критерии их компетентности.
  3. Выберите процедуру: чаще всего это ранжирование 5–15 объектов.
  4. Составьте анкету с однозначной инструкцией и шапкой о квалификации эксперта.
  5. Сведите ответы в матрицу «объекты × эксперты», посчитайте суммы и средние ранги.
  6. Посчитайте W и проверьте значимость — калькулятор конкордации или загрузка файла в автоподбор анализа.
  7. При значимом W постройте рейтинг и веса, опишите результат формулировками из раздела выше.

Что ещё почитать

Если экспертные ранги уже собраны, а считать их некогда — загляните в базу методов или закажите консультацию: подберём процедуру обработки и посчитаем согласованность за вас.

Не хотите разбираться со статистикой сами?

Эксперт подберёт метод, посчитает и оформит таблицы по ГОСТ под вашу тему.