
Если вы читали книгу или смотрели фильм «Автостопом по галактике», то, конечно, помните, какой универсальный ответ дал мегасуперкомпьютер Думатель на «основной вопрос о жизни, вселенной и вообще»: 42. Ответ-то есть. Но, к сожалению, без четко сформулированного вопроса он является бессмысленным, абстрактным.
Мне кажется, этот сюжет отлично описывает ситуацию, когда исследователь, не задумываясь, применяет какой-то статистический метод к решению задачи. И получает универсальный ответ, например, различия статистически значимы. И этот ответ, хотя, конечно, существенно более земной и понятный, чем 42, но всё-таки требует конкретизации. Различия чего? Средних? Медиан? Дисперсий? К какому эффекту относится универсальное выражение p<0.05? Как звучит вопрос, на который мы получили этот ответ?
Это была присказка.
А мы продолжаем на удивление хайповую тему выбора статистических методов. Многое уже сказано, многое обсуждено. В серии постов я покажу еще несколько примеров, в которых разные критерии, применяемые к одним и тем же данным, ведут к противоположным результатам. Либо эти результаты могут выглядеть странными, неожиданными для читателя. И в таких случаях критически важно понимать, на какой вопрос мы ищем ответ, чтобы выбрать правильное решение и дать верную интерпретацию.
1) Итак, первый пример. Известно, что t-тест Стьюдента довольно устойчив к асимметрии выборки, но только в случаях, когда в обеих группах асимметрия имеет одно и то же направление: правосторонняя (чаще встречаются значения ниже среднего значения) или левосторонняя (чаще встречаются значения выше среднего).
А что произойдет, если асимметрия будет разнонаправленной?
На рисунке вы видите пирамидальную диаграмму, которая состоит из 2 гистограмм, соответствующих распределению количественного признака в 2 группах. Диаграмма наглядно показывает, что признак имеет разную асимметрию: в 1-й группе правосторонняя (чаще встречаются низкие значения), во 2-й группе — левосторонняя (чаще встречаются высокие значения).
При этом средние значения оказались практически одинаковыми: в первой группе 5.01, а во второй — 4.99. Разность средних составляет ничтожные 0.02. И если мы будем сравнивать средние значения с помощью t-критерия Стьюдента, то, конечно, различия будут статистически незначимыми: p=0.904.
Однако медианы оказались друг от друга на достаточно большом расстоянии: в первой группе — 4, во второй — 6. Также наблюдаются отличия нижнего и верхнего квартилей: 2 и 7 в первой группе, а во второй группе выше на единицу: 3 и 8, соответственно.
Используем тест Манна-Уитни для сравнения. И получаем статистически значимую разницу: p=0.045.
То есть:
различия средних значений признака являются статистически незначимыми,
но:
вероятность более высоких значений во второй группе статистически значимо выше, чем в первой группе (в каждой случайно выбранной паре).
Второй вывод выглядит вполне логично, если интерпретировать асимметрию распределения как преобладание значений ниже среднего в первой группе и преобладание значений выше среднего во второй группе. Представим, что 5 — это условное референсное (нормальное) значение показателя. Тогда в первой группе чаще встречаются значения ниже нормы, во второй — выше нормы. Конечно, такой вывод может быть очень интересен для клиницистов!
А если референсный диапазон значений был широким и включал все наблюдаемые значения? Тогда факт того, что в одной из групп чаще встречаются значения ниже 5, а в другой — выше 5, может не иметь существенного клинического значения. Все значения находятся в пределах нормы. И нас вполне может устроить вывод о том, что средний уровень показателя сопоставим.
Главное, делая вывод о значимости/незначимости, хорошо где-то обозначить, о каких именно различиях идет речь. На какой вопрос получен этот ответ.

2) Однажды ко мне обратились с вопросом: медианы показателя оказались равны, а критерий Манна-Уитни показал наличие статистически значимых различий. Научный руководитель требует пересчета. Может ли вообще такое быть?
Ответ: конечно, может! Этот критерий в общем случае не сравнивает медианы (только в некоторых частных может быть рассмотрена такая гипотеза). Поэтому мы можем получить такую ситуацию, как на этом рисунке.
Вновь перед нами диаграмма распределения признака в 2 группах. Мы видим, что группы, как и в первом примере, имеют разнонаправленную асимметрию: в группе А она левосторонняя, в группе В — правосторонняя. Группы заметно смещены друг относительно друга, однако их моды совпадают: чаще всего в обеих группах встречается значение 6.
При таком асимметричном распределении, как на рисунке, медиана находится возле моды — самой высокой точки, пика линии распределения. И в этом примере обе медианы тоже равны 6. Будет ли статистически значимым результат сравнения при использовании t-теста и критерия Манна-Уитни?
В этом случае оба критерия показали статистическую значимость различий. P<0.001 для t-теста и p=0.002 для критерия Манна-Уитни. Результаты для t-теста, сравнивающего средние значения, выглядят вполне логично. Средние действительно разные: 5 — в группе А, 7 — в группе В, разность составила 2.
А вот для тех, кто считает, что критерий Манна-Уитни сравнивает медианы, результат будет выглядеть противоречивым. Как так — медианы равны между собой, а p<0.05?
Но если вспомнить вопрос, на который отвечает этот критерий, статистически значимые различия нас не удивят.
Все логично: вероятность более высоких значений в группе В наглядно выше, чем в группе А.

3) Рассмотрим очередной пример нестандартного применения статистических методов.
Итак, ситуация: вновь две группы, вновь сравниваем количественный признак. Вот только распределение у него в группах разное: в группе А — бимодальное распределение (то есть две моды: чаще других встречаются низкие значения и высокие значения), в группе В — симметричное, близкое к нормальному.
Средние значения и медианы в обеих группах одинаковы и равны 4. Вероятность более высоких значений, как и более низких в группах одинакова. Поэтому и t-тест Стьюдента, и тест Манна-Уитни не показывают наличие различий: p=1.0 в обоих случаях.
Готовы ли мы признать, что различий между группами нет? Не готовы. Это важно с точки зрения клиники. Предположим, что средний уровень 4 — условная норма показателя. Тогда в группе А часто встречаются значения ниже и выше нормы, а в группе В — у большинства пациентов значения нормальные или близкие к норме.
Что же разное у этих групп? Форма распределения. Есть ли критерии, которые проверяют гипотезу о равенстве формы распределения?
Есть. Один из них — двухвыборочный критерий Колмогорова-Смирнова. Его нулевая гипотеза состоит в том, что обе выборки исходят из одной генеральной совокупности, то есть функции распределения равны.
Сравнив наши группы с помощью критерия Колмогорова-Смирнова, мы получили p=0.012. Это означает, что между распределениями групп А и B наблюдаются статистически значимые различия.
Конечно, далее следует изучить, чем обусловлены эти различия. В случае бимодального распределения в первую очередь следует предположить влияние бинарного фактора (например, пола: у женщин показатель рос, у мужчин снижался). В любом случае, мы не сделаем неверного вывода о сопоставимости групп и получим основания для дальнейшего поиска.

4) Продолжаем разбор ситуаций, где в зависимости от проверяемой нулевой гипотезы можно получить разные результаты анализа.
Итак, перед нами график, на котором сопоставлены значения двух количественных показателей: X и Y. Мы видим, что с увеличением X (значения на горизонтальной оси) значения Y также увеличивается, причем со стремительно возрастающей скоростью. Такой рост показателя называется экспоненциальным.
Есть ли у нас сомнения в наличии прямой корреляционной связи между X и Y? То есть такой, где увеличение X сопровождается увеличением Y? Конечно, нет.
Коэффициент ранговой корреляции Спирмена ожидаемо демонстрирует очень высокое, близкое к 1 значение: 0.998, при p<0.001. Это понятно, ведь коэффициент Спирмена тестирует нулевую гипотезу об отсутствии монотонной связи между переменными. Монотонность в данном случае означает, что связь имеет неизменное направление. При этом неважно, насколько изменится одна переменная при увеличении другой. Главное, чтобы она все время либо увеличивалась (положительная / прямая связь), либо уменьшалась (отрицательная / обратная связь).
А вот результаты оценки корреляции с помощью коэффициента Пирсона получились совсем другие: значение коэффициента составило всего 0.351, а p оказалось существенно выше 0.05, то есть связь — статистически незначима.
Причина этого в том, что коэффициент корреляции Пирсона проверяет гипотезу об отсутствии линейной связи. Линейная связь — частный случай монотонной связи, для которой важно, что изменения Y при равномерном увеличении X происходят с одной и той же скоростью. Например, если X увеличится с 1 до 2 или с 2 до 3, то Y в обоих случаях должен увеличиться на одно и то же число.
Получается, что перед нами — монотонная положительная связь, однако при этом она нелинейная.
Выбор метода оценки корреляционной связи зависит от исследовательского вопроса:
📍Если нам достаточно вывода о том, что при увеличении одного показателя другой показатель все время либо увеличивается, либо уменьшается, причем неважно на сколько, тогда нам следует использовать коэффициент корреляции Спирмена.
📍А если мы хотим понять, является ли связь линейной, то есть при увеличении X на одно и то же число Y будет все время либо увеличиваться, либо уменьшаться на одно и то же число, тогда нам следует использовать коэффициент корреляции Пирсона.
Конечно, это может быть отражено в тексте описания результатов.
Например, в статье M.Gargett и соавт.(2019), указано, что:
A monotonically increasing correlation (Spearman’s rho 0.771, p = 0.002) between the degree of PTV size reduction and motion vector magnitude was observed.
А в статье Stijn Denissen и соавт. (2022), где использовался коэффициент корреляции Пирсона, представлен такой комментарий к диаграмме, иллюстрирующей связь:
Figure displays the relationship between PC1 and brain age, revealing a strong
linear relationship
(
r
= 0.93,
p
< 0.001).
Добавить комментарий