Часть VII · Случай и данные Глава 49 из 60
Статистика
Пять газетных заголовков — пять разборов. Средняя зарплата, опрос с погрешностью в три процента, «доказанное» лекарство, шоколад и Нобелевские премии, приём в университет: учимся судить о целом по выборке и не обманывать себя.
Опирается на: 48 · Случайные величины
Вы научитесь
- отличать среднее от медианы и понимать, на какой вопрос отвечает каждое
- считать стандартную ошибку и доверительный интервал и читать «плюс-минус три процента»
- понимать, что говорит p-значение и почему двадцать проверок рождают ложное открытие
- видеть за корреляцией регрессию к среднему и вмешивающиеся факторы, а за общими процентами — парадокс Симпсона
Прошлая глава закончилась обещанием: по выборке можно судить о целом. Закон больших чисел гарантирует, что среднее многих независимых наблюдений оказывается близко к математическому ожиданию, а центральная предельная теорема уточняет, как именно оно колеблется вокруг него. Осталось научиться пользоваться этими теоремами так, чтобы не обмануть себя.
Это труднее, чем кажется. «Первый принцип — не обманывать себя, а себя обмануть легче всего», — говорил Ричард Фейнман выпускникам Калтеха в 1974 году. Марк Твен приписывал британскому премьер-министру Бенджамину Дизраэли фразу о трёх видах лжи: «ложь, наглая ложь и статистика». В речах и книгах Дизраэли её так и не нашли, но фраза живёт, потому что каждый видел, как верными числами подпирают неверные выводы.
Глава устроена как передача о разрушителях мифов. У нас пять газетных заголовков. Они придуманы, но каждый вы встречали в десятках вариантов, а за двумя последними стоят настоящие истории. За каждым заголовком мы найдём число, на котором он держится, выясним, что это число на самом деле говорит, и возьмём у математической статистики инструмент, чтобы проверить миф.
Средняя температура по больнице
В компании «Ромашка» средняя зарплата — 145 тысяч рублей в месяц, и за год она выросла на 10 %
Заглянем в ведомость. В «Ромашке» десять человек. Девять сотрудников получают (в тысячах рублей) $40$, $42$, $45$, $48$, $50$, $52$, $55$, $58$ и $60$, директор — $1000$. Сумма $1450$, делим на десять — ровно $145$. Заголовок не врёт. Но никто в компании не получает ничего похожего на $145$ тысяч: девять человек получают не больше $60$, а директор — почти всемеро больше этого среднего.
Теперь вторая половина заголовка. За год директор поднял себе оклад до $1145$ тысяч, остальным не прибавили ни рубля. Сумма стала $1595$, среднее — $159{,}5$, ровно на $10$ % больше прежнего. И опять заголовок честен, хотя девяти сотрудникам из десяти от этого роста не досталось ничего. Так и средняя температура по больнице бывает нормальной, когда у половины пациентов жар, а другая половина остыла навсегда.
Среднее арифметическое $\bar x = \frac{x_1 + \dots + x_n}{n}$ отвечает на вопрос, сколько досталось бы каждому, если бы всё поделили поровну. На вопрос «сколько получает обычный сотрудник» отвечает другое число.
Медиана набора чисел — число посередине: если выписать числа по возрастанию, при нечётном их количестве это средний элемент, при чётном — полусумма двух средних. Строго левее медианы лежит не больше половины чисел, и строго правее — тоже не больше половины.
С медианой треугольника из главы 17 у неё общего немного: та делит пополам площадь треугольника, эта — список чисел. В «Ромашке» медиана — полусумма пятого и шестого чисел, $(50 + 52)/2 = 51$. Директор может поднять себе оклад хоть до миллиарда, медиана не шелохнётся: директор как стоял в списке последним, так и стоит. Статистики называют такое свойство устойчивостью. Одно дикое значение не может увести медиану далеко, а среднее уводит куда угодно. Есть старая шутка: когда в бар заходит Билл Гейтс, средний посетитель бара становится миллиардером.
Поэтому о доходах разумнее спрашивать медиану. Росстат, например, публикует и среднюю, и медианную зарплату, и медианная заметно ниже: распределение доходов, как и в «Ромашке», вытянуто вправо, и немногие большие зарплаты тянут среднее вверх.
Среднее и медиана по-разному уравновешивают данные. Положим одинаковые грузики на лёгкую доску в точках $x_1, \dots, x_n$ и подставим опору в точке $c$. Грузик в точке $x_i$ поворачивает доску с силой, пропорциональной плечу $x_i - c$, и доска наклоняется в сторону, куда указывает знак суммы $\sum (x_i - c)$. Эта сумма равна нулю ровно при $c = \bar x$, потому что $\sum (x_i - \bar x) = \sum x_i - n\bar x = 0$. Среднее — точка равновесия, центр масс грузиков. Медиану же находит голосование: опора стоит на медиане, когда грузиков слева и справа поровну, как бы далеко они ни лежали.
Есть и другой взгляд на эти два числа. Пусть весь набор нужно представить одним числом $c$, и за каждое $x_i$ мы платим штраф за промах. Если штраф равен расстоянию $|x_i - c|$, лучший выбор — медиана. Если он растёт как квадрат расстояния, лучший выбор — среднее. Докажем оба утверждения.
Для чисел $x_1 \le x_2 \le \dots \le x_n$ сумма расстояний $S(c) = |x_1 - c| + \dots + |x_n - c|$ наименьшая, когда $c$ — медиана. При нечётном $n$ минимум достигается только в медиане, при чётном — в любой точке отрезка между двумя средними числами.
Хитрость в том, чтобы проследить, как меняется сумма, когда $c$ чуть-чуть сдвигается.
Для любых чисел $x_1, \dots, x_n$ со средним $\bar x$ и любого числа $c$
$$\sum_{i=1}^n (x_i - c)^2 = \sum_{i=1}^n (x_i - \bar x)^2 + n\,(\bar x - c)^2.$$
Поэтому сумма квадратов отклонений от $c$ наименьшая при $c = \bar x$, и только при нём.
Хитрость в том, чтобы увидеть в наборе из $n$ чисел одну точку $n$-мерного пространства. Для двух чисел это обычная плоскость.
Какую цену промаха выбрать, решает задача, а не математика. Но с квадратами проще считать: у суммы квадратов есть формулы вроде только что доказанной, а у суммы модулей их нет. Поэтому классическая статистика стоит на среднем и квадратах отклонений, и из тех же квадратов строится мера разброса. Она нужна: средняя зарплата $50$ тысяч бывает и в компании, где все получают от $48$ до $52$, и там, где половина получает $10$, а половина — $90$.
Выборочное стандартное отклонение чисел $x_1, \dots, x_n$ — число $s \ge 0$, квадрат которого, выборочная дисперсия $s^2$, равен сумме квадратов отклонений от среднего, делённой на $n - 1$.
Найдите выборочное стандартное отклонение чисел $3$, $7$, $7$, $9$, $14$.
Среднее $\bar x = 40/5 = 8$. Отклонения: $-5$, $-1$, $-1$, $1$, $6$ (их сумма, как и положено, ноль). Сумма квадратов $25 + 1 + 1 + 1 + 36 = 64$, делим на $n - 1 = 4$: $s^2 = 16$, $s = 4$.
За год средний доход жителей города вырос на $8$ %, а медианный не изменился. Что можно утверждать наверняка?
Среднее выросло — значит, выросла сумма, и кому-то прибавили. Медиана стоит на месте — значит, человек в середине списка получает столько же, сколько получал тот, кто стоял там год назад. Кому досталась прибавка, по двум числам не узнать.
Оба числа в заголовке верны. Но среднее отвечает на вопрос «сколько досталось бы каждому, если поделить поровну», а читатель слышит «сколько получает обычный человек». На этот вопрос отвечает медиана, а к любому среднему стоит спросить и разброс.
Тысяча человек за весь город
Опрос: 52 % горожан за строительство нового парка, 48 % — против. Опрошено 1000 человек
Первое возражение, которое слышишь к любому опросу: как тысяча человек может говорить за миллионный город? Второе, противоположное: если опрос ошибся, значит, опросили мало людей. Оба неверны, и лучше всего это показывает история, с которой начинаются многие курсы статистики.
В 1936 году в США выбирали президента: действующий Франклин Рузвельт против республиканца Альфа Лэндона. Журнал Literary Digest, верно угадавший победителей нескольких прошлых выборов, разослал около десяти миллионов анкет и получил больше двух миллионов ответов. Прогноз журнала: Лэндон наберёт около $57$ % голосов. Джордж Гэллап опросил в десятки раз меньше людей и предсказал победу Рузвельта. Рузвельт набрал около $61$ % и выиграл в $46$ штатах из $48$. Через два года журнал перестал выходить.
Беда Literary Digest была не в числе ответов, а в том, чьи это ответы. Адреса брали из телефонных справочников, списков владельцев автомобилей и подписчиков журнала — в разгар Великой депрессии это были люди заметно состоятельнее среднего. К тому же вернулась лишь примерно каждая четвёртая анкета, а охотнее отвечали противники Рузвельта. Два миллиона ответов, собранных криво, оказались хуже нескольких тысяч, собранных честно.
Всё множество объектов, о котором мы хотим узнать, называют генеральной совокупностью, а ту её часть, которую мы на самом деле измерили, — выборкой. Выборка случайная, если каждый член совокупности имел одинаковые шансы в неё попасть и выбор одних не влиял на выбор других. Тогда наблюдения $X_1, \dots, X_n$ — независимые случайные величины с одним и тем же распределением.
Повар, который пробует суп, не съедает кастрюлю: он перемешивает её и пробует ложку. Перемешивание — это случайность выборки, и оно важнее размера ложки. А размер кастрюли почти не важен: перемешанный суп одинаково хорошо пробуется ложкой и из кастрюли, и из котла. Literary Digest черпал ложкой с одного края.
Посчитаем, насколько ошибается честный опрос. Пусть доля сторонников парка в городе равна $p$. Ответ опрошенного под номером $i$ — случайная величина $X_i$: $1$, если он за, и $0$, если против. Её ожидание $p$, а дисперсия $p(1 - p)$ (глава 48). Доля «за» в опросе — среднее $\bar X = \frac{X_1 + \dots + X_n}{n}$. Насколько оно разбросано вокруг $p$?
Пусть случайные величины $X_1, \dots, X_n$ независимы, и у каждой ожидание $\mu$ и дисперсия $\sigma^2$. Тогда у их среднего $\bar X$ ожидание равно $\mu$, дисперсия равна $\sigma^2/n$, а стандартное отклонение — $\sigma/\sqrt n$.
Идея: квадрат суммы — площадь квадрата, сложенного из кусков, а у независимых величин в среднем выживают только куски на диагонали.
Стандартное отклонение выборочного среднего называют стандартной ошибкой: $\mathrm{SE} = \sigma/\sqrt n$. Истинное $\sigma$ обычно неизвестно, и вместо него подставляют выборочное $s$.
Для опроса $\sigma^2 = p(1 - p)$, и при $p$ около половины стандартная ошибка тысячи ответов $\sqrt{0{,}25/1000} \approx 0{,}016$ — полтора процентных пункта. Размер города в формуле не участвует: вот откуда спокойствие повара. Строго говоря, при выборе без возвращения появляется множитель $\sqrt{(N - n)/(N - 1)}$, где $N$ — размер совокупности, но для тысячи человек из миллиона он отличается от единицы на пять десятитысячных. Зато в формуле есть корень: чтобы уменьшить ошибку вдвое, опрашивать нужно вчетверо больше людей. Поэтому типичный общенациональный опрос — одна-две тысячи человек, дальше точность дорожает слишком быстро.
Теперь можно вернуть долг из первого разбора и объяснить деление на $n - 1$.
Если $X_1, \dots, X_n$ независимы, у каждой ожидание $\mu$ и дисперсия $\sigma^2$, то $\mathbb E\sum_{i=1}^n (X_i - \bar X)^2 = (n - 1)\,\sigma^2$. Поэтому выборочная дисперсия $s^2$ в среднем равна $\sigma^2$, а с делением на $n$ она в среднем занижала бы разброс.
Идея: среднее выборки ближе к её числам, чем истинное $\mu$, — по теореме о сумме квадратов оно ближе всех. Поэтому отклонения от $\bar X$ систематически меньше отклонений от $\mu$, и тождество о сумме квадратов говорит, насколько именно. Подставим в него $c = \mu$: $\sum (X_i - \mu)^2 = \sum (X_i - \bar X)^2 + n(\bar X - \mu)^2$. Возьмём ожидания обеих частей. Слева $n$ слагаемых, у каждого ожидание $\sigma^2$, всего $n\sigma^2$. Справа ожидание второго слагаемого по теореме о разбросе среднего равно $n \cdot \frac{\sigma^2}{n} = \sigma^2$. Значит, $\mathbb E\sum(X_i - \bar X)^2 = n\sigma^2 - \sigma^2 = (n - 1)\,\sigma^2$, и после деления на $n - 1$ получаем $\mathbb E s^2 = \sigma^2$.
Число $n - 1$ называют числом степеней свободы: сумма отклонений от среднего равна нулю, поэтому свободно меняться могут только $n - 1$ из них, а последнее определено остальными. Само $s$, заметим, в среднем чуть меньше $\sigma$ — корень из среднего не равен среднему из корней, — но эта поправка мала, и ею обычно пренебрегают.
Стандартная ошибка говорит, как далеко обычно улетает выборочное среднее от истины. Центральная предельная теорема добавляет форму: при большом $n$ распределение $\bar X$ близко к нормальному со средним $\mu$ и стандартным отклонением $\sigma/\sqrt n$. А нормальная величина отклоняется от своего среднего больше чем на $1{,}96$ стандартного отклонения лишь в $5$ % случаев. Отсюда рецепт, по которому живут все опросы.
Пусть $\bar X$ распределено нормально со средним $\mu$ и стандартным отклонением $\mathrm{SE}$. Тогда случайный отрезок $\bigl[\bar X - 1{,}96\,\mathrm{SE};\ \bar X + 1{,}96\,\mathrm{SE}\bigr]$ накрывает $\mu$ с вероятностью $95$ %.
Хитрость в том, чтобы посмотреть на то же событие со стороны $\mu$.
Доверительный интервал с уровнем доверия $95$ % — отрезок, вычисленный по выборке по такому правилу, которое накрывает неизвестный параметр в $95$ % случаев.
Для доли формула та же, только $s$ считают по самой доле: $s = \sqrt{\hat p\,(1 - \hat p)}$, где $\hat p$ — доля «за» в опросе:
$$\hat p \pm 1{,}96\,\sqrt{\frac{\hat p\,(1 - \hat p)}{n}}.$$
В нашем опросе $\hat p = 0{,}52$, $n = 1000$, и $1{,}96\sqrt{0{,}52 \cdot 0{,}48/1000} \approx 0{,}031$. Интервал — от $48{,}9$ до $55{,}1$ %, отсюда знаменитые «плюс-минус три процента». Отсюда же вердикт: половина, $50$ %, лежит внутри интервала, и опрос не доказал, что сторонников парка большинство. С разрывом «52 против 48» ещё хуже. Если доля «за» на пункт больше, то доля «против» на пункт меньше, так что разность долей колеблется вдвое сильнее каждой из них, и её погрешность — около $6$ пунктов, больше самого разрыва.
И последнее. Плюс-минус три процента — это только случайная ошибка: кто попал в выборку, а кто нет. Систематические ошибки вроде тех, что погубили Literary Digest, — кто не взял трубку, кто слукавил, как сформулирован вопрос — в эти три процента не входят и с ростом выборки не уменьшаются. Статистики называют такую ошибку смещением выборки.
Сколько человек нужно опросить, чтобы при доле около $50$ % погрешность опроса (половина ширины 95-процентного интервала) была не больше одного процентного пункта?
Нужно $1{,}96\sqrt{0{,}25/n} \le 0{,}01$, то есть $\sqrt n \ge 1{,}96 \cdot 0{,}5/0{,}01 = 98$, и $n \ge 98^2 = 9604$. Втрое точнее «стандартного» опроса — почти вдесятеро больше людей.
Тысячи человек хватает, чтобы узнать долю с точностью около трёх пунктов, — и не хватает, чтобы отличить $52$ от $50$. А если выборка кривая, не помогут и два миллиона.
Дама, которая пробовала чай
Учёные доказали: новый препарат снижает давление. Результат статистически значим, p < 0,05
Слово «доказали» в таких заголовках почти всегда означает одно: результат прошёл проверку статистической гипотезы. Логику этой проверки лучше всего показывает история, которую сделал знаменитой Рональд Фишер в книге «Планирование экспериментов» (1935).
В 1920-х годах Фишер работал на опытной сельскохозяйственной станции Ротамстед в Англии. По рассказам, однажды он налил чашку чая коллеге, специалистке по водорослям Мюриэл Бристол, а она заметила, что предпочитает, когда в чашку сначала наливают молоко, и различает это на вкус. Как проверить такое утверждение?
Фишер описал такой опыт. Готовят восемь чашек: в четыре сначала наливают молоко, в четыре — чай. Чашки подают в случайном порядке. Дама знает, что тех и других по четыре, и должна указать четыре «молочные». Если она ничего не различает, её выбор — просто одна из $\binom84 = 70$ равновозможных четвёрок (глава 45), и угадать все четыре чашки она может с вероятностью $1/70 \approx 0{,}014$. Если это всё же случилось, возможны две версии: либо дама и правда различает, либо произошло событие с шансом полтора процента. Разумнее поверить даме. По воспоминаниям одного из свидетелей, она не ошиблась ни разу.
А если она угадала три чашки из четырёх? Кажется, тоже неплохо. Но при случайном выборе ровно три угадываются $\binom43\binom41 = 16$ способами из $70$, и вероятность угадать не меньше трёх равна $\frac{16 + 1}{70} \approx 0{,}24$. Каждый четвёртый человек, который ничего не чувствует, добился бы того же. Это не доказательство.
Скучное объяснение «никакого эффекта нет, всё дело в случае» называют нулевой гипотезой и обозначают $H_0$. p-значение — вероятность получить результат, не менее выразительный, чем наблюдаемый, при условии, что нулевая гипотеза верна. Если p-значение меньше заранее выбранного порога $\alpha$ — уровня значимости, — нулевую гипотезу отвергают и говорят, что результат статистически значим.
У дамы, угадавшей все чашки, $p = 1/70 \approx 0{,}014$, у угадавшей три — $p \approx 0{,}24$. Порог $\alpha = 0{,}05$ прижился во многом благодаря Фишеру: ещё в 1925 году он назвал его удобной границей, а не законом природы. Отсюда и его замечание, что шести чашек мало: при трёх «молочных» и трёх обычных случайно угадать всё можно с вероятностью $1/\binom63 = 1/20$, ровно $0{,}05$.
Испытание лекарства устроено так же. Нулевая гипотеза — препарат не действует, и разница между группами, получавшими препарат и пустышку, объясняется тем, кто в какую группу попал. p-значение говорит, насколько редкой была бы наблюдаемая разница, будь это так.
Испытание препарата дало $p = 0{,}03$. Какое утверждение верно?
p-значение — вероятность данных при гипотезе, а не гипотезы при данных. Это та же ловушка, что ошибка прокурора из главы о вероятности.
Решение по порогу может ошибиться двумя способами.
Ошибка первого рода — отвергнуть верную нулевую гипотезу, объявить эффект, которого нет: ложная тревога. Ошибка второго рода — пропустить эффект, который есть. Вероятность заметить существующий эффект называют мощностью проверки.
| Эффекта нет | Эффект есть | |
|---|---|---|
| Объявили эффект | ошибка первого рода, вероятность не больше $\alpha$ | верно, вероятность — мощность |
| Не объявили | верно | ошибка второго рода |
Порог $\alpha = 0{,}05$ держит под контролем только ложные тревоги, и то в одной проверке. Здесь прячется главная ловушка.
Двадцать мармеладок
В 2011 году в веб-комиксе xkcd вышел выпуск «Significant». Учёных просят проверить, вызывают ли мармеладки прыщи. Связи не находят. Тогда проверяют двадцать цветов мармеладок по отдельности, и у зелёных $p < 0{,}05$. Наутро в газете: «Зелёные мармеладки связаны с прыщами! Лишь 5 % вероятности, что это совпадение».
Шутка точна до арифметики. Если мармеладки ни при чём, каждая из двадцати проверок даёт ложную тревогу с вероятностью $0{,}05$. Но вероятность, что её даст хотя бы одна из двадцати, куда больше.
Пусть проводится $m$ проверок, в каждой нулевая гипотеза верна, и каждая поднимает ложную тревогу с вероятностью $\alpha$. Если проверки независимы, вероятность хотя бы одной ложной тревоги равна $1 - (1 - \alpha)^m$. Без всяких предположений о независимости она не больше $m\alpha$.
Хитрость в том, чтобы увидеть вероятность как площадь. Нарисуем случай двух проверок.
В жизни двадцать проверок редко выстраиваются в ряд так честно. Исследователь пробует разные способы анализа: исключить выбросы или оставить, учесть возраст или нет, мерить через неделю или через месяц, остановить набор участников, как только p опустилось ниже $0{,}05$. Каждый выбор по отдельности выглядит невинно, а вместе они и есть двадцать мармеладок, только невидимых. Это называют подгонкой p-значения, по-английски p-hacking.
Последствия оказались серьёзными. В 2005 году эпидемиолог Джон Иоаннидис опубликовал статью с вызывающим названием «Почему большинство опубликованных результатов исследований ложны». В 2015 году большая группа психологов, Open Science Collaboration, повторила сто экспериментов из статей в ведущих журналах. В исходных статьях значимыми были $97$ % результатов, в повторениях — $36$ %. После этого кризиса воспроизводимости многие журналы стали принимать статьи с предварительной регистрацией: исследователь до сбора данных объявляет, какую гипотезу и каким способом будет проверять.
Исследователь проверил $10$ независимых гипотез на уровне $\alpha = 0{,}05$, и все они на самом деле неверны (эффектов нет). С какой вероятностью он объявит хотя бы одно «открытие»? Ответ округлите до тысячных.
Ни одной ложной тревоги — с вероятностью $0{,}95^{10} \approx 0{,}599$. Хотя бы одна — $1 - 0{,}599 = 0{,}401$: почти сорок процентов. С поправкой Бонферрони каждую гипотезу проверяли бы на уровне $0{,}005$, и вероятность ложного открытия была бы $1 - 0{,}995^{10} \approx 0{,}049$.
«p < 0,05» значит лишь, что такой результат редко получается случайно, если эффекта нет. Спросите, сколько гипотез проверили, прежде чем найти эту, и повторил ли кто-нибудь результат.
Шоколад и Нобелевские премии
Больше шоколада — больше нобелевских лауреатов: корреляция 0,79
Этот заголовок почти настоящий. В 2012 году кардиолог Франц Мессерли опубликовал в журнале New England Journal of Medicine заметку: в странах, где едят больше шоколада, больше нобелевских лауреатов на душу населения. По $23$ странам коэффициент корреляции получился $0{,}79$. Заметка была написана с изрядной долей иронии, но новости пересказали её всерьёз.
Что означает число $0{,}79$? Коэффициент корреляции измеряет, насколько точки на диаграмме рассеяния прижаты к прямой.
Число $r$ называют коэффициентом корреляции Пирсона. Идею корреляции предложил Фрэнсис Гальтон в 1888 году, а формулу, которой пользуются сегодня, вывел Карл Пирсон в 1890-х.
Пусть среди $x_i$ и среди $y_i$ есть хотя бы по два различных числа. Тогда $-1 \le r \le 1$, причём $|r| = 1$, только если все точки $(x_i;\,y_i)$ лежат на одной прямой. Прямая, для которой сумма квадратов вертикальных отклонений точек наименьшая, проходит через точку $(\bar x;\,\bar y)$ и имеет наклон $b = r\,\dfrac{s_y}{s_x}$.
Хитрость та же, что с суммой квадратов: весь столбец отклонений — одна стрелка в пространстве из $n$ измерений.
Похвала вредит, ругань помогает?
Из последней строчки теоремы следует явление, которое сбивает с толку и газеты, и учёных. Пересчитаем $x$ и $y$ в стандартные единицы: на сколько выборочных стандартных отклонений значение отстоит от среднего. Тогда $\bar x = \bar y = 0$, $s_x = s_y = 1$, и лучшая прямая — просто $y = r\,x$. Если корреляция не идеальна, $|r| < 1$, и прогноз $y$ всегда ближе к среднему, чем сам $x$.
Первым это заметил Гальтон. В 1886 году он сравнил рост взрослых детей с ростом родителей и увидел, что дети очень высоких родителей в среднем тоже высокие, но ниже родителей, а дети очень низких — в среднем выше. Гальтон назвал это «регрессией к посредственности»; отсюда слово «регрессия», которым теперь называют любую подгонку прямой к точкам.
Даниэль Канеман вспоминал, как в 1960-х годах рассказывал инструкторам израильских ВВС, что поощрение учит лучше наказания. Один инструктор возразил: когда он хвалит курсанта за отличную посадку, следующая обычно выходит хуже, а когда ругает за плохую — лучше. Он видел в этом действие своих слов. На самом деле он видел регрессию к среднему: посадка складывается из умения и везения, и после исключительно удачной попытки следующая, скорее всего, будет обычной — хвали не хвали.
Регрессия к среднему — свойство любых двух неидеально связанных измерений: у объектов, крайних по первому, второе в среднем ближе к среднему.
Регрессия к среднему объясняет многое из того, что выглядит как эффект. Больной идёт к врачу, когда ему хуже всего, и поправится почти при любом лечении. Камеры ставят на перекрёстках, где в прошлом году было больше всего аварий, и на следующий год аварий там становится меньше — отчасти просто так. Поэтому в серьёзном испытании есть контрольная группа: её набирали так же, и регрессия к среднему в ней та же, что в основной.
Корреляция между оценками за две контрольные $r = 0{,}6$. Ученик написал первую на два стандартных отклонения выше среднего. На сколько стандартных отклонений выше среднего лучший прогноз его второй оценки?
В стандартных единицах лучший прогноз — $r\,x = 0{,}6 \cdot 2 = 1{,}2$. Ученик, скорее всего, снова напишет хорошо, но не так блестяще: часть его первого успеха была везением, а везение не повторяется по заказу.
Кто виноват
Вернёмся к шоколаду. Корреляция $0{,}79$ настоящая, но она не говорит, что шоколад делает людей умнее. Объяснений по меньшей мере три. Первое — случайность: среди множества пар показателей какая-нибудь неизбежно окажется связанной, как зелёные мармеладки. Второе — обратная причина: может быть, это нобелевские лауреаты празднуют премии шоколадом. Третье, самое правдоподобное, — общая причина: богатые страны и шоколада едят больше, и на науку тратят больше. Скрытую общую причину называют вмешивающимся фактором.
Ещё одно предупреждение: $r$ ловит только прямолинейную связь. У точек на параболе $y = x^2$, симметричных относительно оси, $r = 0$, хотя $y$ целиком определяется $x$. А четыре набора, которые в 1973 году придумал Фрэнсис Энскомб, имеют одинаковые средние, дисперсии, $r \approx 0{,}82$ и одну и ту же лучшую прямую $y = 3 + 0{,}5x$, но на графике не похожи друг на друга. Прежде чем считать корреляцию, нарисуйте точки.
Как же узнать, действует ли шоколад? Только опытом, в котором шоколад раздаёт жребий: участников случайно делят на две группы, одной дают шоколад, другой — нет. Жребий ничего не знает ни о богатстве, ни о возрасте, ни о привычках, поэтому все вмешивающиеся факторы в среднем делятся между группами поровну. Эту идею, рандомизацию, тоже принёс в науку Фишер. С неё начинается и опыт с чаем: порядок чашек там выбирал жребий.
Корреляция измеряет, насколько точки прижаты к прямой, и ничего не говорит о том, что чем вызвано. Спросите, что ещё могло двигать обе величины, и был ли опыт со жребием.
Беркли, 1973
Университет отсеивает женщин: в аспирантуру приняли 44 % мужчин и только 35 % женщин
Этот случай настоящий. Осенью 1973 года в аспирантуру Калифорнийского университета в Беркли подали заявления $8442$ мужчины и $4321$ женщина. Приняли $44$ % мужчин и $35$ % женщин. При таких числах девять пунктов разницы случайностью не объяснить: погрешность разности меньше двух пунктов. Университет забеспокоился, и разобраться взялся статистик Питер Бикел с коллегами.
Решения о приёме в Беркли принимали не в целом по университету, а на факультетах. Бикел, Хэммел и О'Коннелл посмотрели на каждый факультет отдельно. Вот шесть крупнейших; в их статье 1975 года факультеты названы буквами.
| Факультет | Мужчины: заявлений | приняли | Женщины: заявлений | приняли |
|---|---|---|---|---|
| A | 825 | 62 % | 108 | 82 % |
| B | 560 | 63 % | 25 | 68 % |
| C | 325 | 37 % | 593 | 34 % |
| D | 417 | 33 % | 375 | 35 % |
| E | 191 | 28 % | 393 | 24 % |
| F | 373 | 6 % | 341 | 7 % |
| Все шесть | 2691 | 45 % | 1835 | 30 % |
На четырёх факультетах из шести женщин принимали чаще, чем мужчин, на двух оставшихся — чуть реже. А в сумме по тем же шести факультетам приняли $45$ % мужчин и $30$ % женщин. Разгадка в том, куда подавали заявления. Больше половины мужчин, $1385$ из $2691$, шли на факультеты A и B, где принимали почти две трети. Женщины подавали туда редко, $133$ заявления из $1835$, и в основном шли на C–F, куда поступить трудно всем: там принимали от шести до тридцати семи процентов.
Парадоксом Симпсона называют ситуацию, когда связь, которая есть в каждой из групп, исчезает или меняет знак, если группы объединить. Эдвард Симпсон описал его в 1951 году, хотя замечали его и раньше — Карл Пирсон и Удни Юл на рубеже XIX и XX веков.
Никакого волшебства тут нет, только арифметика средних — та же, что у доски с грузиками.
Пусть группа из $N$ человек разбита на части размеров $n_1, \dots, n_k$, и в части $j$ доля успехов равна $p_j$. Тогда общая доля успехов $p = w_1p_1 + \dots + w_kp_k$, где $w_j = n_j/N$ — доли частей, и она лежит между наименьшей и наибольшей из $p_j$.
Хитрость в том, что общая доля — снова центр масс, как на доске с грузиками. Рисунок — для Беркли, где факультеты A и B объединены в «лёгкие», а C–F — в «трудные».
Если бы женщины распределили свои заявления по шести факультетам так же, как мужчины, то при тех же шансах на каждом факультете их приняли бы около $52$ %, больше, чем мужчин. Бикел и соавторы пришли к выводу, что факультеты если и отдавали кому-то предпочтение, то скорее женщинам. Вопрос сместился с приёмных комиссий на другое: почему женщины чаще шли туда, где мест мало? Но на него отвечает уже не арифметика.
Парадокс встречается и в медицине. В 1986 году британские урологи сравнили две операции по удалению камней из почек: открытую и малоинвазивную, через прокол. В целом малоинвазивная удавалась чаще: $83$ % против $78$ %. Но при мелких камнях открытая операция помогала в $93$ % случаев против $87$ %, а при крупных — в $73$ % против $69$ %. Открытая лучше в обеих группах и хуже в сумме: её чаще применяли в тяжёлых случаях, при крупных камнях.
Какому сравнению верить — по группам или в сумме? Сами числа этого не скажут, нужно понимать, откуда они взялись. Размер камня влиял и на выбор операции, и на её исход, то есть был вмешивающимся фактором, и сравнивать надо внутри групп. Бывают и обратные случаи: если группы образовались уже под действием лечения, деление на них только запутает, и верить надо сумме. Статистика подсказывает, что посчитать; какое из чисел отвечает на ваш вопрос, решает понимание того, как устроено дело.
Факультет за факультетом женщин принимали не реже мужчин. Общий процент у них ниже, потому что они чаще подавали туда, где отказывали всем. Прежде чем сравнивать итоги, спросите, одинаково ли группы распределены по частям.
Пять вопросов к любой новости с числами. Среднее или медиана — и каков разброс? Какова погрешность и как набирали выборку? Сколько гипотез проверили, прежде чем найти эту? Что ещё могло связать две величины и был ли жребий? Не сложили ли в одну кучу разные группы?
Отработать расчёты из всех пяти разборов — медиану и разброс, стандартную ошибку, погрешность опроса, множественные проверки, прогноз с регрессией к среднему и общие доли — можно в тренажёре.
Куда дальше
Во всех пяти историях наблюдения были независимыми: опрошенные не советовались друг с другом, чашки не знали друг о друге, у каждой мармеладки была своя группа. На независимости держались и стандартная ошибка, и формула $1 - 0{,}95^{20}$. Но многое в мире устроено иначе. Буквы в тексте зависят от предыдущих: после твёрдого знака в русском тексте всегда идёт гласная. Погода завтра похожа на погоду сегодня. Пользователь щёлкает по ссылке, которая есть на открытой странице. В статистике мы всё время считали наблюдения независимыми, а здесь каждое следующее зависит от прошлого. Как описать такую зависимость и можно ли измерить, сколько информации несёт сообщение? В 1913 году Андрей Марков пересчитал гласные и согласные в «Евгении Онегине», а в 1948-м Клод Шеннон ответил на второй вопрос одной формулой. Об этом — глава 50.