Царица наук EN

This chapter hasn’t been translated into English yet, so here is the Russian original. Your browser can translate the page; the formulas and widgets work the same. Back to the English contents →

Часть VII · Случай и данные Глава 49 из 60

Статистика

Пять газетных заголовков — пять разборов. Средняя зарплата, опрос с погрешностью в три процента, «доказанное» лекарство, шоколад и Нобелевские премии, приём в университет: учимся судить о целом по выборке и не обманывать себя.

1–2 курс 55 минут

Опирается на: 48 · Случайные величины

Вы научитесь

  • отличать среднее от медианы и понимать, на какой вопрос отвечает каждое
  • считать стандартную ошибку и доверительный интервал и читать «плюс-минус три процента»
  • понимать, что говорит p-значение и почему двадцать проверок рождают ложное открытие
  • видеть за корреляцией регрессию к среднему и вмешивающиеся факторы, а за общими процентами — парадокс Симпсона

Прошлая глава закончилась обещанием: по выборке можно судить о целом. Закон больших чисел гарантирует, что среднее многих независимых наблюдений оказывается близко к математическому ожиданию, а центральная предельная теорема уточняет, как именно оно колеблется вокруг него. Осталось научиться пользоваться этими теоремами так, чтобы не обмануть себя.

Это труднее, чем кажется. «Первый принцип — не обманывать себя, а себя обмануть легче всего», — говорил Ричард Фейнман выпускникам Калтеха в 1974 году. Марк Твен приписывал британскому премьер-министру Бенджамину Дизраэли фразу о трёх видах лжи: «ложь, наглая ложь и статистика». В речах и книгах Дизраэли её так и не нашли, но фраза живёт, потому что каждый видел, как верными числами подпирают неверные выводы.

Глава устроена как передача о разрушителях мифов. У нас пять газетных заголовков. Они придуманы, но каждый вы встречали в десятках вариантов, а за двумя последними стоят настоящие истории. За каждым заголовком мы найдём число, на котором он держится, выясним, что это число на самом деле говорит, и возьмём у математической статистики инструмент, чтобы проверить миф.

Средняя температура по больнице

В компании «Ромашка» средняя зарплата — 145 тысяч рублей в месяц, и за год она выросла на 10 %

Заглянем в ведомость. В «Ромашке» десять человек. Девять сотрудников получают (в тысячах рублей) $40$, $42$, $45$, $48$, $50$, $52$, $55$, $58$ и $60$, директор — $1000$. Сумма $1450$, делим на десять — ровно $145$. Заголовок не врёт. Но никто в компании не получает ничего похожего на $145$ тысяч: девять человек получают не больше $60$, а директор — почти всемеро больше этого среднего.

Теперь вторая половина заголовка. За год директор поднял себе оклад до $1145$ тысяч, остальным не прибавили ни рубля. Сумма стала $1595$, среднее — $159{,}5$, ровно на $10$ % больше прежнего. И опять заголовок честен, хотя девяти сотрудникам из десяти от этого роста не досталось ничего. Так и средняя температура по больнице бывает нормальной, когда у половины пациентов жар, а другая половина остыла навсегда.

Среднее арифметическое $\bar x = \frac{x_1 + \dots + x_n}{n}$ отвечает на вопрос, сколько досталось бы каждому, если бы всё поделили поровну. На вопрос «сколько получает обычный сотрудник» отвечает другое число.

Медиана набора чисел — число посередине: если выписать числа по возрастанию, при нечётном их количестве это средний элемент, при чётном — полусумма двух средних. Строго левее медианы лежит не больше половины чисел, и строго правее — тоже не больше половины.

С медианой треугольника из главы 17 у неё общего немного: та делит пополам площадь треугольника, эта — список чисел. В «Ромашке» медиана — полусумма пятого и шестого чисел, $(50 + 52)/2 = 51$. Директор может поднять себе оклад хоть до миллиарда, медиана не шелохнётся: директор как стоял в списке последним, так и стоит. Статистики называют такое свойство устойчивостью. Одно дикое значение не может увести медиану далеко, а среднее уводит куда угодно. Есть старая шутка: когда в бар заходит Билл Гейтс, средний посетитель бара становится миллиардером.

Поэтому о доходах разумнее спрашивать медиану. Росстат, например, публикует и среднюю, и медианную зарплату, и медианная заметно ниже: распределение доходов, как и в «Ромашке», вытянуто вправо, и немногие большие зарплаты тянут среднее вверх.

Среднее и медиана по-разному уравновешивают данные. Положим одинаковые грузики на лёгкую доску в точках $x_1, \dots, x_n$ и подставим опору в точке $c$. Грузик в точке $x_i$ поворачивает доску с силой, пропорциональной плечу $x_i - c$, и доска наклоняется в сторону, куда указывает знак суммы $\sum (x_i - c)$. Эта сумма равна нулю ровно при $c = \bar x$, потому что $\sum (x_i - \bar x) = \sum x_i - n\bar x = 0$. Среднее — точка равновесия, центр масс грузиков. Медиану же находит голосование: опора стоит на медиане, когда грузиков слева и справа поровну, как бы далеко они ни лежали.

Тяните треугольную опору: доска наклоняется в сторону перевеса. Тяните грузики. Поднимите директору зарплату и посмотрите, кто уедет вслед за ним — среднее или медиана.

Есть и другой взгляд на эти два числа. Пусть весь набор нужно представить одним числом $c$, и за каждое $x_i$ мы платим штраф за промах. Если штраф равен расстоянию $|x_i - c|$, лучший выбор — медиана. Если он растёт как квадрат расстояния, лучший выбор — среднее. Докажем оба утверждения.

Для чисел $x_1 \le x_2 \le \dots \le x_n$ сумма расстояний $S(c) = |x_1 - c| + \dots + |x_n - c|$ наименьшая, когда $c$ — медиана. При нечётном $n$ минимум достигается только в медиане, при чётном — в любой точке отрезка между двумя средними числами.

Хитрость в том, чтобы проследить, как меняется сумма, когда $c$ чуть-чуть сдвигается.

Отметим числа на прямой и пробную точку $c$. Сумма $S(c)$ — общая длина отрезков от $c$ до всех чисел. Сдвинем $c$ вправо на маленькое $h$, не перескакивая ни через одно число. Пусть левее $c$ лежат $L$ чисел, правее — $R$. Каждый отрезок до числа слева удлиняется на $h$, каждый отрезок до числа справа укорачивается на $h$. Значит, сумма меняется на $(L - R)\,h$. Пока правее точки $c$ чисел больше ($R > L$), сдвиг вправо уменьшает сумму; когда больше левее, уменьшает сдвиг влево. Выгодно двигаться туда, где чисел больше. Поэтому график $S(c)$ — ломаная, и на каждом её звене наклон равен $L - R$. Левее всех чисел наклон равен $-n$, а при переходе через каждое число он вырастает на $2$: одно число перешло из правых в левые. Наклон отрицателен, пока $L < R$, и положителен, когда $L > R$. Наименьшее значение ломаная принимает там, где наклон меняет знак. При нечётном $n = 2k + 1$ это точка $x_{k+1}$: левее неё $k$ чисел и правее $k$, это медиана. При чётном $n = 2k$ между $x_k$ и $x_{k+1}$ наклон равен нулю, ломаная идёт горизонтально, и минимум дают все точки этого отрезка, в том числе полусумма — медиана.
Двигайте числа и точку $c$: график внизу — сумма расстояний, наклон каждого звена равен разности «слева минус справа».

Для любых чисел $x_1, \dots, x_n$ со средним $\bar x$ и любого числа $c$

$$\sum_{i=1}^n (x_i - c)^2 = \sum_{i=1}^n (x_i - \bar x)^2 + n\,(\bar x - c)^2.$$

Поэтому сумма квадратов отклонений от $c$ наименьшая при $c = \bar x$, и только при нём.

Хитрость в том, чтобы увидеть в наборе из $n$ чисел одну точку $n$-мерного пространства. Для двух чисел это обычная плоскость.

Два числа $x_1, x_2$ — точка $X = (x_1;\,x_2)$, а «ответ одним числом» $c$ — точка $C = (c;\,c)$ на диагонали $y = x$. По формуле расстояния (глава 18) $|XC|^2 = (x_1 - c)^2 + (x_2 - c)^2$ — ровно наша сумма квадратов. Опустим из $X$ перпендикуляр на диагональ. Его основание — точка $M = (\bar x;\,\bar x)$. Проверим: у вектора $\overrightarrow{MX} = (x_1 - \bar x;\ x_2 - \bar x)$ сумма координат $x_1 + x_2 - 2\bar x = 0$, а это и есть его скалярное произведение с направлением диагонали $(1;\,1)$ (глава 22). Произведение равно нулю — векторы перпендикулярны. Треугольник $XMC$ прямоугольный, прямой угол при $M$. По теореме Пифагора $|XC|^2 = |XM|^2 + |MC|^2$. Катет $|XM|^2 = (x_1 - \bar x)^2 + (x_2 - \bar x)^2$ от $c$ не зависит, а второй катет $|MC|^2 = 2(\bar x - c)^2$ обращается в ноль только при $C = M$. Ближайшая к $X$ точка диагонали — $M$, и сумма квадратов наименьшая при $c = \bar x$. Для $n$ чисел рассуждение то же, только в $n$-мерном пространстве, где Пифагор — одна строчка алгебры. Запишем $x_i - c = (x_i - \bar x) + (\bar x - c)$ и возведём в квадрат: $(x_i - c)^2 = (x_i - \bar x)^2 + 2(x_i - \bar x)(\bar x - c) + (\bar x - c)^2$. Сложим по всем $i$. Средние слагаемые дают $2(\bar x - c)\sum(x_i - \bar x) = 0$ — это и есть перпендикулярность, — а последние дают $n(\bar x - c)^2$. Получилось нужное тождество.
Тяните точку данных $X$ и точку ответа $C$ по диагонали: квадрат гипотенузы всегда равен сумме квадратов катетов, а меньше всего он при $C = M$.

Какую цену промаха выбрать, решает задача, а не математика. Но с квадратами проще считать: у суммы квадратов есть формулы вроде только что доказанной, а у суммы модулей их нет. Поэтому классическая статистика стоит на среднем и квадратах отклонений, и из тех же квадратов строится мера разброса. Она нужна: средняя зарплата $50$ тысяч бывает и в компании, где все получают от $48$ до $52$, и там, где половина получает $10$, а половина — $90$.

Выборочное стандартное отклонение чисел $x_1, \dots, x_n$ — число $s \ge 0$, квадрат которого, выборочная дисперсия $s^2$, равен сумме квадратов отклонений от среднего, делённой на $n - 1$.

Сумма квадратов отклонений от среднего. Квадрат убирает знак: отклонения вверх и вниз не гасят друг друга, как гасили бы в сумме самих отклонений, которая всегда равна нулю. Корень в конце возвращает нас от «квадратных рублей» к рублям. Делим не на $n$, а на $n - 1$. Почему — станет ясно во втором разборе; при больших $n$ разница незаметна. Пример: у девяти сотрудников «Ромашки» без директора среднее $50$, отклонения $-10, -8, -5, -2, 0, 2, 5, 8, 10$, сумма их квадратов $386$, и $s = \sqrt{386/8} \approx 6{,}9$ тысячи. С директором $s \approx 300$ тысяч, вдвое больше самого среднего. Такой разброс — верный знак того, что одно среднее здесь мало что говорит.

Найдите выборочное стандартное отклонение чисел $3$, $7$, $7$, $9$, $14$.

Среднее $\bar x = 40/5 = 8$. Отклонения: $-5$, $-1$, $-1$, $1$, $6$ (их сумма, как и положено, ноль). Сумма квадратов $25 + 1 + 1 + 1 + 36 = 64$, делим на $n - 1 = 4$: $s^2 = 16$, $s = 4$.

За год средний доход жителей города вырос на $8$ %, а медианный не изменился. Что можно утверждать наверняка?

Среднее выросло — значит, выросла сумма, и кому-то прибавили. Медиана стоит на месте — значит, человек в середине списка получает столько же, сколько получал тот, кто стоял там год назад. Кому досталась прибавка, по двум числам не узнать.

Оба числа в заголовке верны. Но среднее отвечает на вопрос «сколько досталось бы каждому, если поделить поровну», а читатель слышит «сколько получает обычный человек». На этот вопрос отвечает медиана, а к любому среднему стоит спросить и разброс.

Тысяча человек за весь город

Опрос: 52 % горожан за строительство нового парка, 48 % — против. Опрошено 1000 человек

Первое возражение, которое слышишь к любому опросу: как тысяча человек может говорить за миллионный город? Второе, противоположное: если опрос ошибся, значит, опросили мало людей. Оба неверны, и лучше всего это показывает история, с которой начинаются многие курсы статистики.

В 1936 году в США выбирали президента: действующий Франклин Рузвельт против республиканца Альфа Лэндона. Журнал Literary Digest, верно угадавший победителей нескольких прошлых выборов, разослал около десяти миллионов анкет и получил больше двух миллионов ответов. Прогноз журнала: Лэндон наберёт около $57$ % голосов. Джордж Гэллап опросил в десятки раз меньше людей и предсказал победу Рузвельта. Рузвельт набрал около $61$ % и выиграл в $46$ штатах из $48$. Через два года журнал перестал выходить.

Беда Literary Digest была не в числе ответов, а в том, чьи это ответы. Адреса брали из телефонных справочников, списков владельцев автомобилей и подписчиков журнала — в разгар Великой депрессии это были люди заметно состоятельнее среднего. К тому же вернулась лишь примерно каждая четвёртая анкета, а охотнее отвечали противники Рузвельта. Два миллиона ответов, собранных криво, оказались хуже нескольких тысяч, собранных честно.

Всё множество объектов, о котором мы хотим узнать, называют генеральной совокупностью, а ту её часть, которую мы на самом деле измерили, — выборкой. Выборка случайная, если каждый член совокупности имел одинаковые шансы в неё попасть и выбор одних не влиял на выбор других. Тогда наблюдения $X_1, \dots, X_n$ — независимые случайные величины с одним и тем же распределением.

Повар, который пробует суп, не съедает кастрюлю: он перемешивает её и пробует ложку. Перемешивание — это случайность выборки, и оно важнее размера ложки. А размер кастрюли почти не важен: перемешанный суп одинаково хорошо пробуется ложкой и из кастрюли, и из котла. Literary Digest черпал ложкой с одного края.

Посчитаем, насколько ошибается честный опрос. Пусть доля сторонников парка в городе равна $p$. Ответ опрошенного под номером $i$ — случайная величина $X_i$: $1$, если он за, и $0$, если против. Её ожидание $p$, а дисперсия $p(1 - p)$ (глава 48). Доля «за» в опросе — среднее $\bar X = \frac{X_1 + \dots + X_n}{n}$. Насколько оно разбросано вокруг $p$?

Пусть случайные величины $X_1, \dots, X_n$ независимы, и у каждой ожидание $\mu$ и дисперсия $\sigma^2$. Тогда у их среднего $\bar X$ ожидание равно $\mu$, дисперсия равна $\sigma^2/n$, а стандартное отклонение — $\sigma/\sqrt n$.

Идея: квадрат суммы — площадь квадрата, сложенного из кусков, а у независимых величин в среднем выживают только куски на диагонали.

Ожидание среднего равно $\mu$ по линейности: $\mathbb E\bar X = \frac1n(\mathbb E X_1 + \dots + \mathbb E X_n) = \mu$. Для дисперсии введём отклонения $Y_i = X_i - \mu$, у них $\mathbb E Y_i = 0$ и $\mathbb E Y_i^2 = \sigma^2$. Тогда $\bar X - \mu = \frac{Y_1 + \dots + Y_n}{n}$, и $\mathbb D\bar X = \mathbb E(\bar X - \mu)^2 = \frac{1}{n^2}\,\mathbb E\,(Y_1 + \dots + Y_n)^2$. Квадрат суммы — площадь квадрата со стороной $Y_1 + \dots + Y_n$. Разрежем его на $n^2$ прямоугольников $Y_iY_j$, как в главе 7 (на рисунке $n = 3$): $(Y_1 + \dots + Y_n)^2 = \sum_{i,j} Y_iY_j$. Ожидание суммы равно сумме ожиданий, так что считать можно по кускам. На диагонали стоят квадраты $Y_i^2$. Ожидание каждого равно $\sigma^2$ — это определение дисперсии. Их $n$ штук, вместе $n\sigma^2$. Вне диагонали — прямоугольники $Y_iY_j$ с $i \ne j$. Величины $Y_i$ и $Y_j$ независимы, а ожидание произведения независимых величин равно произведению ожиданий: для дискретных величин $\sum_{a,b} ab\,P(Y_i = a)\,P(Y_j = b) = \sum_a a\,P(Y_i = a) \cdot \sum_b b\,P(Y_j = b)$. Значит, $\mathbb E(Y_iY_j) = 0 \cdot 0 = 0$. В отдельном опыте такой прямоугольник может иметь и отрицательную «площадь», когда $Y_i$ и $Y_j$ разных знаков; в среднем плюсы и минусы гасят друг друга. Остаётся $\mathbb E(Y_1 + \dots + Y_n)^2 = n\sigma^2$, откуда $\mathbb D\bar X = \frac{n\sigma^2}{n^2} = \frac{\sigma^2}{n}$, а стандартное отклонение равно $\sigma/\sqrt n$. Сумма $n$ независимых отклонений растёт не как $n$, а как $\sqrt n$: они частично гасят друг друга.
Тяните стороны $Y_1$, $Y_2$, $Y_3$, в том числе через ноль: прямоугольники вне диагонали меняют знак, а квадраты на диагонали всегда положительны.

Стандартное отклонение выборочного среднего называют стандартной ошибкой: $\mathrm{SE} = \sigma/\sqrt n$. Истинное $\sigma$ обычно неизвестно, и вместо него подставляют выборочное $s$.

Для опроса $\sigma^2 = p(1 - p)$, и при $p$ около половины стандартная ошибка тысячи ответов $\sqrt{0{,}25/1000} \approx 0{,}016$ — полтора процентных пункта. Размер города в формуле не участвует: вот откуда спокойствие повара. Строго говоря, при выборе без возвращения появляется множитель $\sqrt{(N - n)/(N - 1)}$, где $N$ — размер совокупности, но для тысячи человек из миллиона он отличается от единицы на пять десятитысячных. Зато в формуле есть корень: чтобы уменьшить ошибку вдвое, опрашивать нужно вчетверо больше людей. Поэтому типичный общенациональный опрос — одна-две тысячи человек, дальше точность дорожает слишком быстро.

Теперь можно вернуть долг из первого разбора и объяснить деление на $n - 1$.

Если $X_1, \dots, X_n$ независимы, у каждой ожидание $\mu$ и дисперсия $\sigma^2$, то $\mathbb E\sum_{i=1}^n (X_i - \bar X)^2 = (n - 1)\,\sigma^2$. Поэтому выборочная дисперсия $s^2$ в среднем равна $\sigma^2$, а с делением на $n$ она в среднем занижала бы разброс.

Идея: среднее выборки ближе к её числам, чем истинное $\mu$, — по теореме о сумме квадратов оно ближе всех. Поэтому отклонения от $\bar X$ систематически меньше отклонений от $\mu$, и тождество о сумме квадратов говорит, насколько именно. Подставим в него $c = \mu$: $\sum (X_i - \mu)^2 = \sum (X_i - \bar X)^2 + n(\bar X - \mu)^2$. Возьмём ожидания обеих частей. Слева $n$ слагаемых, у каждого ожидание $\sigma^2$, всего $n\sigma^2$. Справа ожидание второго слагаемого по теореме о разбросе среднего равно $n \cdot \frac{\sigma^2}{n} = \sigma^2$. Значит, $\mathbb E\sum(X_i - \bar X)^2 = n\sigma^2 - \sigma^2 = (n - 1)\,\sigma^2$, и после деления на $n - 1$ получаем $\mathbb E s^2 = \sigma^2$.

Число $n - 1$ называют числом степеней свободы: сумма отклонений от среднего равна нулю, поэтому свободно меняться могут только $n - 1$ из них, а последнее определено остальными. Само $s$, заметим, в среднем чуть меньше $\sigma$ — корень из среднего не равен среднему из корней, — но эта поправка мала, и ею обычно пренебрегают.

Стандартная ошибка говорит, как далеко обычно улетает выборочное среднее от истины. Центральная предельная теорема добавляет форму: при большом $n$ распределение $\bar X$ близко к нормальному со средним $\mu$ и стандартным отклонением $\sigma/\sqrt n$. А нормальная величина отклоняется от своего среднего больше чем на $1{,}96$ стандартного отклонения лишь в $5$ % случаев. Отсюда рецепт, по которому живут все опросы.

Пусть $\bar X$ распределено нормально со средним $\mu$ и стандартным отклонением $\mathrm{SE}$. Тогда случайный отрезок $\bigl[\bar X - 1{,}96\,\mathrm{SE};\ \bar X + 1{,}96\,\mathrm{SE}\bigr]$ накрывает $\mu$ с вероятностью $95$ %.

Хитрость в том, чтобы посмотреть на то же событие со стороны $\mu$.

Выборка дала среднее $\bar x$. Отложим от него в обе стороны по $1{,}96\,\mathrm{SE}$ — получится интервал с центром в $\bar x$. Интервал накрывает $\mu$ ровно тогда, когда расстояние от $\bar x$ до $\mu$ не больше $1{,}96\,\mathrm{SE}$. Расстояние симметрично, поэтому это то же самое, что попадание $\bar x$ в полосу той же ширины вокруг $\mu$. Двигайте $\bar x$: пока точка в полосе, её интервал дотягивается до $\mu$, вышла из полосы — не дотягивается. Вероятность, что $\bar X$ попадёт в полосу, — площадь под колоколом над полосой. Число $1{,}96$ подобрано так, чтобы эта площадь равнялась $0{,}95$: $\Phi(1{,}96) - \Phi(-1{,}96) \approx 0{,}95$, где $\Phi$ — функция стандартного нормального распределения. Значит, интервал накрывает $\mu$ с вероятностью $95$ %. Случайна здесь не $\mu$, а $\bar X$ — и вместе с ним сам интервал. Для уровня $99$ % вместо $1{,}96$ берут $2{,}58$, для $90$ % — $1{,}64$.
Тяните выборочное среднее $\bar x$: интервал накрывает $\mu$ ровно тогда, когда $\bar x$ стоит в закрашенной полосе.

Доверительный интервал с уровнем доверия $95$ % — отрезок, вычисленный по выборке по такому правилу, которое накрывает неизвестный параметр в $95$ % случаев.

Выборочное среднее — лучшая догадка о неизвестном $\mu$. Сколько стандартных ошибок откладывать. Для уровня $95$ % это такое число $z$, что $\Phi(z) = 0{,}975$: по $2{,}5$ % остаётся на каждый хвост. Стандартная ошибка, в которой неизвестное $\sigma$ заменено выборочным $s$. Когда наблюдений хотя бы несколько десятков, это почти не меняет дела; для маленьких выборок $1{,}96$ заменяют чуть большим числом из распределения Стьюдента. Пример: на молокозаводе взвесили $100$ пакетов с надписью «1 л». Среднее $996$ мл, $s = 12$ мл. Стандартная ошибка $12/\sqrt{100} = 1{,}2$ мл, интервал $996 \pm 2{,}35$, то есть от $993{,}6$ до $998{,}4$ мл. Литр в него не попал: разливочную машину пора настроить.
Каждая строка — отдельный опрос и его доверительный интервал; красные промахнулись мимо истинной доли. Меняйте число опрошенных и уровень доверия. Потом включите «кривую выборку», как у Literary Digest, и увеличьте её.

Для доли формула та же, только $s$ считают по самой доле: $s = \sqrt{\hat p\,(1 - \hat p)}$, где $\hat p$ — доля «за» в опросе:

$$\hat p \pm 1{,}96\,\sqrt{\frac{\hat p\,(1 - \hat p)}{n}}.$$

В нашем опросе $\hat p = 0{,}52$, $n = 1000$, и $1{,}96\sqrt{0{,}52 \cdot 0{,}48/1000} \approx 0{,}031$. Интервал — от $48{,}9$ до $55{,}1$ %, отсюда знаменитые «плюс-минус три процента». Отсюда же вердикт: половина, $50$ %, лежит внутри интервала, и опрос не доказал, что сторонников парка большинство. С разрывом «52 против 48» ещё хуже. Если доля «за» на пункт больше, то доля «против» на пункт меньше, так что разность долей колеблется вдвое сильнее каждой из них, и её погрешность — около $6$ пунктов, больше самого разрыва.

И последнее. Плюс-минус три процента — это только случайная ошибка: кто попал в выборку, а кто нет. Систематические ошибки вроде тех, что погубили Literary Digest, — кто не взял трубку, кто слукавил, как сформулирован вопрос — в эти три процента не входят и с ростом выборки не уменьшаются. Статистики называют такую ошибку смещением выборки.

Сколько человек нужно опросить, чтобы при доле около $50$ % погрешность опроса (половина ширины 95-процентного интервала) была не больше одного процентного пункта?

Нужно $1{,}96\sqrt{0{,}25/n} \le 0{,}01$, то есть $\sqrt n \ge 1{,}96 \cdot 0{,}5/0{,}01 = 98$, и $n \ge 98^2 = 9604$. Втрое точнее «стандартного» опроса — почти вдесятеро больше людей.

Тысячи человек хватает, чтобы узнать долю с точностью около трёх пунктов, — и не хватает, чтобы отличить $52$ от $50$. А если выборка кривая, не помогут и два миллиона.

Дама, которая пробовала чай

Учёные доказали: новый препарат снижает давление. Результат статистически значим, p < 0,05

Слово «доказали» в таких заголовках почти всегда означает одно: результат прошёл проверку статистической гипотезы. Логику этой проверки лучше всего показывает история, которую сделал знаменитой Рональд Фишер в книге «Планирование экспериментов» (1935).

В 1920-х годах Фишер работал на опытной сельскохозяйственной станции Ротамстед в Англии. По рассказам, однажды он налил чашку чая коллеге, специалистке по водорослям Мюриэл Бристол, а она заметила, что предпочитает, когда в чашку сначала наливают молоко, и различает это на вкус. Как проверить такое утверждение?

Фишер описал такой опыт. Готовят восемь чашек: в четыре сначала наливают молоко, в четыре — чай. Чашки подают в случайном порядке. Дама знает, что тех и других по четыре, и должна указать четыре «молочные». Если она ничего не различает, её выбор — просто одна из $\binom84 = 70$ равновозможных четвёрок (глава 45), и угадать все четыре чашки она может с вероятностью $1/70 \approx 0{,}014$. Если это всё же случилось, возможны две версии: либо дама и правда различает, либо произошло событие с шансом полтора процента. Разумнее поверить даме. По воспоминаниям одного из свидетелей, она не ошиблась ни разу.

А если она угадала три чашки из четырёх? Кажется, тоже неплохо. Но при случайном выборе ровно три угадываются $\binom43\binom41 = 16$ способами из $70$, и вероятность угадать не меньше трёх равна $\frac{16 + 1}{70} \approx 0{,}24$. Каждый четвёртый человек, который ничего не чувствует, добился бы того же. Это не доказательство.

Вы — дама: отметьте четыре чашки, в которые, по-вашему, сначала налили молоко. Вкуса через экран не почувствовать, так что вы угадываете наугад — сравните, как часто это удаётся, с тем, что обещает гистограмма. Поменяйте число чашек: при шести даже полное попадание мало что доказывает.

Скучное объяснение «никакого эффекта нет, всё дело в случае» называют нулевой гипотезой и обозначают $H_0$. p-значение — вероятность получить результат, не менее выразительный, чем наблюдаемый, при условии, что нулевая гипотеза верна. Если p-значение меньше заранее выбранного порога $\alpha$ — уровня значимости, — нулевую гипотезу отвергают и говорят, что результат статистически значим.

У дамы, угадавшей все чашки, $p = 1/70 \approx 0{,}014$, у угадавшей три — $p \approx 0{,}24$. Порог $\alpha = 0{,}05$ прижился во многом благодаря Фишеру: ещё в 1925 году он назвал его удобной границей, а не законом природы. Отсюда и его замечание, что шести чашек мало: при трёх «молочных» и трёх обычных случайно угадать всё можно с вероятностью $1/\binom63 = 1/20$, ровно $0{,}05$.

Испытание лекарства устроено так же. Нулевая гипотеза — препарат не действует, и разница между группами, получавшими препарат и пустышку, объясняется тем, кто в какую группу попал. p-значение говорит, насколько редкой была бы наблюдаемая разница, будь это так.

Испытание препарата дало $p = 0{,}03$. Какое утверждение верно?

p-значение — вероятность данных при гипотезе, а не гипотезы при данных. Это та же ловушка, что ошибка прокурора из главы о вероятности.

Решение по порогу может ошибиться двумя способами.

Ошибка первого рода — отвергнуть верную нулевую гипотезу, объявить эффект, которого нет: ложная тревога. Ошибка второго рода — пропустить эффект, который есть. Вероятность заметить существующий эффект называют мощностью проверки.

Эффекта нетЭффект есть
Объявили эффектошибка первого рода, вероятность не больше $\alpha$верно, вероятность — мощность
Не объявиливерноошибка второго рода

Порог $\alpha = 0{,}05$ держит под контролем только ложные тревоги, и то в одной проверке. Здесь прячется главная ловушка.

Двадцать мармеладок

В 2011 году в веб-комиксе xkcd вышел выпуск «Significant». Учёных просят проверить, вызывают ли мармеладки прыщи. Связи не находят. Тогда проверяют двадцать цветов мармеладок по отдельности, и у зелёных $p < 0{,}05$. Наутро в газете: «Зелёные мармеладки связаны с прыщами! Лишь 5 % вероятности, что это совпадение».

Шутка точна до арифметики. Если мармеладки ни при чём, каждая из двадцати проверок даёт ложную тревогу с вероятностью $0{,}05$. Но вероятность, что её даст хотя бы одна из двадцати, куда больше.

Пусть проводится $m$ проверок, в каждой нулевая гипотеза верна, и каждая поднимает ложную тревогу с вероятностью $\alpha$. Если проверки независимы, вероятность хотя бы одной ложной тревоги равна $1 - (1 - \alpha)^m$. Без всяких предположений о независимости она не больше $m\alpha$.

Хитрость в том, чтобы увидеть вероятность как площадь. Нарисуем случай двух проверок.

Пусть исход каждой проверки определяется случайным числом из отрезка $[0;\,1]$: тревога, если оно меньше $\alpha$. Для непрерывного критерия таким числом служит само p-значение. Два независимых таких числа — случайная точка единичного квадрата, и вероятность любого события равна площади соответствующей части квадрата. Тревога в первой проверке — вертикальная полоса ширины $\alpha$, во второй — горизонтальная полоса высоты $\alpha$. Каждая занимает долю $\alpha$ квадрата. Ни одной тревоги — оставшийся квадрат со стороной $1 - \alpha$ и площадью $(1 - \alpha)^2$. Хотя бы одна тревога — уголок из двух полос, его площадь $1 - (1 - \alpha)^2$. При $\alpha = 0{,}05$ это $0{,}0975$, почти вдвое больше $\alpha$. Для $m$ независимых проверок то же в $m$-мерном кубе: вероятности «нет тревоги» перемножаются, и ни одной тревоги не будет с вероятностью $(1 - \alpha)^m$. При $m = 20$ хотя бы одна тревога случится с вероятностью $1 - 0{,}95^{20} \approx 0{,}64$. Если проверки зависимы, области тревог могут лечь как угодно, но площадь их объединения не больше суммы площадей: общие куски в сумме посчитаны дважды. Поэтому вероятность хотя бы одной тревоги не больше $m\alpha$. Отсюда поправка Бонферрони: чтобы общая вероятность ложной тревоги в $m$ проверках была не больше $\alpha$, каждую проверку проводят с порогом $\alpha/m$.
Двигайте порог $\alpha$: площадь уголка — вероятность хотя бы одной ложной тревоги в двух проверках.
Мармеладки ни при чём: в каждом опыте обе группы по 30 человек берутся из одного и того же распределения. Проверьте все двадцать цветов и посмотрите, найдётся ли «открытие». Повторите много раз и сравните долю исследований с находкой с $1 - 0{,}95^{20}$. Потом включите поправку Бонферрони.

В жизни двадцать проверок редко выстраиваются в ряд так честно. Исследователь пробует разные способы анализа: исключить выбросы или оставить, учесть возраст или нет, мерить через неделю или через месяц, остановить набор участников, как только p опустилось ниже $0{,}05$. Каждый выбор по отдельности выглядит невинно, а вместе они и есть двадцать мармеладок, только невидимых. Это называют подгонкой p-значения, по-английски p-hacking.

Последствия оказались серьёзными. В 2005 году эпидемиолог Джон Иоаннидис опубликовал статью с вызывающим названием «Почему большинство опубликованных результатов исследований ложны». В 2015 году большая группа психологов, Open Science Collaboration, повторила сто экспериментов из статей в ведущих журналах. В исходных статьях значимыми были $97$ % результатов, в повторениях — $36$ %. После этого кризиса воспроизводимости многие журналы стали принимать статьи с предварительной регистрацией: исследователь до сбора данных объявляет, какую гипотезу и каким способом будет проверять.

Исследователь проверил $10$ независимых гипотез на уровне $\alpha = 0{,}05$, и все они на самом деле неверны (эффектов нет). С какой вероятностью он объявит хотя бы одно «открытие»? Ответ округлите до тысячных.

Ни одной ложной тревоги — с вероятностью $0{,}95^{10} \approx 0{,}599$. Хотя бы одна — $1 - 0{,}599 = 0{,}401$: почти сорок процентов. С поправкой Бонферрони каждую гипотезу проверяли бы на уровне $0{,}005$, и вероятность ложного открытия была бы $1 - 0{,}995^{10} \approx 0{,}049$.

«p < 0,05» значит лишь, что такой результат редко получается случайно, если эффекта нет. Спросите, сколько гипотез проверили, прежде чем найти эту, и повторил ли кто-нибудь результат.

Шоколад и Нобелевские премии

Больше шоколада — больше нобелевских лауреатов: корреляция 0,79

Этот заголовок почти настоящий. В 2012 году кардиолог Франц Мессерли опубликовал в журнале New England Journal of Medicine заметку: в странах, где едят больше шоколада, больше нобелевских лауреатов на душу населения. По $23$ странам коэффициент корреляции получился $0{,}79$. Заметка была написана с изрядной долей иронии, но новости пересказали её всерьёз.

Что означает число $0{,}79$? Коэффициент корреляции измеряет, насколько точки на диаграмме рассеяния прижаты к прямой.

Сумма произведений отклонений. Точка правее и выше центра $(\bar x;\,\bar y)$ или левее и ниже даёт положительное слагаемое, точка правее и ниже или левее и выше — отрицательное. Если точки вытянуты вдоль растущей прямой, перевешивают плюсы. Нормировка: делим на произведение «длин» отклонений. После неё $r$ не зависит от единиц измерения — от того, в граммах или килограммах считать шоколад, — и, как мы сейчас докажем, лежит между $-1$ и $1$. Пример: для точек $(1;\,1)$, $(2;\,3)$, $(3;\,2)$ средние $\bar x = \bar y = 2$, отклонения по $x$: $-1, 0, 1$, по $y$: $-1, 1, 0$. Числитель $1 + 0 + 0 = 1$, знаменатель $\sqrt2 \cdot \sqrt2 = 2$, и $r = 0{,}5$.

Число $r$ называют коэффициентом корреляции Пирсона. Идею корреляции предложил Фрэнсис Гальтон в 1888 году, а формулу, которой пользуются сегодня, вывел Карл Пирсон в 1890-х.

Угадайте $r$ на глаз и проверьте себя. В режиме «Свои точки» ставьте точки касанием и двигайте их; в режиме «Энскомб» сравните четыре набора, у которых одно и то же $r$.

Пусть среди $x_i$ и среди $y_i$ есть хотя бы по два различных числа. Тогда $-1 \le r \le 1$, причём $|r| = 1$, только если все точки $(x_i;\,y_i)$ лежат на одной прямой. Прямая, для которой сумма квадратов вертикальных отклонений точек наименьшая, проходит через точку $(\bar x;\,\bar y)$ и имеет наклон $b = r\,\dfrac{s_y}{s_x}$.

Хитрость та же, что с суммой квадратов: весь столбец отклонений — одна стрелка в пространстве из $n$ измерений.

Соберём отклонения в два вектора: $\mathbf u = (x_1 - \bar x;\ \dots;\ x_n - \bar x)$ и $\mathbf v = (y_1 - \bar y;\ \dots;\ y_n - \bar y)$. Числитель $r$ — их скалярное произведение, знаменатель — произведение длин: $r = \frac{\langle\mathbf u, \mathbf v\rangle}{|\mathbf u|\,|\mathbf v|}$. Две стрелки, выпущенные из одной точки, всегда лежат в одной плоскости — её и рисуем. Сначала о прямой. При любом наклоне $b$ выбрать сдвиг прямой $y = a + bx$ — значит представить набор чисел $y_i - bx_i$ одним числом $a$, и по теореме о сумме квадратов лучшее $a$ — их среднее, $\bar y - b\bar x$. Значит, лучшая прямая проходит через $(\bar x;\,\bar y)$, и её вертикальные отклонения равны $(y_i - \bar y) - b(x_i - \bar x)$ — это координаты вектора $\mathbf v - b\mathbf u$. Раскроем квадрат длины: $|\mathbf v - b\mathbf u|^2 = |\mathbf v|^2 - 2b\,\langle\mathbf u, \mathbf v\rangle + b^2|\mathbf u|^2$. Это квадратный трёхчлен от $b$; наименьшее значение он принимает в вершине параболы (глава 10), при $b = \frac{\langle\mathbf u, \mathbf v\rangle}{|\mathbf u|^2}$. На рисунке $b\mathbf u$ — проекция $\mathbf v$ на прямую вектора $\mathbf u$, а остаток $\mathbf v - b\mathbf u$ ей перпендикулярен. Подставим это $b$: наименьшее значение равно $|\mathbf v|^2 - \frac{\langle\mathbf u, \mathbf v\rangle^2}{|\mathbf u|^2} = |\mathbf v|^2\,(1 - r^2)$. Сумма квадратов не бывает отрицательной, поэтому $1 - r^2 \ge 0$, то есть $|r| \le 1$. Ноль получается, только когда остаток нулевой, $\mathbf v = b\mathbf u$: все точки лежат на прямой. По теореме Пифагора длина проекции равна $|\mathbf v|\,|r|$, так что $r$ — косинус угла между $\mathbf u$ и $\mathbf v$. Наклон лучшей прямой $b = \frac{\langle\mathbf u, \mathbf v\rangle}{|\mathbf u|^2} = r\,\frac{|\mathbf v|}{|\mathbf u|} = r\,\frac{s_y}{s_x}$: множитель $\sqrt{n - 1}$ в $s_x$ и $s_y$ сокращается.
Тяните концы векторов $\mathbf u$ и $\mathbf v$: проекция и остаток всегда перпендикулярны, а $r$ — косинус угла между стрелками.

Похвала вредит, ругань помогает?

Из последней строчки теоремы следует явление, которое сбивает с толку и газеты, и учёных. Пересчитаем $x$ и $y$ в стандартные единицы: на сколько выборочных стандартных отклонений значение отстоит от среднего. Тогда $\bar x = \bar y = 0$, $s_x = s_y = 1$, и лучшая прямая — просто $y = r\,x$. Если корреляция не идеальна, $|r| < 1$, и прогноз $y$ всегда ближе к среднему, чем сам $x$.

Первым это заметил Гальтон. В 1886 году он сравнил рост взрослых детей с ростом родителей и увидел, что дети очень высоких родителей в среднем тоже высокие, но ниже родителей, а дети очень низких — в среднем выше. Гальтон назвал это «регрессией к посредственности»; отсюда слово «регрессия», которым теперь называют любую подгонку прямой к точкам.

Даниэль Канеман вспоминал, как в 1960-х годах рассказывал инструкторам израильских ВВС, что поощрение учит лучше наказания. Один инструктор возразил: когда он хвалит курсанта за отличную посадку, следующая обычно выходит хуже, а когда ругает за плохую — лучше. Он видел в этом действие своих слов. На самом деле он видел регрессию к среднему: посадка складывается из умения и везения, и после исключительно удачной попытки следующая, скорее всего, будет обычной — хвали не хвали.

Регрессия к среднему — свойство любых двух неидеально связанных измерений: у объектов, крайних по первому, второе в среднем ближе к среднему.

Пятьсот учеников пишут две контрольные; результат каждой — умение плюс везение. Выделите лучших или худших по первой контрольной и посмотрите на их вторую. Двигайте долю везения: без неё регрессии нет, при одном везении она полная.

Регрессия к среднему объясняет многое из того, что выглядит как эффект. Больной идёт к врачу, когда ему хуже всего, и поправится почти при любом лечении. Камеры ставят на перекрёстках, где в прошлом году было больше всего аварий, и на следующий год аварий там становится меньше — отчасти просто так. Поэтому в серьёзном испытании есть контрольная группа: её набирали так же, и регрессия к среднему в ней та же, что в основной.

Корреляция между оценками за две контрольные $r = 0{,}6$. Ученик написал первую на два стандартных отклонения выше среднего. На сколько стандартных отклонений выше среднего лучший прогноз его второй оценки?

В стандартных единицах лучший прогноз — $r\,x = 0{,}6 \cdot 2 = 1{,}2$. Ученик, скорее всего, снова напишет хорошо, но не так блестяще: часть его первого успеха была везением, а везение не повторяется по заказу.

Кто виноват

Вернёмся к шоколаду. Корреляция $0{,}79$ настоящая, но она не говорит, что шоколад делает людей умнее. Объяснений по меньшей мере три. Первое — случайность: среди множества пар показателей какая-нибудь неизбежно окажется связанной, как зелёные мармеладки. Второе — обратная причина: может быть, это нобелевские лауреаты празднуют премии шоколадом. Третье, самое правдоподобное, — общая причина: богатые страны и шоколада едят больше, и на науку тратят больше. Скрытую общую причину называют вмешивающимся фактором.

Ещё одно предупреждение: $r$ ловит только прямолинейную связь. У точек на параболе $y = x^2$, симметричных относительно оси, $r = 0$, хотя $y$ целиком определяется $x$. А четыре набора, которые в 1973 году придумал Фрэнсис Энскомб, имеют одинаковые средние, дисперсии, $r \approx 0{,}82$ и одну и ту же лучшую прямую $y = 3 + 0{,}5x$, но на графике не похожи друг на друга. Прежде чем считать корреляцию, нарисуйте точки.

Как же узнать, действует ли шоколад? Только опытом, в котором шоколад раздаёт жребий: участников случайно делят на две группы, одной дают шоколад, другой — нет. Жребий ничего не знает ни о богатстве, ни о возрасте, ни о привычках, поэтому все вмешивающиеся факторы в среднем делятся между группами поровну. Эту идею, рандомизацию, тоже принёс в науку Фишер. С неё начинается и опыт с чаем: порядок чашек там выбирал жребий.

Корреляция измеряет, насколько точки прижаты к прямой, и ничего не говорит о том, что чем вызвано. Спросите, что ещё могло двигать обе величины, и был ли опыт со жребием.

Беркли, 1973

Университет отсеивает женщин: в аспирантуру приняли 44 % мужчин и только 35 % женщин

Этот случай настоящий. Осенью 1973 года в аспирантуру Калифорнийского университета в Беркли подали заявления $8442$ мужчины и $4321$ женщина. Приняли $44$ % мужчин и $35$ % женщин. При таких числах девять пунктов разницы случайностью не объяснить: погрешность разности меньше двух пунктов. Университет забеспокоился, и разобраться взялся статистик Питер Бикел с коллегами.

Решения о приёме в Беркли принимали не в целом по университету, а на факультетах. Бикел, Хэммел и О'Коннелл посмотрели на каждый факультет отдельно. Вот шесть крупнейших; в их статье 1975 года факультеты названы буквами.

ФакультетМужчины: заявленийпринялиЖенщины: заявленийприняли
A82562 %10882 %
B56063 %2568 %
C32537 %59334 %
D41733 %37535 %
E19128 %39324 %
F3736 %3417 %
Все шесть269145 %183530 %

На четырёх факультетах из шести женщин принимали чаще, чем мужчин, на двух оставшихся — чуть реже. А в сумме по тем же шести факультетам приняли $45$ % мужчин и $30$ % женщин. Разгадка в том, куда подавали заявления. Больше половины мужчин, $1385$ из $2691$, шли на факультеты A и B, где принимали почти две трети. Женщины подавали туда редко, $133$ заявления из $1835$, и в основном шли на C–F, куда поступить трудно всем: там принимали от шести до тридцати семи процентов.

Парадоксом Симпсона называют ситуацию, когда связь, которая есть в каждой из групп, исчезает или меняет знак, если группы объединить. Эдвард Симпсон описал его в 1951 году, хотя замечали его и раньше — Карл Пирсон и Удни Юл на рубеже XIX и XX веков.

Никакого волшебства тут нет, только арифметика средних — та же, что у доски с грузиками.

Пусть группа из $N$ человек разбита на части размеров $n_1, \dots, n_k$, и в части $j$ доля успехов равна $p_j$. Тогда общая доля успехов $p = w_1p_1 + \dots + w_kp_k$, где $w_j = n_j/N$ — доли частей, и она лежит между наименьшей и наибольшей из $p_j$.

Хитрость в том, что общая доля — снова центр масс, как на доске с грузиками. Рисунок — для Беркли, где факультеты A и B объединены в «лёгкие», а C–F — в «трудные».

Успехов в части $j$ было $n_jp_j$, всего успехов $n_1p_1 + \dots + n_kp_k$. Делим на $N$: $p = \frac{n_1}{N}p_1 + \dots + \frac{n_k}{N}p_k$. Веса $w_j = n_j/N$ неотрицательны и в сумме дают $1$, поэтому $p$ не меньше наименьшей из $p_j$ (заменим все $p_j$ наименьшей — сумма только уменьшится) и не больше наибольшей. Для двух частей $p = w\,p_1 + (1 - w)\,p_2 = p_2 + w\,(p_1 - p_2)$: точка между $p_2$ и $p_1$, отстоящая от $p_2$ на долю $w$ расстояния. Отложим по горизонтали $w$ — долю заявлений на лёгкие факультеты, по вертикали — общую долю принятых. Для мужчин общая доля лежит на отрезке от $(0;\ 25{,}5\,\%)$ — все подали на трудные — до $(1;\ 62{,}5\,\%)$ — все подали на лёгкие. У женщин такой же отрезок: от $26{,}5$ % до $79{,}7$ %. И на лёгких, и на трудных факультетах женщин принимали чаще, поэтому их отрезок целиком выше мужского. Но стоят группы на своих отрезках в разных местах. У мужчин $w = 1385/2691 \approx 0{,}51$, их точка — $44{,}5$ %. У женщин $w = 133/1835 \approx 0{,}07$, почти у левого края, и их точка — $30{,}4$ %. Точка на верхнем отрезке слева оказалась ниже точки на нижнем отрезке справа. Будь веса одинаковыми, точки стояли бы на одной вертикали, и верхний отрезок остался бы верхним: $p_{\text{ж}} - p_{\text{м}} = \sum_j w_j\,(p_{\text{ж},j} - p_{\text{м},j}) > 0$. Значит, парадокс Симпсона возможен, только когда группы по-разному распределены между частями.
Тяните точки групп вдоль их отрезков: сдвиньте женщин вправо, к мужскому распределению заявлений, и перевес вернётся к ним.
Каждая строка — факультет; кружки — доли принятых мужчин и женщин, площадь кружка пропорциональна числу заявлений. Нижняя строка — все вместе. Включите «Женщины подают, как мужчины», потом переключитесь на лечение камней в почках.

Если бы женщины распределили свои заявления по шести факультетам так же, как мужчины, то при тех же шансах на каждом факультете их приняли бы около $52$ %, больше, чем мужчин. Бикел и соавторы пришли к выводу, что факультеты если и отдавали кому-то предпочтение, то скорее женщинам. Вопрос сместился с приёмных комиссий на другое: почему женщины чаще шли туда, где мест мало? Но на него отвечает уже не арифметика.

Парадокс встречается и в медицине. В 1986 году британские урологи сравнили две операции по удалению камней из почек: открытую и малоинвазивную, через прокол. В целом малоинвазивная удавалась чаще: $83$ % против $78$ %. Но при мелких камнях открытая операция помогала в $93$ % случаев против $87$ %, а при крупных — в $73$ % против $69$ %. Открытая лучше в обеих группах и хуже в сумме: её чаще применяли в тяжёлых случаях, при крупных камнях.

Какому сравнению верить — по группам или в сумме? Сами числа этого не скажут, нужно понимать, откуда они взялись. Размер камня влиял и на выбор операции, и на её исход, то есть был вмешивающимся фактором, и сравнивать надо внутри групп. Бывают и обратные случаи: если группы образовались уже под действием лечения, деление на них только запутает, и верить надо сумме. Статистика подсказывает, что посчитать; какое из чисел отвечает на ваш вопрос, решает понимание того, как устроено дело.

Факультет за факультетом женщин принимали не реже мужчин. Общий процент у них ниже, потому что они чаще подавали туда, где отказывали всем. Прежде чем сравнивать итоги, спросите, одинаково ли группы распределены по частям.

Пять вопросов к любой новости с числами. Среднее или медиана — и каков разброс? Какова погрешность и как набирали выборку? Сколько гипотез проверили, прежде чем найти эту? Что ещё могло связать две величины и был ли жребий? Не сложили ли в одну кучу разные группы?

Отработать расчёты из всех пяти разборов — медиану и разброс, стандартную ошибку, погрешность опроса, множественные проверки, прогноз с регрессией к среднему и общие доли — можно в тренажёре.

Куда дальше

Во всех пяти историях наблюдения были независимыми: опрошенные не советовались друг с другом, чашки не знали друг о друге, у каждой мармеладки была своя группа. На независимости держались и стандартная ошибка, и формула $1 - 0{,}95^{20}$. Но многое в мире устроено иначе. Буквы в тексте зависят от предыдущих: после твёрдого знака в русском тексте всегда идёт гласная. Погода завтра похожа на погоду сегодня. Пользователь щёлкает по ссылке, которая есть на открытой странице. В статистике мы всё время считали наблюдения независимыми, а здесь каждое следующее зависит от прошлого. Как описать такую зависимость и можно ли измерить, сколько информации несёт сообщение? В 1913 году Андрей Марков пересчитал гласные и согласные в «Евгении Онегине», а в 1948-м Клод Шеннон ответил на второй вопрос одной формулой. Об этом — глава 50.

В этой главе

  1. Средняя температура по больнице
  2. Тысяча человек за весь город
  3. Дама, которая пробовала чай
  4. Шоколад и Нобелевские премии
  5. Беркли, 1973
  6. Куда дальше

Главы курса