Эта методичка охватывает тему 4: Дополнительная теория вероятностей и статистика. Она включает непрерывные распределения, вывод для малых выборок, критерий хи-квадрат и непараметрические тесты, а также производящие функции вероятности.
Дополнительная теория вероятностей и статистика
A-Level Дополнительная математика · Тема 4
8:08
Дополнительная теория вероятностей и статистика
Дублин, девятнадцатьсот восемь. Внутри пивоварни Guinness молодой химик по имени Уильям Госсет сталкивается с очень практичной проблемой. Он может протестировать лишь несколько партий…
Английское озвучивание · Английский + китайские субтитры (встроенные)
4.1
Непрерывные случайные величины
Программа
| Кандидаты должны уметь: | Примечания и примеры |
|---|---|
| использовать функцию плотности вероятности, которая может быть задана кусочно | |
| использовать общее следствие $\text{E}(g(X)) = \int f(x)g(x) \, \mathrm{d}x$, где $f(x)$ является функцией плотности вероятности непрерывной случайной величины $X$, а $g(X)$ — функция от $X$ | |
| понимать и использовать связь между функцией плотности вероятности (PDF) и функцией распределения (CDF), а также использовать любую из них для вычисления вероятностей или перцентилей | |
| использовать функции распределения (CDF) связанных величин в простых случаях. | Например, зная CDF величины $X$, найти CDF связанной величины $Y$, а затем её PDF, например, когда $Y = X^3$. |
Источник: Программа Cambridge International
Непреремнная переменная $X$ описывается функцией плотности вероятности $f(x)$, которая может быть задана кусочно. Вероятность попадания в диапазон равна площади под $f$, а среднее значение любой функции от $X$ равно

Функция накопленного распределения $F(x) = P(X \leqslant x)$ — это накопленная сумма: $F(x) = \displaystyle\int_{-\infty}^{x} f(t)\,dt$, и $f(x) = F'(x)$. Используйте $F$ для нахождения вероятностей и перцентилей (например, медиана определяет $F(x) = 0.5$).

Разбор примера. Случайная величина имеет $f(x) = \tfrac12 x$ при $0 \leqslant x \leqslant 2$. Найдите медиану.
Функция накопленного распределения равна $F(x) = \displaystyle\int_0^x \tfrac12 t\,dt = \tfrac14 x^2$. Приравняйте $F(m) = 0.5$:
Распределение связанной переменной. Если $Y=g(X)$, найдите распределение $Y$ через его функцию накопления. Для $Y=X^2$: $F_Y(y)=P(X^2\leqslant y)=P(-\sqrt y\leqslant X\leqslant\sqrt y)=F_X(\sqrt y)-F_X(-\sqrt y)$, затем дифференцируйте для получения $f_Y=F_Y'$. Когда $g$ монотонно возрастает, существует упрощение, $F_Y(y)=F_X\big(g^{-1}(y)\big)$.
Разбор примера. Имеется $f_X(x)=\tfrac12 x$ на интервале $[0,2]$ (поэтому $F_X(x)=\tfrac14 x^2$), пусть $Y=X^2$. Для $0\leqslant y\leqslant 4$, $F_Y(y)=F_X(\sqrt y)=\tfrac14 y$, следовательно $f_Y(y)=F_Y'(y)=\tfrac14$ — то есть $Y$ распределена равномерно на $[0,4]$.
Непрерывные случайные величины
P(a < X < b) = ∫ f(x) dx
Для непрерывной переменной вероятность равна площади под кривой плотности.
| English | Русский |
|---|---|
| probability density function/ˌprɒbəˈbɪlɪti ˈdensɪti ˈfʌŋkʃn/ | функция плотности вероятности |
| cumulative distribution function/ˈkjuːmjʊlətɪv ˌdɪstrɪˈbjuːʃn ˈfʌŋkʃn/ | функция распределения |
| percentiles/pəˈsentaɪlz/ | перцентилей |
| median/ˈmiːdiːən/ | медианой |
| hypothesis test/haɪˈpɒθəsɪs test/ | статистическая гипотеза |
| confidence interval/ˈkɒnfɪdəns ˈɪntəvl/ | доверительный интервал |
| pooled estimate/puːld ˈestɪmət/ | объединенная оценка |
| chi-squared test/kaɪ skweəd test/ | критерий хи-квадрат |
| theoretical distribution/θɪəˈretɪkl ˌdɪstrɪˈbjuːʃn/ | теоретическое распределение |
| degrees of freedom/dɪˈɡriːz ɒv ˈfriːdəm/ | число степеней свободы |
| goodness of fit/ˈɡʊdnəs ɒv fɪt/ | соответствия |
| independence/ˌɪndɪˈpendəns/ | независимости |
| contingency table/kənˈtɪndʒənsi ˈteɪbl/ | таблица сопряженности |
| non-parametric test/nɒn ˌpærəˈmetrɪk test/ | непараметрический тест |
4.2
Вывод на основе нормального и t-распределений
Программа
| Кандидаты должны уметь: | Примечания и примеры |
|---|---|
| формулировать гипотезы и применять проверку гипотезы относительно среднего значения генеральной совокупности на основе малой выборки, выбранной из нормального распределения с неизвестной дисперсией, используя t-критерий | |
| вычислять объединенную оценку дисперсии генеральной совокупности по двум выборкам | Могут потребоваться расчеты как на основе исходных данных, так и на основе сводных данных. |
| Формулировать гипотезы относительно разности средних генеральных совокупностей и применять, где уместно: - t-критерий для выборки ⟨2⟩ - ** paired t-критерий (для парных выборок)** - тест с использованием нормального распределения | Ожидается способность выбирать тест, соответствующий обстоятельствам задачи. |
| определить доверительный интервал для среднего значения генеральной совокупности на основе малой выборки из нормального распределения с неизвестной дисперсией, используя t-распределение | |
| определить доверительный интервал для разности средних значений генеральных совокупностей, используя t-распределение или нормальное распределение, в зависимости от обстоятельств. |
Источник: Программа Cambridge International

Когда выборка мала, а дисперсия генеральной совокупности неизвестна, основывайте гипотезу на распределении $t$ вместо нормального. Та же идея дает доверительный интервал для среднего:

Разобранное решение. Образец $n = 10$ имеет среднее значение $\bar{x} = 50$ и стандартное отклонение $s = 4$. Найдите доверительный интервал для среднего со степенью достоверности $95\%$ (используйте $t = 2.262$ для $9$ степеней свободы).
Почему малым выборкам нужен t вместо z
При неизвестном $\sigma$ используется $t$, и $t$ имеет более тяжелые хвосты, чем нормальное (нарисовано пунктиром позади него) — поэтому его критические значения больше, а интервал шире. При $9$ степенях свободы, указанных в разобранном решении, виджет показывает $t^* = 2.262$, точно такое же табличное значение, что использовалось выше. Прокрутите df вверх, и $t$ совпадет с нормальным распределением.
Нормальное распределение
Заштрихуйте хвост, чтобы найти вероятность — это основа доверительных интервалов и тестов гипотез.
4.3
Критерии хи-квадрат
Программа
| Кандидаты должны уметь: | Примечания и примеры |
|---|---|
| подбирать теоретическое распределение, предписанное данной гипотезой, к имеющимся данным | Задания не будут включать длительные вычисления. |
| использовать $\chi^2$-критерий с соответствующим числом степеней свободы для проведения анализа соответствия (goodness of fit) | Классы следует объединять так, чтобы каждая ожидаемая частота была не менее 5. |
| использовать $\chi^2$-критерий с соответствующим числом степеней свободы для проверки независимости в таблице сопряженности. | Поправка Йейтса не требуется. При необходимости следует объединять строки или столбцы так, чтобы ожидаемая частота в каждой ячейке составляла не менее 5. |
Источник: Программа Cambridge International
Критерий $\chi^2$ (χ²-критерий) сравнивает наблюдаемые частоты $O$ с ожидаемыми частотами $E$ из теоретического распределения:

Разбор примера. Четыре равновероятные категории дают наблюдаемые частоты $20, 30, 25, 25$ (поэтому каждая ожидаемая частота равна $25$). Проверьте соответствие на уровне значимости $5\%$.
Распределение хи-квадрат и его хвост на 5%
Разобранное решение на этой странице дает $\chi^2 = 2$ при $3$ степенях свободы против табличного значения $7.815$ — виджет воспроизводит оба. Перетащите df, чтобы увидеть, почему критическое значение меняется в зависимости от числа категорий.
Маршрут хи-квадрат теста
Следуйте наблюдаемым и ожидаемым частотам для принятия решения по тесту.
4.4
Непараметрические тесты
Программа
| Кандидаты должны уметь: | Примечания и примеры |
|---|---|
| понимать концепцию непараметрического критерия и оценивать ситуации, в которых такой критерий может быть полезен | например, при выборочном исследовании из генеральной совокупности, которую нельзя считать нормально распределенной. |
| понимать основу знакового теста, теста Вилкоксона о рангах со знаками и теста Вилкоксона о сумме рангов | Включая знание того, что тесты Вилкоксона применимы только для симметричных распределений. |
| использовать одновыборочный знаковый тест и одновыборочный тест Вилкоксона о рангах со знаками для проверки гипотезы относительно медианы генеральной совокупности | Включая использование нормальных приближений там, где это уместно. Задания не будут включать одинаковые ранги или наблюдения, равные проверяемому значению медианы генеральной совокупности. |
| использовать парный знаковый тест, тест Вилкоксона для спаренных выборок о рангах со знаками и тест Вилкоксона о сумме рангов (при необходимости) для проверки равенства генеральных совокупностей. | Включая использование нормальных приближений там, где это уместно. Задания не будут включать одинаковые ранги или пары нулевой разницы. |
Источник: Программа Cambridge International
Непараметрический тест не предполагает нормальное распределение данных, поэтому он полезен, когда это предположение нарушается. Основные из них:
- знаковый тест: подсчитайте, сколько значений находятся выше и ниже предполагаемой медианы, и протестируйте эти подсчеты с помощью биномиальной модели;
- критерий Вилкоксона для связанных выборок (тест для парных данных), который также использует величины различий, а не только их знаки;
- критерий Вилкоксона для независимых выборок, для сравнения двух отдельных выборок.

Разобранный пример. Проверьте, является ли медиана равной $5$. В выборке из $10$ значений (ни одно не равно $5$), $9$ находятся выше $5$, а $1$ — ниже. Проведите тест на уровне значимости $5\%$ (двусторонний).
При условии $H_0$ (медиана $= 5$) количество наблюдений выше нее следует распределению $B(10, 0.5)$. Наблюдаемый результат ($9$ над медианой) является экстремальным, поэтому найдите P-значение $P(X \geq 9) = \binom{10}{9}(0.5)^{10} + (0.5)^{10} = \dfrac{11}{1024} = 0.0107$. Для двустороннего теста сравните со значением $\tfrac{1}{2}(5\%) = 0.025$. Поскольку $0.0107 < 0.025$, отвергаем гипотезу $H_0$: есть доказательства того, что медиана не равна $5$.
Выбор непараметрического теста
Выберите ранговый тест, соответствующий ситуации с данными.
| English | Русский |
|---|---|
| sign test/saɪn test/ | тест знаков |
| Wilcoxon signed-rank test/ˈwɪlkɒksn saɪnd ræŋk test/ | критерий Вилкоксона для связанных выборок |
| Wilcoxon rank-sum test/ˈwɪlkɒksn ræŋk sʌm test/ | критерий Вилкоксона |
| probability generating function/ˌprɒbəˈbɪlɪti ˈdʒenəreɪtɪŋ ˈfʌŋkʃn/ | функция порождения вероятностей |
| Further Probability & Statistics/ˈfɜːðə ˌprɒbəˈbɪlɪti ænd stəˈtɪstɪks/ | Дополнительная теория вероятностей и статистика |
4.5
Генерирующие функции вероятностей
Программа
| Кандидаты должны уметь: | Примечания и примеры |
|---|---|
| понимать концепцию функции порождения вероятностей (PGF) и составлять и использовать PGF для заданных распределений | Включая дискретное равномерное, биномиальное, геометрическое и пуассоновское распределения. |
| использовать формулы для математического ожидания и дисперсии дискретной случайной переменной через её PGF, а также применять эти формулы для вычисления математического ожидания и дисперсии заданного распределения вероятностей | |
| использовать результат о том, что PGF суммы независимых случайных величин является произведением их PGF. |
Источник: Программа Cambridge International

Генерирующая функция вероятностей дискретной случайной величины $X$ имеет вид
Разбор примера. Случайная величина $X$ принимает значения $P(X=0) = 0.5$, $P(X=1) = 0.3$, $P(X=2) = 0.2$. Найдите P-функцию (PGF) $E(X)$.
Здесь $G(t) = 0.5 + 0.3t + 0.2t^2$, следовательно $G'(t) = 0.3 + 0.4t$ и

Лабораторная работа: функция порождения вероятностей
G(x) = p0 + p1 x + p2 x^2 + ...
Измените x и посмотрите, как ФПВ хранит вероятности в степенях x.
4.5
Советы для экзамена
- Для непрерывной случайной величины плотность вероятности интегрируется до $1$ по всему диапазону, а интеграл равен $E(X) = \int x f(x)\,dx$.
- Используйте распределение t-Стьюдента ($t$-распределение), когда выборка мала, а генеральная дисперсия неизвестна; укажите число степеней свободы.
- Для χ²-критерия вычислите статистику $\sum (O-E)^2/E$, сравните её с критическим значением для соответствующих степеней свободы и объедините классы с малыми частотами $E < 5$.
- Укажите нулевую и альтернативную гипотезы $H_0$ и $H_1$ и дайте вывод в контексте задачи для каждого теста.
Интерактивные уроки по этой теме
Пройдите его шаг за шагом с упражнениями мгновенной проверки.