Перейти к содержанию

Дополнительная теория вероятностей и статистика

A-Level Дополнительная математика · Тема 4

Видеоурок по этой теме Открыть страницу видео
8:08

Дополнительная теория вероятностей и статистика

Дублин, девятнадцатьсот восемь. Внутри пивоварни Guinness молодой химик по имени Уильям Госсет сталкивается с очень практичной проблемой. Он может протестировать лишь несколько партий…

Английское озвучивание · Английский + китайские субтитры (встроенные)

Эта методичка охватывает тему 4: Дополнительная теория вероятностей и статистика. Она включает непрерывные распределения, вывод для малых выборок, критерий хи-квадрат и непараметрические тесты, а также производящие функции вероятности.

4.1

Непрерывные случайные величины

Программа
Кандидаты должны уметь: Примечания и примеры
использовать функцию плотности вероятности, которая может быть задана кусочно
использовать общее следствие $\text{E}(g(X)) = \int f(x)g(x) \, \mathrm{d}x$, где $f(x)$ является функцией плотности вероятности непрерывной случайной величины $X$, а $g(X)$ — функция от $X$
понимать и использовать связь между функцией плотности вероятности (PDF) и функцией распределения (CDF), а также использовать любую из них для вычисления вероятностей или перцентилей
использовать функции распределения (CDF) связанных величин в простых случаях. Например, зная CDF величины $X$, найти CDF связанной величины $Y$, а затем её PDF, например, когда $Y = X^3$.

Источник: Программа Cambridge International

Непреремнная переменная $X$ описывается функцией плотности вероятности $f(x)$, которая может быть задана кусочно. Вероятность попадания в диапазон равна площади под $f$, а среднее значение любой функции от $X$ равно

$$E(g(X)) = \int g(x)\,f(x)\,dx.$$

Плотность, где площадь слева от медианы заштрихована как одна половина
Медиана находится там, где площадь под $f(x)$ слева от нее составляет ровно $0.5$.

Функция накопленного распределения $F(x) = P(X \leqslant x)$ — это накопленная сумма: $F(x) = \displaystyle\int_{-\infty}^{x} f(t)\,dt$, и $f(x) = F'(x)$. Используйте $F$ для нахождения вероятностей и перцентилей (например, медиана определяет $F(x) = 0.5$).

Растущая функция распределения от 0 до 1, где медиана определяется на уровне высоты 0,5
График накопленного распределения $F(x)$ возрастает от $0$ до $1$; высота $0.5$ достигается в точке медианы.

Разбор примера. Случайная величина имеет $f(x) = \tfrac12 x$ при $0 \leqslant x \leqslant 2$. Найдите медиану.

Функция накопленного распределения равна $F(x) = \displaystyle\int_0^x \tfrac12 t\,dt = \tfrac14 x^2$. Приравняйте $F(m) = 0.5$:

$$\tfrac14 m^2 = 0.5 \;\Rightarrow\; m^2 = 2 \;\Rightarrow\; m = \sqrt{2} = 1.41.$$

Распределение связанной переменной. Если $Y=g(X)$, найдите распределение $Y$ через его функцию накопления. Для $Y=X^2$: $F_Y(y)=P(X^2\leqslant y)=P(-\sqrt y\leqslant X\leqslant\sqrt y)=F_X(\sqrt y)-F_X(-\sqrt y)$, затем дифференцируйте для получения $f_Y=F_Y'$. Когда $g$ монотонно возрастает, существует упрощение, $F_Y(y)=F_X\big(g^{-1}(y)\big)$.

Разбор примера. Имеется $f_X(x)=\tfrac12 x$ на интервале $[0,2]$ (поэтому $F_X(x)=\tfrac14 x^2$), пусть $Y=X^2$. Для $0\leqslant y\leqslant 4$, $F_Y(y)=F_X(\sqrt y)=\tfrac14 y$, следовательно $f_Y(y)=F_Y'(y)=\tfrac14$ — то есть $Y$ распределена равномерно на $[0,4]$.

Исследовать

Непрерывные случайные величины

P(a < X < b) = ∫ f(x) dx

Для непрерывной переменной вероятность равна площади под кривой плотности.

English Русский
probability density function/ˌprɒbəˈbɪlɪti ˈdensɪti ˈfʌŋkʃn/ функция плотности вероятности
cumulative distribution function/ˈkjuːmjʊlətɪv ˌdɪstrɪˈbjuːʃn ˈfʌŋkʃn/ функция распределения
percentiles/pəˈsentaɪlz/ перцентилей
median/ˈmiːdiːən/ медианой
hypothesis test/haɪˈpɒθəsɪs test/ статистическая гипотеза
confidence interval/ˈkɒnfɪdəns ˈɪntəvl/ доверительный интервал
pooled estimate/puːld ˈestɪmət/ объединенная оценка
chi-squared test/kaɪ skweəd test/ критерий хи-квадрат
theoretical distribution/θɪəˈretɪkl ˌdɪstrɪˈbjuːʃn/ теоретическое распределение
degrees of freedom/dɪˈɡriːz ɒv ˈfriːdəm/ число степеней свободы
goodness of fit/ˈɡʊdnəs ɒv fɪt/ соответствия
independence/ˌɪndɪˈpendəns/ независимости
contingency table/kənˈtɪndʒənsi ˈteɪbl/ таблица сопряженности
non-parametric test/nɒn ˌpærəˈmetrɪk test/ непараметрический тест
4.2

Вывод на основе нормального и t-распределений

Программа
Кандидаты должны уметь: Примечания и примеры
формулировать гипотезы и применять проверку гипотезы относительно среднего значения генеральной совокупности на основе малой выборки, выбранной из нормального распределения с неизвестной дисперсией, используя t-критерий
вычислять объединенную оценку дисперсии генеральной совокупности по двум выборкам Могут потребоваться расчеты как на основе исходных данных, так и на основе сводных данных.
Формулировать гипотезы относительно разности средних генеральных совокупностей и применять, где уместно: - t-критерий для выборки ⟨2⟩ - ** paired t-критерий (для парных выборок)** - тест с использованием нормального распределения Ожидается способность выбирать тест, соответствующий обстоятельствам задачи.
определить доверительный интервал для среднего значения генеральной совокупности на основе малой выборки из нормального распределения с неизвестной дисперсией, используя t-распределение
определить доверительный интервал для разности средних значений генеральных совокупностей, используя t-распределение или нормальное распределение, в зависимости от обстоятельств.

Источник: Программа Cambridge International

Доска Гальтона с шарами, сложенными в форму колокола
Доска Гальтона: падающие шары через штырьки складываются в колоколообразное нормальное распределение.

Когда выборка мала, а дисперсия генеральной совокупности неизвестна, основывайте гипотезу на распределении $t$ вместо нормального. Та же идея дает доверительный интервал для среднего:

$$\bar{x} \pm t\,\frac{s}{\sqrt{n}},$$
где $t$ берется из таблиц распределения $t$ с $n - 1$ степенями свободы. Для сравнения двух совокупностей используйте двухвыборочный (2-выборочный) или парный тест $t$, предварительно найдя объединенную оценку общей дисперсии при необходимости.

Кривая t-распределения, расположенная ниже и шире стандартного нормального
Для малой выборки распределение $t$ более полого с тяжелыми хвостами, поэтому его критические значения больше.

Разобранное решение. Образец $n = 10$ имеет среднее значение $\bar{x} = 50$ и стандартное отклонение $s = 4$. Найдите доверительный интервал для среднего со степенью достоверности $95\%$ (используйте $t = 2.262$ для $9$ степеней свободы).

$$50 \pm 2.262\times\frac{4}{\sqrt{10}} = 50 \pm 2.86 \;\Rightarrow\; (47.1,\ 52.9).$$

Исследовать

Почему малым выборкам нужен t вместо z

При неизвестном $\sigma$ используется $t$, и $t$ имеет более тяжелые хвосты, чем нормальное (нарисовано пунктиром позади него) — поэтому его критические значения больше, а интервал шире. При $9$ степенях свободы, указанных в разобранном решении, виджет показывает $t^* = 2.262$, точно такое же табличное значение, что использовалось выше. Прокрутите df вверх, и $t$ совпадет с нормальным распределением.

Исследовать

Нормальное распределение

Заштрихуйте хвост, чтобы найти вероятность — это основа доверительных интервалов и тестов гипотез.

4.3

Критерии хи-квадрат

Программа
Кандидаты должны уметь: Примечания и примеры
подбирать теоретическое распределение, предписанное данной гипотезой, к имеющимся данным Задания не будут включать длительные вычисления.
использовать $\chi^2$-критерий с соответствующим числом степеней свободы для проведения анализа соответствия (goodness of fit) Классы следует объединять так, чтобы каждая ожидаемая частота была не менее 5.
использовать $\chi^2$-критерий с соответствующим числом степеней свободы для проверки независимости в таблице сопряженности. Поправка Йейтса не требуется. При необходимости следует объединять строки или столбцы так, чтобы ожидаемая частота в каждой ячейке составляла не менее 5.

Источник: Программа Cambridge International

Критерий $\chi^2$ (χ²-критерий) сравнивает наблюдаемые частоты $O$ с ожидаемыми частотами $E$ из теоретического распределения:

$$\chi^2 = \sum \frac{(O - E)^2}{E}.$$
Сравните это значение с табличным для соответствующего числа степеней свободы. Два применения: тест пригодности (соответствуют ли данные предложенной модели?) и тест на независимость двух переменных в таблице сопряженности.

Асимметричный вправо график хи-квадрат с заштрихованной верхней 5%-хвостовой областью за критическим значением
Критерий отвергает модель, когда $\chi^2$ превышает критическое значение, попадая в заштрихованный правый хвост $5\%$.

Разбор примера. Четыре равновероятные категории дают наблюдаемые частоты $20, 30, 25, 25$ (поэтому каждая ожидаемая частота равна $25$). Проверьте соответствие на уровне значимости $5\%$.

$$\chi^2 = \frac{(20-25)^2 + (30-25)^2 + 0 + 0}{25} = \frac{25 + 25}{25} = 2.$$
При $4 - 1 = 3$ степенях свободы табличное значение равно $7.815$. Поскольку $2 < 7.815$, не отвергаем модель.

Исследовать

Распределение хи-квадрат и его хвост на 5%

Разобранное решение на этой странице дает $\chi^2 = 2$ при $3$ степенях свободы против табличного значения $7.815$ — виджет воспроизводит оба. Перетащите df, чтобы увидеть, почему критическое значение меняется в зависимости от числа категорий.

Исследовать

Маршрут хи-квадрат теста

Следуйте наблюдаемым и ожидаемым частотам для принятия решения по тесту.

4.4

Непараметрические тесты

Программа
Кандидаты должны уметь: Примечания и примеры
понимать концепцию непараметрического критерия и оценивать ситуации, в которых такой критерий может быть полезен например, при выборочном исследовании из генеральной совокупности, которую нельзя считать нормально распределенной.
понимать основу знакового теста, теста Вилкоксона о рангах со знаками и теста Вилкоксона о сумме рангов Включая знание того, что тесты Вилкоксона применимы только для симметричных распределений.
использовать одновыборочный знаковый тест и одновыборочный тест Вилкоксона о рангах со знаками для проверки гипотезы относительно медианы генеральной совокупности Включая использование нормальных приближений там, где это уместно. Задания не будут включать одинаковые ранги или наблюдения, равные проверяемому значению медианы генеральной совокупности.
использовать парный знаковый тест, тест Вилкоксона для спаренных выборок о рангах со знаками и тест Вилкоксона о сумме рангов (при необходимости) для проверки равенства генеральных совокупностей. Включая использование нормальных приближений там, где это уместно. Задания не будут включать одинаковые ранги или пары нулевой разницы.

Источник: Программа Cambridge International

Непараметрический тест не предполагает нормальное распределение данных, поэтому он полезен, когда это предположение нарушается. Основные из них:

  • знаковый тест: подсчитайте, сколько значений находятся выше и ниже предполагаемой медианы, и протестируйте эти подсчеты с помощью биномиальной модели;
  • критерий Вилкоксона для связанных выборок (тест для парных данных), который также использует величины различий, а не только их знаки;
  • критерий Вилкоксона для независимых выборок, для сравнения двух отдельных выборок.
Числовая прямая с пунктирной медианой: три точки под ней помечены минусом, четыре над ней — плюсом
Знаковый тест подсчитывает, сколько значений находится выше и ниже предлагаемой медианы, затем проверяет эти подсчеты с помощью биномиальной модели

Разобранный пример. Проверьте, является ли медиана равной $5$. В выборке из $10$ значений (ни одно не равно $5$), $9$ находятся выше $5$, а $1$ — ниже. Проведите тест на уровне значимости $5\%$ (двусторонний).

При условии $H_0$ (медиана $= 5$) количество наблюдений выше нее следует распределению $B(10, 0.5)$. Наблюдаемый результат ($9$ над медианой) является экстремальным, поэтому найдите P-значение $P(X \geq 9) = \binom{10}{9}(0.5)^{10} + (0.5)^{10} = \dfrac{11}{1024} = 0.0107$. Для двустороннего теста сравните со значением $\tfrac{1}{2}(5\%) = 0.025$. Поскольку $0.0107 < 0.025$, отвергаем гипотезу $H_0$: есть доказательства того, что медиана не равна $5$.

Исследовать

Выбор непараметрического теста

Выберите ранговый тест, соответствующий ситуации с данными.

English Русский
sign test/saɪn test/ тест знаков
Wilcoxon signed-rank test/ˈwɪlkɒksn saɪnd ræŋk test/ критерий Вилкоксона для связанных выборок
Wilcoxon rank-sum test/ˈwɪlkɒksn ræŋk sʌm test/ критерий Вилкоксона
probability generating function/ˌprɒbəˈbɪlɪti ˈdʒenəreɪtɪŋ ˈfʌŋkʃn/ функция порождения вероятностей
Further Probability & Statistics/ˈfɜːðə ˌprɒbəˈbɪlɪti ænd stəˈtɪstɪks/ Дополнительная теория вероятностей и статистика
4.5

Генерирующие функции вероятностей

Программа
Кандидаты должны уметь: Примечания и примеры
понимать концепцию функции порождения вероятностей (PGF) и составлять и использовать PGF для заданных распределений Включая дискретное равномерное, биномиальное, геометрическое и пуассоновское распределения.
использовать формулы для математического ожидания и дисперсии дискретной случайной переменной через её PGF, а также применять эти формулы для вычисления математического ожидания и дисперсии заданного распределения вероятностей
использовать результат о том, что PGF суммы независимых случайных величин является произведением их PGF.

Источник: Программа Cambridge International

Набор полигональных игральных костей
Игральные кости: отправная точка для теории вероятностей и дискретных случайных величин.

Генерирующая функция вероятностей дискретной случайной величины $X$ имеет вид

$$G(t) = E(t^X) = \sum_x P(X = x)\,t^x.$$
Она упаковывает всё распределение в одну функцию. Математическое ожидание и дисперсия получаются из её производных при $t = 1$: $E(X) = G'(1)$ и $\mathrm{Var}(X) = G''(1) + G'(1) - \big(G'(1)\big)^2$. Кроме того, ГФ суммы независимых величин равна произведению их ГФ.

Разбор примера. Случайная величина $X$ принимает значения $P(X=0) = 0.5$, $P(X=1) = 0.3$, $P(X=2) = 0.2$. Найдите P-функцию (PGF) $E(X)$.

Здесь $G(t) = 0.5 + 0.3t + 0.2t^2$, следовательно $G'(t) = 0.3 + 0.4t$ и

$$E(X) = G'(1) = 0.3 + 0.4 = 0.7.$$

ГФ честной игральной кости упаковывает одинаковые массы от 1 до 6 в G(t)
ГФ честной игральной кости упаковывает одинаковые массы от 1 до 6 в G(t)
Исследовать

Лабораторная работа: функция порождения вероятностей

G(x) = p0 + p1 x + p2 x^2 + ...

Измените x и посмотрите, как ФПВ хранит вероятности в степенях x.

4.5

Советы для экзамена

  • Для непрерывной случайной величины плотность вероятности интегрируется до $1$ по всему диапазону, а интеграл равен $E(X) = \int x f(x)\,dx$.
  • Используйте распределение t-Стьюдента ($t$-распределение), когда выборка мала, а генеральная дисперсия неизвестна; укажите число степеней свободы.
  • Для χ²-критерия вычислите статистику $\sum (O-E)^2/E$, сравните её с критическим значением для соответствующих степеней свободы и объедините классы с малыми частотами $E < 5$.
  • Укажите нулевую и альтернативную гипотезы $H_0$ и $H_1$ и дайте вывод в контексте задачи для каждого теста.

Интерактивные уроки по этой теме

Пройдите его шаг за шагом с упражнениями мгновенной проверки.

Архив экзаменационных работ

Больше тем в A-Level Дополнительная математика

Войти или создать аккаунт

IGCSE, A-Level & AP