Passer au contenu

Distributions d'échantillonnage

AP Statistiques · Sujet 5

Entrainer
Leçon vidéo pour ce sujet Ouvrir la page vidéo
7:32

Distributions d'échantillonnage

Deux mille élèves fréquentent cette école, et certains y vont en vélo. Nous voulons connaître la part. Personne ne peut interroger les deux mille, nous interrogons donc cent personnes au hasard.…

Narration en anglais · Sous-titres anglais + 中文 incrustés

5.1

Why Two Samples Never Match: Sampling Variability

Programme

Compréhension durable (VAR-1) : Étant donné que la variation peut être aléatoire ou non, les conclusions sont incertaines.

Objectif d'apprentissage VAR-1.G : Identifier les questions suggérées par la variation des statistiques pour des échantillons collectés dans la même population. [Compétence 1.A]

  • VAR-1.G.1 La variation des statistiques pour des échantillons prélevés dans la même population peut être aléatoire ou non.

Source : Description du cours et de l'examen AP College Board

Une statistique 统计量 (comme une moyenne d'échantillon $\bar{x}$ ou une proportion d'échantillon $\hat{p}$) est calculée à partir d'un échantillon et varie d'un échantillon à l'autre – c'est la variabilité d'échantillonnage 抽样变异. Un paramètre 参数 ($\mu$ ou $p$) est la vérité fixe concernant la population. La distribution d'échantillonnage 抽样分布 est la distribution d'une statistique sur tous les échantillons possibles d'une taille donnée – c'est le pont entre un seul échantillon et l'inférence.

5.2

The Normal Curve as a Model for a Statistic

Programme

Compréhension durable (VAR-6) : La distribution normale peut être utilisée pour modéliser la variation.

Objectif d'apprentissage VAR-6.A : Calculer la probabilité qu'une valeur particulière se trouve dans un intervalle donné d'une distribution normale. [Compétence 3.A]

  • VAR-6.A.1 Une variable aléatoire continue est une variable qui peut prendre n'importe quelle valeur dans un domaine spécifié. Chaque intervalle dans le domaine a une probabilité associée.
  • VAR-6.A.2 Une variable aléatoire continue avec une distribution normale est couramment utilisée pour décrire des populations. La distribution d'une variable aléatoire normale peut être décrite par une courbe normale ou en « forme de cloche ».
  • VAR-6.A.3 L'aire sous une courbe normale sur un intervalle donné représente la probabilité qu'une valeur particulière se trouve dans cet intervalle.
    • Exemples illustratifs pour VAR-6.A : Variable aléatoire continue : Si l'on regarde une horloge à un moment aléatoire, la probabilité que l'aiguille des minutes soit entre 3 et 6 est un quart.

Objectif d'apprentissage VAR-6.B : Déterminer l'intervalle associé à une aire donnée dans une distribution normale. [Compétence 3.A]

  • VAR-6.B.1 Les bornes d'un intervalle associé à une zone donnée dans une distribution normale peuvent être déterminées à l'aide de scores $z$ ou de technologies, telles qu'une calculatrice, une table de la loi normale standard ou des sorties générées par ordinateur.
  • VAR-6.B.2 Les intervalles associés à une aire donnée dans une distribution normale peuvent être déterminés en attribuant des inégalités appropriées aux bornes des intervalles :
    • a. $P(X < x_a) = \dfrac{p}{100}$ signifie que le bas $p\%$ de valeurs se trouvent à gauche de $x_a$.
    • b. $P(x_a < X < x_b) = \dfrac{p}{100}$ signifie que $p\%$ de valeurs se trouvent entre $x_a$ et $x_b$.
    • c. $P(X > x_b) = \dfrac{p}{100}$ signifie que les $p\%$ plus élevés de valeurs se trouvent à droite de $x_b$.
    • d. Pour déterminer les valeurs les plus extrêmes $p\%$, il faut diviser l'aire associée à $p\%$ en deux parties égales de part et d'autre de la distribution : $P(X < x_a) = \dfrac{1}{2}\dfrac{p}{100}$ et $P(X > x_b) = \dfrac{1}{2}\dfrac{p}{100}$ signifie que la moitié des $p\%$ valeurs les plus extrêmes se trouvent à gauche de $x_a$ et la moitié des $p\%$ valeurs les plus extrêmes se trouvent à droite de $x_b$.

Objectif d'apprentissage VAR-6.C : Déterminer l'opportunité d'utiliser la distribution normale pour approximer les probabilités pour des distributions inconnues. [Compétence 3.C]

  • VAR-6.C.1 Les distributions normales sont symétriques et en « forme de cloche ». Par conséquent, elles peuvent être utilisées pour approximer des distributions ayant des caractéristiques similaires.

Source : Description du cours et de l'examen AP College Board

La loi normale

Pour des échantillons suffisamment grands, de nombreuses distributions d'échantillonnage sont approximativement normales. Cela nous permet de décrire une statistique par un centre (sa moyenne), une dispersion (son erreur type 标准误), et une forme normale – puis de calculer la probabilité qu'un résultat d'échantillon donné soit obtenu.

Explorer

Utiliser la courbe normale pour trouver une proportion

Un modèle normale transforme une plage de valeurs en une aire = une proportion. Hachurez une bande pour lire la fraction d'échantillons qui tombe dans cette plage (la règle 68-95-99.7).

5.3

Le théorème central limite

Programme

Compréhension durable (UNC-3) : Le raisonnement probabiliste nous permet d'anticiper des motifs dans les données.

Objectif d'apprentissage UNC-3.H : Estimer les distributions d'échantillonnage en utilisant la simulation. [Compétence 3.C]

  • UNC-3.H.1 Une distribution d'échantillonnage d'une statistique est la distribution des valeurs de cette statistique pour tous les échantillons possibles d'une taille donnée provenant d'une population donnée.
  • UNC-3.H.2 Le théorème central limite (TCL) stipule que lorsque la taille de l'échantillon est suffisamment grande, une distribution d'échantillonnage de la moyenne d'une variable aléatoire sera approximativement normalement distribuée.
  • UNC-3.H.3 Le théorème central limite exige que les valeurs de l'échantillon soient indépendantes les unes des autres et que $n$ soit suffisamment grand.
  • UNC-3.H.4 Une distribution de randomisation est un ensemble de statistiques générées par simulation en supposant des valeurs connues pour les paramètres. Pour une expérience randomisée, cela signifie réallouer/réattribuer à nouveau aléatoirement les valeurs de la variable réponse aux groupes de traitement.
  • UNC-3.H.5 La distribution d'échantillonnage d'une statistique peut être simulée en générant des échantillons aléatoires répétés à partir d'une population.

Source : Description du cours et de l'examen AP College Board

Le Théorème Central Limite

Le Théorème Central Limite 中心极限定理 (TCL) : pour une moyenne d'échantillon, si la taille de l'échantillon $n$ est suffisamment grande (une règle courante est $n\ge 30$), la distribution d'échantillonnage de $\bar{x}$ est approximativement normale, quel que soit la forme de la population. Plus $n$ est grand, plus la distribution est normale et resserrée.

La moyenne d'échantillon est presque normale quelle que soit la forme de la population
La moyenne d'échantillon est presque normale quelle que soit la forme de la population
Explorer

Observer la transformation d'une distribution d'échantillonnage en normalité

Le Théorème Central Limite : pour un échantillon suffisamment grand, la distribution de la moyenne de l'échantillon est approximativement normale, quelle que soit la forme de la population.

Vocabulaire Entrainer
Anglais Chinois Pinyin
statistic/stəˈtɪstɪk/ 统计量 tǒng jì liàng
sampling variability/ˈsæmplɪŋ ˌveərɪəˈbɪlɪti/ 抽样变异 chōu yàng biàn yì
parameter/pəˈræmɪtə/ 参数 cān shù
sampling distribution/ˈsæmplɪŋ ˌdɪstrɪˈbjuːʃn/ 抽样分布 chōu yàng fēn bù
standard error/ˈstændəd ˈerə/ 标准误 biāo zhǔn wù
5.4

Good Guesses and Bad Guesses: Bias

Programme

Compréhension durable (UNC-3) : Le raisonnement probabiliste nous permet d'anticiper des motifs dans les données.

Objectif d'apprentissage UNC-3.I : Expliquer pourquoi un estimateur est ou n'est pas sans biais. [Compétence 4.B]

  • UNC-3.I.1 Lors de l'estimation d'un paramètre de population, un estimateur est sans biais si, en moyenne, la valeur de l'estimateur est égale au paramètre de la population.

Objectif d'apprentissage UNC-3.J : Calculer des estimations pour un paramètre de population. [Compétence 3.B]

  • UNC-3.J.1 Lors de l'estimation d'un paramètre de population, un estimateur présente une variabilité qui peut être modélisée à l'aide de probabilités.
  • UNC-3.J.2 Une statistique d'échantillon est un estimateur ponctuel du paramètre de population correspondant.

Source : Description du cours et de l'examen AP College Board

Une statistique est non biaisée 无偏 si la moyenne de sa distribution d'échantillonnage est égale au paramètre – elle est correcte en moyenne. Le biais concerne le décalage du centre ; la variabilité concerne l'étalement. Un bon estimateur est à la fois non biaisé (centré correctement) et à faible variabilité (précis) ; de plus grands échantillons réduisent la variabilité mais ne corrigent pas le biais dû à un mauvais échantillonnage.

Quatre distributions d'échantillonnage croisant le biais avec la variabilité, par rapport au paramètre vrai
Le biais et la variabilité sont des défauts séparés. Seul l'estimateur en haut à gauche est à la fois centré sur $\theta$ et resserré ; celui en bas à gauche est précis mais toujours faux, ce qu'aucune quantité supplémentaire de données ne pourra corriger.
5.5

The Sampling Distribution of a Sample Proportion

Programme

Compréhension durable (UNC-3) : Le raisonnement probabiliste nous permet d'anticiper des motifs dans les données.

Objectif d'apprentissage UNC-3.K : Déterminer les paramètres d'une distribution d'échantillonnage pour les proportions d'échantillon. [Compétence 3.B]

  • UNC-3.K.1 Pour des échantillons indépendants (tirage avec remise) d'une variable catégorielle provenant d'une population avec proportion de population $p$, la distribution d'échantillonnage de la proportion d'échantillon, $\hat{p}$, a une moyenne, $\mu_{\hat{p}} = p$ et un écart-type, $\sigma_{\hat{p}} = \sqrt{\dfrac{p(1-p)}{n}}$.
  • UNC-3.K.2 Si le tirage est effectué sans remise, l'écart-type de la proportion d'échantillon est inférieur à celui donné par la formule ci-dessus. Si la taille de l'échantillon est inférieure à 10 % de la taille de la population, la différence est négligeable.

Objectif d'apprentissage UNC-3.L : Déterminer si une distribution d'échantillonnage pour une proportion d'échantillon peut être décrite comme approximativement normale. [Compétence 3.C]

  • UNC-3.L.1 Pour une variable catégorielle, la distribution d'échantillonnage de la proportion d'échantillon, $\hat{p}$, aura une distribution approximativement normale, à condition que la taille de l'échantillon soit suffisamment grande : $np \geq 10$ et $n(1-p) \geq 10$

Objectif d'apprentissage UNC-3.M : Interpréter les probabilités et les paramètres pour une distribution d'échantillonnage pour une proportion d'échantillon. [Compétence 4.B]

  • UNC-3.M.1 Les probabilités et les paramètres pour une distribution d'échantillonnage pour une proportion d'échantillon doivent être interprétés en utilisant des unités appropriées et dans le contexte d'une population spécifique.

Source : Description du cours et de l'examen AP College Board

Pour une proportion d'échantillon $\hat{p}$ provenant d'un SRS : la moyenne est $p$ (sans biais), et l'écart-type est

$$\sigma_{\hat p}=\sqrt{\frac{p(1-p)}{n}}.$$
Cette dispersion a deux noms : c'est l'écart-type de la distribution d'échantillonnage, et on l'appelle erreur standard une fois que vous devez l'estimer à partir de l'échantillon (en remplaçant $p$ par $\hat p$) — ce que font exactement les unités d'inférence ultérieures. Elle est approximativement normale lorsque $np\ge 10$ et $n(1-p)\ge 10$ (la condition des Grandes Comptages), et la condition $10\%$ ($n\le 0.10N$) maintient les observations quasi-indépendantes.

Exemple résolu. Supposons que $40\%$ des électeurs favorisent une mesure ($p=0.4$) et que vous échantillonnez $n=100$. L'erreur standard est $\sigma_{\hat p}=\sqrt{\dfrac{0.4(0.6)}{100}}=0.049$. La probabilité qu'un échantillon donne $\hat{p}>0.5$ est $z=\dfrac{0.5-0.4}{0.049}=2.04$, donc $P(\hat p>0.5)\approx0.02$ – une majorité dans l'échantillon serait surprenante.

5.6

Comparer deux groupes : Différence des proportions d'échantillon

Programme

Compréhension durable (UNC-3) : Le raisonnement probabiliste nous permet d'anticiper des motifs dans les données.

Objectif d'apprentissage UNC-3.N : Déterminer les paramètres d'une distribution d'échantillonnage pour une différence de proportions d'échantillon. [Compétence 3.B]

  • UNC-3.N.1 Pour une variable catégorielle, lors d'un tirage aléatoire avec remise de deux populations indépendantes avec proportions de population $p_1$ et $p_2$, la distribution d'échantillonnage de la différence de proportions d'échantillon $\hat{p}_1 - \hat{p}_2$ a une moyenne, $\mu_{\hat{p}_1 - \hat{p}_2} = p_1 - p_2$ et un écart-type, $\sigma_{\hat{p}_1 - \hat{p}_2} = \sqrt{\dfrac{p_1(1-p_1)}{n_1} + \dfrac{p_2(1-p_2)}{n_2}}$.
  • UNC-3.N.2 Si le tirage est effectué sans remise, l'écart-type de la différence de proportions d'échantillon est inférieur à celui donné par la formule ci-dessus. Si les tailles d'échantillon sont inférieures à 10 % des tailles de population, la différence est négligeable.

Objectif d'apprentissage UNC-3.O : Déterminer si une distribution d'échantillonnage pour une différence de proportions d'échantillon peut être décrite comme approximativement normale. [Compétence 3.C]

  • UNC-3.O.1 La distribution d'échantillonnage de la différence de proportions d'échantillon $\hat{p}_1 - \hat{p}_2$ aura une distribution approximativement normale à condition que les tailles d'échantillon soient suffisamment grandes : $n_1 p_1 \geq 10, n_1(1-p_1) \geq 10, n_2 p_2 \geq 10, n_2(1-p_2) \geq 10$.

Objectif d'apprentissage UNC-3.P : Interpréter les probabilités et les paramètres pour une distribution d'échantillonnage pour une différence de proportions. [Compétence 4.B]

  • UNC-3.P.1 Les paramètres pour une distribution d'échantillonnage pour une différence de proportions doivent être interprétés en utilisant des unités appropriées et dans le contexte de populations spécifiques.

Source : Description du cours et de l'examen AP College Board

Pour $\hat{p}_1-\hat{p}_2$ provenant de deux échantillons indépendants : la moyenne est $p_1-p_2$, et comme les échantillons sont indépendants, les variances s'additionnent :

$$\sigma_{\hat p_1-\hat p_2}=\sqrt{\frac{p_1(1-p_1)}{n_1}+\frac{p_2(1-p_2)}{n_2}}.$$
Elle est approximativement normale lorsque la condition des Grandes Comptages est satisfaite dans les deux échantillons.

5.7

Distribution d'échantillonnage de la moyenne d'un échantillon

Programme

Compréhension durable (UNC-3) : Le raisonnement probabiliste nous permet d'anticiper des motifs dans les données.

Objectif d'apprentissage UNC-3.Q : Déterminer les paramètres d'une distribution d'échantillonnage pour les moyennes d'échantillon. [Compétence 3.B]

  • UNC-3.Q.1 Pour une variable numérique, lors d'un tirage aléatoire avec remise d'une population avec moyenne $\mu$ et écart-type, $\sigma$, la distribution d'échantillonnage de la moyenne d'échantillon a une moyenne $\mu_{\bar{x}} = \mu$ et un écart-type $\sigma_{\bar{x}} = \dfrac{\sigma}{\sqrt{n}}$.
  • UNC-3.Q.2 Si le tirage est effectué sans remise, l'écart-type de la moyenne d'échantillon est inférieur à celui donné par la formule ci-dessus. Si la taille de l'échantillon est inférieure à 10 % de la taille de la population, la différence est négligeable.

Objectif d'apprentissage UNC-3.R : Déterminer si une distribution d'échantillonnage d'une moyenne d'échantillon peut être décrite comme approximativement normale. [Compétence 3.C]

  • UNC-3.R.1 Pour une variable numérique, si la distribution de la population peut être modélisée par une distribution normale, la distribution d'échantillonnage de la moyenne d'échantillon, $\bar{x}$, peut être modélisée par une distribution normale.
  • UNC-3.R.2 Pour une variable numérique, si la distribution de la population ne peut pas être modélisée par une distribution normale, la distribution d'échantillonnage de la moyenne d'échantillon, $\bar{x}$, peut être modélisée approximativement par une distribution normale, à condition que la taille de l'échantillon soit suffisamment grande, par exemple supérieure ou égale à 30.

Objectif d'apprentissage UNC-3.S : Interpréter les probabilités et les paramètres pour une distribution d'échantillonnage pour une moyenne d'échantillon. [Compétence 4.B]

  • UNC-3.S.1 Les probabilités et les paramètres pour une distribution d'échantillonnage pour une moyenne d'échantillon doivent être interprétés en utilisant des unités appropriées et dans le contexte d'une population spécifique.

Source : Description du cours et de l'examen AP College Board

Pour une moyenne d'échantillon $\bar{x}$ provenant d'un SRS : la moyenne est $\mu$ (sans biais), et l'écart-type est

$$\sigma_{\bar x}=\frac{\sigma}{\sqrt{n}}.$$
Sa forme est normale si la population est normale, ou approximativement normale pour de grands $n$ grâce au TCL. Notez que la dispersion diminue selon $\sqrt{n}$ – quadrupler l'échantillon divise par deux l'erreur standard.

Exemple résolu. Une population a $\mu=70$ et $\sigma=12$. Pour des échantillons de $n=36$, la distribution d'échantillonnage de $\bar{x}$ est centrée sur $70$ avec une erreur standard de $\dfrac{12}{\sqrt{36}}=2$. La probabilité qu'une moyenne d'échantillon dépasse $73$ est $z=\dfrac{73-70}{2}=1.5$, donc $P(\bar x>73)\approx0.067$.

La distribution d'échantillonnage de la moyenne se rétrécit et devient plus normale à mesure que n augmente
La population de gauche est fortement asymétrique, yet chaque distribution d'échantillonnage de $\bar{x}$ est centrée sur $\mu$. Un grand $n$ réduit l'erreur standard $\sigma/\sqrt{n}$, donc la courbe devient plus haute et plus étroite – et elle s'aplatit aussi : encore nettement asymétrique à $n=2$, presque exactement normale (pointillés) à $n=30$.
Vocabulaire Entrainer
Anglais Chinois Pinyin
Central Limit Theorem/ˈsentrəl ˈlɪmɪt ˈθɪərəm/ 中心极限定理 zhōng xīn jí xiàn dìng lǐ
unbiased/ʌnˈbaɪəst/ 无偏 wú piān
5.8

Comparer deux groupes : Différence des moyennes d'échantillon

Programme

Compréhension durable (UNC-3) : Le raisonnement probabiliste nous permet d'anticiper des motifs dans les données.

Objectif d'apprentissage UNC-3.T : Déterminer les paramètres d'une distribution d'échantillonnage pour une différence de moyennes d'échantillon. [Compétence 3.B]

  • UNC-3.T.1 Pour une variable numérique, lors d'un tirage aléatoire avec remise de deux populations indépendantes avec moyennes de population $\mu_1$ et $\mu_2$ et écarts-types de population $\sigma_1$ et $\sigma_2$, la distribution d'échantillonnage de la différence de moyennes d'échantillon $\bar{x}_1 - \bar{x}_2$ a une moyenne $\mu_{(\bar{x}_1 - \bar{x}_2)} = \mu_1 - \mu_2$ et un écart-type, $\sigma_{(\bar{x}_1 - \bar{x}_2)} = \sqrt{\dfrac{\sigma_1^2}{n_1} + \dfrac{\sigma_2^2}{n_2}}$.
  • UNC-3.T.2 Si le tirage est effectué sans remise, l'écart-type de la différence de moyennes d'échantillon est inférieur à celui donné par la formule ci-dessus. Si les tailles d'échantillon sont inférieures à 10 % des tailles de population, la différence est négligeable.

Objectif d'apprentissage UNC-3.U : Déterminer si une distribution d'échantillonnage d'une différence de moyennes d'échantillon peut être décrite comme approximativement normale. [Compétence 3.C]

  • UNC-3.U.1 La distribution d'échantillonnage de la différence de moyennes d'échantillon $\bar{x}_1 - \bar{x}_2$ peut être modélisée par une distribution normale si les deux distributions de population peuvent être modélisées par une distribution normale.
  • UNC-3.U.2 La distribution d'échantillonnage de la différence de moyennes d'échantillon $\bar{x}_1 - \bar{x}_2$ peut être modélisée approximativement par une distribution normale si les deux distributions de population ne peuvent pas être modélisées par une distribution normale mais que les deux tailles d'échantillon sont supérieures ou égales à 30.

Objectif d'apprentissage UNC-3.V : Interpréter les probabilités et les paramètres pour une distribution d'échantillonnage pour une différence de moyennes d'échantillon. [Compétence 4.B]

  • UNC-3.V.1 Les probabilités et les paramètres pour une distribution d'échantillonnage pour une différence de moyennes d'échantillon doivent être interprétés en utilisant des unités appropriées et dans le contexte de populations spécifiques.

Source : Description du cours et de l'examen AP College Board

Pour $\bar{x}_1-\bar{x}_2$ provenant de deux échantillons indépendants : la moyenne est $\mu_1-\mu_2$, et (indépendant, donc variances s'additionnent)

$$\sigma_{\bar x_1-\bar x_2}=\sqrt{\frac{\sigma_1^2}{n_1}+\frac{\sigma_2^2}{n_2}}.$$
Ceci est la base pour l'inférence à deux échantillons dans les unités suivantes.

5.8

Conseils d'examen

  • Une distribution d'échantillonnage est la distribution d'une statistique sur de nombreux échantillons, centrée sur le vrai paramètre.
  • Le Théorème Central Limite : pour un échantillon assez grand, la moyenne de l'échantillon est approximativement normale, même si la population ne l'est pas.
  • Les grands échantillons donnent moins de variabilité (une erreur standard plus petite).
  • Vérifiez les conditions (aléatoire, indépendant/10%, assez grand) avant d'utiliser un modèle normal.
  • Gardez distinct ce qui varie — la statistique — du paramètre fixe.

Leçons interactives sur ce sujet

Traversez-le étape par étape, avec des exercices à vérification instantanée.

Épreuves Passées

Plus de sujets dans AP Statistiques

Se connecter ou créer un compte

IGCSE, A-Level & AP