Passer au contenu

Explorer les données à deux variables

AP Statistiques · Sujet 2

Entrainer
Leçon vidéo pour ce sujet Ouvrir la page vidéo
7:49

Explorer les données à deux variables

Trente enfants d'une école primaire. Pour chaque enfant, deux nombres : pointure et score à un test de lecture. Tracez un point par enfant. Le motif est difficile à…

Narration en anglais · Sous-titres anglais + 中文 incrustés

2.1

Deux variables sont-elles liées ?

Programme

Compréhension durable (VAR-1) : Étant donné que la variation peut être aléatoire ou non, les conclusions sont incertaines.

Objectif d'apprentissage VAR-1.D : Identifier les questions à répondre concernant les relations potentielles dans les données. [Compétence 1.A]

  • VAR-1.D.1 Les motifs et associations apparents dans les données peuvent être aléatoires ou non.

Source : Description du cours et de l'examen AP College Board

Les données à deux variables nous permettent de demander si deux caractéristiques sont associées 关联 – savoir l'une permet d'en déduire quelque chose sur l'autre. Une variable explicative 解释变量 (l'« entrée ») peut aider à prédire une variable réponse 响应变量 (la « sortie »). L'association n'est pas la même que la causalité.

2.2

Deux variables catégorielles

Programme

Compréhension durable (UNC-1) : Les représentations graphiques et statistiques nous permettent d'identifier et de représenter les caractéristiques clés des données.

Objectif d'apprentissage UNC-1.P : Comparer les représentations numériques et graphiques pour deux variables catégorielles. [Compétence 2.D]

  • UNC-1.P.1 Les graphiques à barres côte à côte, les graphiques à barres segmentés et les diagrammes en mosaïque sont des exemples de graphiques à barres pour une variable catégorielle, détaillés par catégories d'une autre variable catégorielle.
  • UNC-1.P.2 Les représentations graphiques de deux variables catégorielles peuvent être utilisées pour comparer des distributions et/ou déterminer si les variables sont associées.
  • UNC-1.P.3 Un tableau croisé, également appelé tableau de contingence, est utilisé pour résumer deux variables catégorielles. Les entrées dans les cellules peuvent être des comptes de fréquences ou des fréquences relatives.
  • UNC-1.P.4 Une fréquence relative jointe est une fréquence de cellule divisée par le total pour l'ensemble du tableau.

Source : Description du cours et de l'examen AP College Board

Un tableau croisé 双向表 (tableau de contingence) compte les individus selon deux variables catégorielles simultanément. Une distribution marginale 边缘分布 est un total de ligne ou de colonne exprimé comme fraction du total général (les totaux eux-mêmes ne sont que des comptes). Comparer les cellules intérieures montre si les variables sont liées.

2.3

Comparaison de groupes avec des distributions conditionnelles

Programme

Compréhension durable (UNC-1) : Les représentations graphiques et statistiques nous permettent d'identifier et de représenter les caractéristiques clés des données.

Objectif d'apprentissage UNC-1.Q : Calculer les statistiques pour deux variables catégorielles. [Compétence 2.C]

  • UNC-1.Q.1 Les fréquences relatives marginales sont les totaux de ligne et de colonne dans un tableau croisé divisés par le total pour l'ensemble du tableau.
  • UNC-1.Q.2 Une fréquence relative conditionnelle est une fréquence relative pour une partie spécifique du tableau de contingence (p. ex., fréquences de cellules dans une ligne divisées par le total pour cette ligne).

Objectif d'apprentissage UNC-1.R : Comparer les statistiques pour deux variables catégorielles. [Compétence 2.D]

  • UNC-1.R.1 Les statistiques récapitulatives pour deux variables catégorielles peuvent être utilisées pour comparer des distributions et/ou déterminer si les variables sont associées.

Source : Description du cours et de l'examen AP College Board

Une distribution conditionnelle 条件分布 est la distribution d'une variable à l'intérieur d'une catégorie fixe de l'autre (obtenue en divisant chaque cellule par son total de ligne ou de colonne). Si les distributions conditionnelles diffèrent entre les groupes, les deux variables sont associées ; si elles sont identiques, il n'y a pas d'association. Les diagrammes à bandes segmentées 分段条形图 ou les mosaïques les représentent.

2.4

Nuages de points pour deux variables quantitatives

Programme

Compréhension durable (UNC-1) : Les représentations graphiques et statistiques nous permettent d'identifier et de représenter les caractéristiques clés des données.

Objectif d'apprentissage UNC-1.S : Représenter des données quantitatives bivariées à l'aide de nuages de points. [Compétence 2.B]

  • UNC-1.S.1 Un ensemble de données quantitatives bivariées consiste en des observations de deux variables quantitatives différentes faites sur des individus dans un échantillon ou une population.
  • UNC-1.S.2 Un nuage de points montre deux valeurs numériques pour chaque observation, l'une correspondant à la valeur sur l'axe $x$ et l'autre correspondant à la valeur sur l'axe $y$.
  • UNC-1.S.3 Une variable explicative est une variable dont les valeurs sont utilisées pour expliquer ou prédire les valeurs correspondantes pour la variable réponse.

Compréhension durable (DAT-1) : Les modèles de régression peuvent nous permettre de prédire les réponses aux changements d'une variable explicative.

Objectif d'apprentissage DAT-1.A : Décrire les caractéristiques d'un nuage de points. [Compétence 2.A]

  • DAT-1.A.1 Une description d'un nuage de points comprend la forme, la direction, la force et les caractéristiques inhabituelles.
  • DAT-1.A.2 La direction de l'association montrée dans un nuage de points, s'il y en a une, peut être décrite comme positive ou négative.
  • DAT-1.A.3 Une association positive signifie qu'à mesure que les valeurs d'une variable augmentent, les valeurs de l'autre variable ont tendance à augmenter. Une association négative signifie qu'à mesure que les valeurs d'une variable augmentent, les valeurs de l'autre variable ont tendance à diminuer.
  • DAT-1.A.4 La forme de l'association montrée dans un nuage de points, s'il y en a une, peut être décrite comme linéaire ou non-linéaire à divers degrés.
  • DAT-1.A.5 La force de l'association est la mesure dans laquelle les points individuels suivent un motif spécifique, p. ex., linéaire, et peut être montrée dans un nuage de points. La force peut être décrite comme forte, modérée ou faible.
  • DAT-1.A.6 Les caractéristiques inhabituelles d'un nuage de points incluent des regroupements de points ou des points présentant des écarts relativement importants entre la valeur de la variable réponse et une valeur prédite pour cette variable.

Source : Description du cours et de l'examen AP College Board

Un nuage de points 散点图 représente chaque individu par un point, la variable explicative sur l'axe $x$ et la variable réponse sur l'axe $y$. Le décrire avec DUFS : Direction (positive/négative), Caractéristiques inhabituelles (valeurs aberrantes, regroupements), Forme (linéaire ou courbe) et Force (à quel point les points suivent le motif) – toujours en contexte.

Une droite de tendance traverse le milieu des points dispersés
Une droite de tendance traverse le milieu des points dispersés
2.5

Corrélation

Programme

Compréhension durable (DAT-1) : Les modèles de régression peuvent nous permettre de prédire les réponses aux changements d'une variable explicative.

Objectif d'apprentissage DAT-1.B : Déterminer la corrélation pour une relation linéaire. [Compétence 2.C]

  • DAT-1.B.1 La corrélation, $r$, donne la direction et quantifie la force de l'association linéaire entre deux variables quantitatives.
  • DAT-1.B.2 Le coefficient de corrélation peut être calculé par : $r = \dfrac{1}{n-1} \sum \left( \dfrac{x_i - \bar{x}}{s_x} \right) \left( \dfrac{y_i - \bar{y}}{s_y} \right)$. Cependant, le moyen le plus courant de déterminer $r$ est d'utiliser une technologie.
  • DAT-1.B.3 Un coefficient de corrélation proche de 1 ou de $-1$ ne signifie pas nécessairement qu'un modèle linéaire est approprié.

Objectif d'apprentissage DAT-1.C : Interpréter la corrélation pour une relation linéaire. [Compétence 4.B]

  • DAT-1.C.1 La corrélation, $r$, est sans unité, et toujours comprise entre $-1$ et 1, inclus. Une valeur de $r = 0$ indique qu'il n'y a aucune association linéaire. Une valeur de $r = 1$ ou de $r = -1$ indique qu'il y a une association linéaire parfaite.
  • DAT-1.C.2 Une relation perçue ou réelle entre deux variables ne signifie pas que les changements dans une variable causent des changements dans l'autre. Autrement dit, la corrélation n'implique pas nécessairement la causalité.

Source : Description du cours et de l'examen AP College Board

Ce que r mesure réellement

Le coefficient de corrélation 相关系数 $r$ mesure la force et la direction d'une relation linéaire. Il varie de $-1$ à $1$ : proche de $\pm 1$ indique une forte linéarité, proche de $0$ une faible linéarité. $r$ n'a aucune unité et ne change pas si l'on inverse les variables. Avertissements : $r$ ne mesure que la force linéaire, il n'est pas résistant aux valeurs aberrantes, et une forte $r$ ne prouve pas la causalité.

La corrélation positive monte ensemble ; la corrélation négative évolue dans des directions opposées
Corrélation positive monte ensemble ; corrélation négative va dans des directions opposées
Explorer

Force d'une relation linéaire

Corrélation $r$ varie de $-1$ à $1$ : près de $\pm1$ les points épousent une ligne, près de 0 ils se dispersent. Changez-la et regardez le nuage se resserrer ou s'étendre.

2.6

Modèles de régression linéaire

Programme

Compréhension durable (DAT-1) : Les modèles de régression peuvent nous permettre de prédire les réponses aux changements d'une variable explicative.

Objectif d'apprentissage DAT-1.D : Calculer une valeur de réponse prédite en utilisant un modèle de régression linéaire. [Compétence 2.C]

  • DAT-1.D.1 Un modèle de régression linéaire simple est une équation qui utilise une variable explicative, $x$, pour prédire la variable réponse, $y$.
  • DAT-1.D.2 La valeur de réponse prédite, notée $\hat{y}$, est calculée comme $\hat{y} = a + bx$, où $a$ est l'ordonnée à l'origine $y$ et $b$ est la pente de la droite de régression, et $x$ est la valeur de la variable explicative.
  • DAT-1.D.3 L'extrapolation consiste à prédire une valeur de réponse en utilisant une valeur pour la variable explicative qui se situe au-delà de l'intervalle des valeurs de $x$ utilisées pour déterminer la droite de régression. La valeur prédite est moins fiable en tant qu'estimation plus nous extrapolons.

Source : Description du cours et de l'examen AP College Board

La droite de régression des moindres carrés 最小二乘回归线 prédit la réponse : $\hat{y}=a+bx$, où $\hat{y}$ est la réponse prédite. La pente 斜率 $b$ est le changement prévu de $y$ pour une augmentation d'une unité de $x$ ; l'intercept $y$ 截距 $a$ est la réponse prévue lorsque $y$ lorsque $x=0$. Interpréter les deux en contexte et avec des unités – une compétence évaluée. Éviter l'extrapolation 外推 (prédire loin hors des données).

Exemple résolu. Une étude sur les heures d'étude ($x$) et le score de test ($y$) donne $\hat{y}=20+3x$. La pente signifie que chaque heure supplémentaire d'étude est associée à une augmentation prévue de $3$ points. Un étudiant qui étudie $5$ heures est prévu pour obtenir un score de $\hat{y}=20+3(5)=35$.

Explorer

Ajuster une ligne des moindres carrés

Une ligne de régression est le meilleur ajustement linéaire, minimisant les distances verticales au carré. Sa pente prédit comment $y$ change par unité de $x$.

Vocabulaire Entrainer
Anglais Chinois Pinyin
associated/əˈsəʊsɪeɪtɪd/ 关联 guān lián
explanatory variable/ekˈsplænətəri ˈveərɪəbl/ 解释变量 jiě shì biàn liàng
response variable/rɪˈspɒns ˈveərɪəbl/ 响应变量 xiǎng yìng biàn liàng
two-way table/tuː weɪ ˈteɪbl/ 双向表 shuāng xiàng biǎo
marginal distributions/ˈmɑːdʒɪnl ˌdɪstrɪˈbjuːʃnz/ 边缘分布 biān yuán fēn bù
conditional distribution/kənˈdɪʃənl ˌdɪstrɪˈbjuːʃn/ 条件分布 tiáo jiàn fēn bù
Segmented bar charts/seɡˈmentɪd bɑː tʃɑːts/ 分段条形图 fēn duàn tiáo xíng tú
scatterplot/ˈskætəplɒt/ 散点图 sàn diǎn tú
correlation coefficient/ˌkɒrɪˈleɪʃn ˌkəʊɪˈfɪʃənt/ 相关系数 xiāng guān xì shù
least-squares regression line/liːst skweəz rɪˈɡreʃn laɪn/ 最小二乘回归线 zuì xiǎo èr chéng huí guī xiàn
slope/sləʊp/ 斜率 xié lǜ
y-intercept/waɪ ˌɪntəˈsept/ 截距 jié jù
extrapolation/ekˈstræpəleɪʃn/ 外推 wài tuī
2.7

Résidus

Programme

Compréhension durable (DAT-1) : Les modèles de régression peuvent nous permettre de prédire les réponses aux changements d'une variable explicative.

Objectif d'apprentissage DAT-1.E : Représenter les différences entre les réponses mesurées et prédites à l'aide de graphiques de résidus. [Compétence 2.B]

  • DAT-1.E.1 Le résidu est la différence entre la valeur réelle et la valeur prédite : $\text{residual} = y - \hat{y}$.
  • DAT-1.E.2 Un graphique de résidus est un graphique des résidus par rapport aux valeurs de la variable explicative ou aux valeurs de réponse prédites.

Objectif d'apprentissage DAT-1.F : Décrire la forme de l'association des données bivariées à l'aide de graphiques de résidus. [Compétence 2.A]

  • DAT-1.F.1 L'apparente randomisation dans un graphique de résidus pour un modèle linéaire est une preuve d'une forme linéaire à l'association entre les variables.
  • DAT-1.F.2 Les graphiques de résidus peuvent être utilisés pour examiner l'adéquation d'un modèle sélectionné.

Source : Description du cours et de l'examen AP College Board

Régression des moindres carrés

Un résidu 残差 est réel moins prévu, $y-\hat{y}$ : à quelle distance un point se situe au-dessus (+) ou en dessous (-) de la droite. Un graphique des résidus 残差图 trace les résidus contre $x$. S'il ne montre aucun motif (dispersion aléatoire), un modèle linéaire est approprié ; un motif courbé ou évasé signifie que le modèle linéaire est un mauvais ajustement.

Exemple résolu. En poursuivant l'étude ci-dessus, un étudiant qui a étudié $5$ heures a obtenu réellement $40$. Le résidu est $y-\hat{y}=40-35=+5$ : la droite a sous-prédit de $5$ points, donc ce point se trouve au-dessus de la droite.

Quatre jeux de données avec un r et une droite de régression identiques mais quatre formes différentes
Une mise en garde concernant $r$ et la droite : les quatre jeux de données ont le même $r=0.82$ et la même $\hat{y}=3.0+0.5x$, mais seul le premier est véritablement linéaire. Les nuages de points diffèrent peu à peine – c'est le graphique des résidus ci-dessous de chacun qui révèle la courbe, la valeur aberrante et le point à haute influence.
2.8

Moindres carrés et ajustement de la régression

Programme

Compréhension durable (DAT-1) : Les modèles de régression peuvent nous permettre de prédire les réponses aux changements d'une variable explicative.

Objectif d'apprentissage DAT-1.G : Estimer les paramètres du modèle de la droite de régression des moindres carrés. [Compétence 2.C]

  • DAT-1.G.1 Le modèle de régression des moindres carrés minimise la somme des carrés des résidus et contient le point $(\bar{x}, \bar{y})$.
  • DAT-1.G.2 La pente, $b$, de la droite de régression peut être calculée comme $b = r \left( \dfrac{s_y}{s_x} \right)$ où $r$ est la corrélation entre $x$ et $y$, $s_y$ est l'écart-type échantillonnal de la variable réponse, $y$, et $s_x$ est l'écart-type échantillonnal de la variable explicative, $x$.
  • DAT-1.G.3 Parfois, l'ordonnée à l'origine $y$ de la droite n'a pas d'interprétation logique dans le contexte.
  • DAT-1.G.4 En régression linéaire simple, $r^2$ est le carré de la corrélation, $r$. On l'appelle également le coefficient de détermination. $r^2$ représente la proportion de variation de la variable réponse expliquée par la variable explicative dans le modèle.

Objectif d'apprentissage DAT-1.H : Interpréter les coefficients du modèle de la droite de régression des moindres carrés. [Compétence 4.B]

  • DAT-1.H.1 Les coefficients du modèle de régression des moindres carrés sont la pente estimée et l'ordonnée à l'origine $y$.
  • DAT-1.H.2 La pente est la quantité dont la valeur $y$ prédite change pour chaque augmentation d'une unité de $x$.
  • DAT-1.H.3 La valeur de l'ordonnée à l'origine $y$ est la valeur prédite de la variable de réponse lorsque la variable explicative est égale à $0$. La formule pour l'ordonnée à l'origine $y$, $a$, est $a = \bar{y} - b\bar{x}$.

Source : Description du cours et de l'examen AP College Board

La droite des moindres carrés minimise la somme des résidus au carré
La droite des moindres carrés minimise la somme des résidus au carré

La droite minimise la somme des résidus au carré. Son ajustement est mesuré par :

  • $s$, l'écart-type des résidus – l'erreur de prédiction typique, dans les unités de la réponse.
  • $r^2$, le coefficient de détermination 决定系数 – la proportion de la variation de $y$ expliquée par le modèle linéaire (une valeur comprise entre $0$ et $1$ ; multiplier par $100$ pour l'exprimer en pourcentage). Le rapporter en contexte : "$r^2 = 0.81$ signifie que 81 % de la variation de $y$ est expliquée par la relation linéaire avec $x$."
Vocabulaire Entrainer
Anglais Chinois Pinyin
residual/rɪˈsɪdʒuːəl/ 残差 cán chà
residual plot/rɪˈsɪdʒuːəl plɒt/ 残差图 cán chà tú
coefficient of determination/ˌkəʊɪˈfɪʃənt ɒv dɪˌtɜːmɪˈneɪʃn/ 决定系数 jué dìng xì shù
high-leverage/haɪ ˈliːvərɪdʒ/ 高杠杆 gāo gàng gǎn
influential/ˌɪnfluːˈenʃl/ 有影响的 yǒu yǐng xiǎng de
2.9

Écarts par rapport à la linéarité

Programme

Compréhension durable (DAT-1) : Les modèles de régression peuvent nous permettre de prédire les réponses aux changements d'une variable explicative.

Objectif d'apprentissage DAT-1.I : Identifier les points influents en régression. [Compétence 2.A]

  • DAT-1.I.1 Un point aberrant en régression est un point qui ne suit pas la tendance générale montrée dans le reste des données et présente un grand résidu lorsque la Droite de Régression des Moindres Carrés (DRMC) est calculée.
  • DAT-1.I.2 Un point à fort levier en régression a une valeur $x$ nettement plus grande ou plus petite que celle des autres observations.
  • DAT-1.I.3 Un point influent en régression est tout point dont la suppression modifie substantiellement la relation. Cela peut se traduire par une pente, une ordonnée à l'origine $y$ et/ou une corrélation très différentes. Les valeurs aberrantes et les points à forte levier sont souvent influents.

Objectif d'apprentissage DAT-1.J : Calculer une réponse prédite en utilisant une droite de régression des moindres carrés pour un ensemble de données transformées. [Compétence 2.C]

  • DAT-1.J.1 Les transformations de variables, telles que l'évaluation du logarithme naturel de chaque valeur de la variable réponse ou le carré de chaque valeur de la variable explicative, peuvent être utilisées pour créer des ensembles de données transformées, qui peuvent être plus linéaires que les données non transformées.
  • DAT-1.J.2 Une augmentation de l'aléatoire dans les diagrammes de résidus après transformation des données et/ou un mouvement de $r^2$ vers une valeur plus proche de 1 offre la preuve que la droite de régression des moindres carrés pour les données transformées est un modèle plus approprié à utiliser pour prédire les réponses à la variable explicative que la droite de régression pour les données non transformées.

Source : Description du cours et de l'examen AP College Board

Certains points affectent fortement la droite. Un point à haute influence 高杠杆 a une valeur extrême sur l'axe $x$ ; un point influent 有影响的 modifie notablement la pente ou $r$ lorsqu'il est retiré ; ici, une valeur aberrante est un point avec un grand résidu. Quand le motif est courbé, transformer une variable (ex. : prendre un logarithme) pour la lineariser, puis ajuster une droite aux données transformées.

2.9

Conseils d'examen

  • Sur un nuage de points, décrire la direction, la forme, la force et les valeurs aberrantes ; $r$ varie de $-1$ à $1$.
  • La corrélation n'est pas la causalité – une variable cachée peut entraîner les deux.
  • Interpréter la pente de la droite des moindres carrés en contexte (« pour une unité de $x$, la prédiction de $y$ change de $b$ »).
  • Vérifier un graphique des résidus : aucun motif signifie qu'une droite s'adapte ; une courbe signifie qu'elle ne s'adapte pas. Éviter l'extrapolation.
  • $r^2$ est la fraction de la variation de $y$ expliquée par le modèle.

Leçons interactives sur ce sujet

Traversez-le étape par étape, avec des exercices à vérification instantanée.

Épreuves Passées

Plus de sujets dans AP Statistiques

Se connecter ou créer un compte

IGCSE, A-Level & AP