Saltar al contenido

Exploración de datos de dos variables

AP Estadística · Tema 2

Entrenar
Lección de video para este tema Abrir la página de video
7:49

Exploración de Datos de Dos Variables

Treinta niños de una escuela primaria. Para cada niño, dos números: talla de zapato, y una puntuación de prueba de lectura. Grafica un punto por niño. El patrón es difícil de…

Narración en inglés · Subtítulos en inglés + 中文 quemados en pantalla

2.1

¿Están relacionadas dos variables?

Syllabus

Comprensión duradera (VAR-1): Dado que la variación puede ser aleatoria o no, las conclusiones son inciertas.

Objetivo de aprendizaje VAR-1.D: Identificar preguntas para responder sobre posibles relaciones en los datos. [Habilidad 1.A]

  • VAR-1.D.1 Los patrones y asociaciones aparentes en los datos pueden ser aleatorios o no.

Fuente: College Board AP Course and Exam Description

Los datos de dos variables nos permiten preguntarnos si dos características están asociadas – saber una nos dice algo sobre la otra. Una variable explicativa (la "entrada") puede ayudar a predecir una variable de respuesta (la "salida"). La asociación no es lo mismo que la causalidad.

2.2

Dos variables categóricas

Syllabus

Comprensión Duradera (UNC-1): Las representaciones gráficas y las estadísticas nos permiten identificar y representar características clave de los datos.

Objetivo de Aprendizaje UNC-1.P: Comparar representaciones numéricas y gráficas para dos variables categóricas. [Habilidad 2.D]

  • UNC-1.P.1 Los gráficos de barras lado a lado, los gráficos de barras segmentadas y los diagramas de mosaico son ejemplos de gráficos de barras para una variable categórica, desglosados por categorías de otra variable categórica.
  • UNC-1.P.2 Las representaciones gráficas de dos variables categóricas se pueden utilizar para comparar distribuciones y/o determinar si las variables están asociadas.
  • UNC-1.P.3 Una tabla de contingencia, también llamada tabla de doble entrada, se utiliza para resumir dos variables categóricas. Las entradas en las celdas pueden ser recuentos de frecuencia o frecuencias relativas.
  • UNC-1.P.4 Una frecuencia relativa conjunta es la frecuencia de una celda dividida por el total de toda la tabla.

Fuente: College Board AP Course and Exam Description

Una tabla bidireccional (tabla de contingencia) cuenta individuos según dos variables categóricas al mismo tiempo. Una distribución marginal es el total de una fila o columna expresado como fracción del total general (los totales en sí mismos son solo conteos). Comparar las celdas internas muestra si las variables están relacionadas.

2.3

Comparación de grupos con distribuciones condicionales

Syllabus

Comprensión perdurable (UNC-1): Las representaciones gráficas y las estadísticas nos permiten identificar y representar las características clave de los datos.

Objetivo de aprendizaje UNC-1.Q: Calcular estadísticas para dos variables categóricas. [Habilidad 2.C]

  • UNC-1.Q.1 Las frecuencias relativas marginales son los totales de filas y columnas en una tabla de doble entrada divididos por el total de toda la tabla.
  • UNC-1.Q.2 Una frecuencia relativa condicional es una frecuencia relativa correspondiente a una parte específica de la tabla de contingencia (por ejemplo, las frecuencias de las celdas en una fila divididas por el total de esa fila).

Objetivo de aprendizaje UNC-1.R: Comparar estadísticas para dos variables categóricas. [Habilidad 2.D]

  • UNC-1.R.1 Las estadísticas descriptivas para dos variables categóricas pueden utilizarse para comparar distribuciones y/o determinar si las variables están asociadas.

Fuente: College Board AP Course and Exam Description

Una distribución condicional es la distribución de una variable dentro de una categoría fija de la otra (se obtiene dividiendo cada celda por su total de fila o columna). Si las distribuciones condicionales difieren entre grupos, las dos variables están asociadas; si son iguales, no hay asociación. Los gráficos de barras segmentadas o los diagramas mosaico las muestran.

2.4

Diagramas de dispersión para dos variables cuantitativas

Syllabus

Comprensión duradera (UNC-1): Las representaciones gráficas y las estadísticas nos permiten identificar y representar características clave de los datos.

Objetivo de aprendizaje UNC-1.S: Representar datos cuantitivos bivariados mediante diagramas de dispersión. [Habilidad 2.B]

  • UNC-1.S.1 Un conjunto de datos cuantitativos bivariados consiste en observaciones de dos variables cuantitativas diferentes realizadas sobre individuos en una muestra o población.
  • UNC-1.S.2 Un diagrama de dispersión muestra dos valores numéricos para cada observación, uno correspondiente al valor en el eje $x$ y otro correspondiente al valor en el eje $y$.
  • UNC-1.S.3 Una variable explicativa es una variable cuyos valores se utilizan para explicar o predecir valores correspondientes en la variable de respuesta.

Comprensión duradera (DAT-1): Los modelos de regresión pueden permitirnos predecir respuestas ante cambios en una variable explicativa.

Objetivo de aprendizaje DAT-1.A: Describir las características de un diagrama de dispersión. [Habilidad 2.A]

  • DAT-1.A.1 Una descripción de un diagrama de dispersión incluye forma, dirección, fuerza y características inusuales.
  • DAT-1.A.2 La dirección de la asociación mostrada en un diagrama de dispersión, si existe, puede describirse como positiva o negativa.
  • DAT-1.A.3 Una asociación positiva significa que a medida que aumentan los valores de una variable, los valores de la otra variable tienden a aumentar. Una asociación negativa significa que a medida que aumentan los valores de una variable, los valores de la otra variable tienden a disminuir.
  • DAT-1.A.4 La forma de la asociación mostrada en un diagrama de dispersión, si existe, puede describirse como lineal o no lineal en diversos grados.
  • DAT-1.A.5 La fuerza de la asociación indica qué tan cerca siguen los puntos individuales un patrón específico, p. ej., lineal, y puede mostrarse en un diagrama de dispersión. La fuerza puede describirse como fuerte, moderada o débil.
  • DAT-1.A.6 Las características inusuales de un diagrama de dispersión incluyen agrupaciones de puntos o puntos con discrepancias relativamente grandes entre el valor de la variable de respuesta y un valor predicho para dicha variable.

Fuente: College Board AP Course and Exam Description

Un diagrama de dispersión representa a cada individuo como un punto, con la variable explicativa en el eje $x$ y la variable de respuesta en el eje $y$. Describirlo mediante DUFS: Dirección (positiva/negativa), Inusuales (valores atípicos, agrupamientos), Forma (lineal o curva) y Fuerza (qué tan estrechamente siguen los puntos el patrón) – siempre contextualizado.

Una línea de mejor ajuste pasa por el centro de los puntos dispersos
Una línea de ajuste óptimo pasa por el centro de los puntos dispersos
2.5

Correlación

Syllabus

Comprensión Duradera (DAT-1): Los modelos de regresión pueden permitirnos predecir respuestas ante cambios en una variable explicativa.

Objetivo de Aprendizaje DAT-1.B: Determinar la correlación para una relación lineal. [Habilidad 2.C]

  • DAT-1.B.1 La correlación, $r$, indica la dirección y cuantifica la fuerza de la asociación lineal entre dos variables cuantitativas.
  • DAT-1.B.2 El coeficiente de correlación se puede calcular mediante: $r = \dfrac{1}{n-1} \sum \left( \dfrac{x_i - \bar{x}}{s_x} \right) \left( \dfrac{y_i - \bar{y}}{s_y} \right)$. Sin embargo, la forma más común de determinar $r$ es utilizando tecnología.
  • DAT-1.B.3 Un coeficiente de correlación cercano a 1 o $-1$ no significa necesariamente que un modelo lineal sea apropiado.

Objetivo de Aprendizaje DAT-1.C: Interpretar la correlación para una relación lineal. [Habilidad 4.B]

  • DAT-1.C.1 La correlación, $r$, es adimensional y siempre está comprendida entre $-1$ y 1, inclusive. Un valor de $r = 0$ indica que no existe asociación lineal. Un valor de $r = 1$ o $r = -1$ indica que existe una asociación lineal perfecta.
  • DAT-1.C.2 Una relación percibida o real entre dos variables no implica que los cambios en una variable causen cambios en la otra. Es decir, la correlación no necesariamente implica causalidad.

Fuente: College Board AP Course and Exam Description

Lo que mide realmente r

El coeficiente de correlación $r$ mide la fuerza y dirección de una relación lineal. Varía desde $-1$ hasta $1$: cerca de $\pm 1$ indica una fuerte relación lineal, cerca de $0$ indica una débil relación lineal. $r$ no tiene unidades y no cambia si se intercambian las variables. Advertencias: $r$ solo mide la fuerza lineal, no es robusto ante valores atípicos y una fuerte $r$ no prueba causalidad.

La correlación positiva sube juntas; la correlación negativa se mueve en direcciones opuestas
La correlación positiva aumenta conjuntamente; la correlación negativa se mueve en direcciones opuestas
Explorar

Fuerza de una relación lineal

Correlación $r$ va de $-1$ a $1$: cerca de $\pm1$ los puntos abrazan una línea, cerca de 0 se dispersan. Cámbielo y vea cómo la nube se ajusta o expande.

2.6

Modelos de Regresión Lineal

Syllabus

Comprensión Duradera (DAT-1): Los modelos de regresión pueden permitirnos predecir respuestas ante cambios en una variable explicativa.

Objetivo de Aprendizaje DAT-1.D: Calcular un valor de respuesta predicho utilizando un modelo de regresión lineal. [Habilidad 2.C]

  • DAT-1.D.1 Un modelo de regresión lineal simple es una ecuación que utiliza una variable explicativa, $x$, para predecir la variable de respuesta, $y$.
  • DAT-1.D.2 El valor de respuesta predicho, denotado por $\hat{y}$, se calcula como $\hat{y} = a + bx$, donde $a$ es la intersección con el eje $y$, $b$ es la pendiente de la recta de regresión y $x$ es el valor de la variable explicativa.
  • DAT-1.D.3 La extrapolación es predecir un valor de respuesta utilizando un valor para la variable explicativa que está fuera del intervalo de valores de $x$ utilizados para determinar la recta de regresión. El valor predicho es menos confiable como estimación cuanto más nos alejamos en la extrapolación.

Fuente: College Board AP Course and Exam Description

La línea de regresión por mínimos cuadrados 最小二乘回归线 predice la respuesta: $\hat{y}=a+bx$, donde $\hat{y}$ es la respuesta predicha. La pendiente 斜率 $b$ es el cambio previsto en $y$ por cada aumento de una unidad en $x$; la intersección en el eje $y$ 截距 $a$ es la respuesta prevista en $y$ cuando $x=0$. Interpreta ambos en contexto y con unidades – una habilidad evaluada. Evita la extrapolación 外推 (predecir muy lejos fuera de los datos).

Ejemplo resuelto. Un estudio de las horas estudiadas ($x$) y la nota del examen ($y$) arroja $\hat{y}=20+3x$. La pendiente indica que cada hora adicional de estudio se asocia con un aumento previsto de $3$ puntos en la nota. Se predice que un estudiante que estudia $5$ horas obtendrá una nota de $\hat{y}=20+3(5)=35$.

Explorar

Ajustar una línea de mínimos cuadrados

Una línea de regresión es el mejor ajuste de línea recta, minimizando las distancias verticales al cuadrado. Su pendiente predice cómo $y$ cambia por unidad de $x$.

2.7

Residuos

Syllabus

Comprensión Duradera (DAT-1): Los modelos de regresión pueden permitirnos predecir las respuestas a los cambios en una variable explicativa.

Objetivo de Aprendizaje DAT-1.E: Representar las diferencias entre las respuestas medidas y las predichas mediante gráficos de residuos. [Habilidad 2.B]

  • DAT-1.E.1 El residuo es la diferencia entre el valor real y el valor predicho: $\text{residual} = y - \hat{y}$.
  • DAT-1.E.2 Un gráfico de residuos es un gráfico de los residuos frente a los valores de la variable explicativa o de los valores de respuesta predicha.

Objetivo de Aprendizaje DAT-1.F: Describir la forma de asociación de los datos bivariados utilizando gráficos de residuos. [Habilidad 2.A]

  • DAT-1.F.1 La aleatoriedad aparente en un gráfico de residuos para un modelo lineal es evidencia de una forma lineal en la asociación entre las variables.
  • DAT-1.F.2 Los gráficos de residuos pueden utilizarse para investigar la idoneidad de un modelo seleccionado.

Fuente: College Board AP Course and Exam Description

Regresión de mínimos cuadrados

Una residual 残差 es la diferencia entre el valor real y el predicho, $y-\hat{y}$: qué tan lejos se sitúa un punto por encima (+) o por debajo (−) de la línea. Un gráfico de residuos 残差图 grafica los residuos en función de $x$. Si no muestra ningún patrón (dispersión aleatoria), un modelo lineal es apropiado; un patrón curvo o en abanico indica que el modelo lineal es un ajuste deficiente.

Ejemplo resuelto. Continuando con el estudio anterior, un estudiante que estudió $5$ horas obtuvo realmente una puntuación de $40$. El residuo es $y-\hat{y}=40-35=+5$: la línea subestimó en $5$ puntos, por lo que este punto se sitúa por encima de la línea.

Cuatro conjuntos de datos con r y línea de regresión idénticas pero cuatro formas diferentes
Una advertencia sobre $r$ y la recta: los cuatro conjuntos de datos tienen el mismo $r=0.82$ y el mismo $\hat{y}=3.0+0.5x$, pero solo el primero es genuinamente lineal. Los diagramas de dispersión apenas difieren — lo que revela la curvatura, el valor atípico y el punto de alta influencia es el diagrama de residuos debajo de cada uno.
Vocabulario Entrenar
Inglés Chino Pinyin
associated/əˈsəʊsɪeɪtɪd/ 关联 guān lián
explanatory variable/ekˈsplænətəri ˈveərɪəbl/ 解释变量 jiě shì biàn liàng
response variable/rɪˈspɒns ˈveərɪəbl/ 响应变量 xiǎng yìng biàn liàng
two-way table/tuː weɪ ˈteɪbl/ 双向表 shuāng xiàng biǎo
marginal distributions/ˈmɑːdʒɪnl ˌdɪstrɪˈbjuːʃnz/ 边缘分布 biān yuán fēn bù
conditional distribution/kənˈdɪʃənl ˌdɪstrɪˈbjuːʃn/ 条件分布 tiáo jiàn fēn bù
Segmented bar charts/seɡˈmentɪd bɑː tʃɑːts/ 分段条形图 fēn duàn tiáo xíng tú
scatterplot/ˈskætəplɒt/ 散点图 sàn diǎn tú
correlation coefficient/ˌkɒrɪˈleɪʃn ˌkəʊɪˈfɪʃənt/ 相关系数 xiāng guān xì shù
least-squares regression line/liːst skweəz rɪˈɡreʃn laɪn/ 最小二乘回归线 zuì xiǎo èr chéng huí guī xiàn
slope/sləʊp/ 斜率 xié lǜ
y-intercept/waɪ ˌɪntəˈsept/ 截距 jié jù
extrapolation/ekˈstræpəleɪʃn/ 外推 wài tuī
residual/rɪˈsɪdʒuːəl/ 残差 cán chà
residual plot/rɪˈsɪdʒuːəl plɒt/ 残差图 cán chà tú
coefficient of determination/ˌkəʊɪˈfɪʃənt ɒv dɪˌtɜːmɪˈneɪʃn/ 决定系数 jué dìng xì shù
high-leverage/haɪ ˈliːvərɪdʒ/ 高杠杆 gāo gàng gǎn
influential/ˌɪnfluːˈenʃl/ 有影响的 yǒu yǐng xiǎng de
2.8

Regresión por Mínimos Cuadrados y su Ajuste

Syllabus

Comprensión Duradera (DAT-1): Los modelos de regresión pueden permitirnos predecir respuestas ante cambios en una variable explicativa.

Objetivo de Aprendizaje DAT-1.G: Estimar parámetros para el modelo de la recta de regresión de mínimos cuadrados. [Habilidad 2.C]

  • DAT-1.G.1 El modelo de regresión de mínimos cuadrados minimiza la suma de los cuadrados de los residuos y contiene el punto $(\bar{x}, \bar{y})$.
  • DAT-1.G.2 La pendiente, $b$, de la recta de regresión se puede calcular como $b = r \left( \dfrac{s_y}{s_x} \right)$, donde $r$ es la correlación entre $x$ e $y$, $s_y$ es la desviación estándar muestral de la variable de respuesta, $y$, y $s_x$ es la desviación estándar muestral de la variable explicativa, $x$.
  • DAT-1.G.3 A veces, la intersección con el eje $y$ de la recta no tiene una interpretación lógica en el contexto.
  • DAT-1.G.4 En la regresión lineal simple, $r^2$ es el cuadrado de la correlación, $r$. También se le llama coeficiente de determinación. $r^2$ representa la proporción de variación en la variable de respuesta que es explicada por la variable explicativa en el modelo.

Objetivo de Aprendizaje DAT-1.H: Interpretar coeficientes para el modelo de la recta de regresión de mínimos cuadrados. [Habilidad 4.B]

  • DAT-1.H.1 Los coeficientes del modelo de regresión de mínimos cuadrados son la pendiente estimada y la intersección con el eje $y$.
  • DAT-1.H.2 La pendiente es la cantidad que cambia el valor predicho de $y$ por cada aumento unitario en $x$.
  • DAT-1.H.3 El valor de la intersección con el eje $y$ es el valor predicho de la variable de respuesta cuando la variable explicativa es igual a $0$. La fórmula para la intersección con el eje $y$, $a$, es $a = \bar{y} - b\bar{x}$.

Fuente: College Board AP Course and Exam Description

La línea de mínimos cuadrados minimiza la suma de los residuos al cuadrado
La recta de mínimos cuadrados minimiza la suma de los residuos al cuadrado

La recta minimiza la suma de los residuos al cuadrado. Su ajuste se mide mediante:

  • $s$, la desviación estándar de los residuos: el error típico de predicción, en las unidades de la variable respuesta.
  • $r^2$, el coeficiente de determinación 决定系数 – la proporción de la variación en $y$ que el modelo lineal explica (un valor entre $0$ y $1$; multiplique por $100$ para expresarlo como porcentaje). Indíquelo en contexto: "$r^2 = 0.81$ significa que el 81% de la variación en $y$ es explicada por la relación lineal con $x$."
2.9

Desviaciones de la Linealidad

Syllabus

Comprensión perdurable (DAT-1): Los modelos de regresión pueden permitirnos predecir respuestas ante cambios en una variable explicativa.

Objetivo de aprendizaje DAT-1.I: Identificar puntos influyentes en la regresión. [Habilidad 2.A]

  • DAT-1.I.1 Un valor atípico en la regresión es un punto que no sigue la tendencia general mostrada en el resto de los datos y tiene un residuo grande cuando se calcula la Recta de Regresión por Mínimos Cuadrados (LSRL, por sus siglas en inglés).
  • DAT-1.I.2 Un punto de alta apalancamiento (high-leverage point) en la regresión tiene un valor de $x$ considerablemente mayor o menor que el resto de las observaciones.
  • DAT-1.I.3 Un punto influyente en la regresión es cualquier punto que, si se elimina, cambia sustancialmente la relación. Ejemplos incluyen una pendiente diferente, un intercepto en $y$ diferente y/o una correlación diferente. Los valores atípicos y los puntos de alta apalancamiento suelen ser influyentes.

Objetivo de aprendizaje DAT-1.J: Calcular una respuesta predicha utilizando una recta de regresión por mínimos cuadrados para un conjunto de datos transformados. [Habilidad 2.C]

  • DAT-1.J.1 Las transformaciones de variables, como evaluar el logaritmo natural de cada valor de la variable de respuesta o elevar al cuadrado cada valor de la variable explicativa, pueden utilizarse para crear conjuntos de datos transformados, que pueden tener una forma más lineal que los datos sin transformar.
  • DAT-1.J.2 El aumento de aleatoriedad en los gráficos de residuos después de la transformación de los datos y/o el movimiento de $r^2$ hacia un valor más cercano a 1 ofrece evidencia de que la recta de regresión por mínimos cuadrados para los datos transformados es un modelo más apropiado para usar en la predicción de respuestas ante la variable explicativa que la recta de regresión para los datos sin transformar.

Fuente: College Board AP Course and Exam Description

Algunos puntos afectan fuertemente a la recta. Un punto de alta apalancamiento 高杠杆 tiene un valor extremo de $x$; un punto influyente 有影响的 cambia notablemente la pendiente o el $r$ al ser eliminado; aquí, un punto atípico es aquel con un residuo grande. Cuando el patrón es curvo, transforme una variable (p. ej., tome un logaritmo) para linearizarla, luego ajuste una recta a los datos transformados.

2.9

Consejos para el examen

  • En un diagrama de dispersión describa la dirección, forma, intensidad y valores atípicos; $r$ oscila entre $-1$ y $1$.
  • La correlación no implica causalidad: una variable oculta puede influir en ambas.
  • Interprete la pendiente de la recta de mínimos cuadrados en contexto ("por cada unidad de $x$, la predicción de $y$ cambia en $b$").
  • Revise un gráfico de residuos: ausencia de patrones indica que la recta se ajusta bien; un patrón curvo indica que no. Evite la extrapolación.
  • $r^2$ es la fracción de variación en $y$ explicada por el modelo.

Lecciones interactivas sobre este tema

Trátalo paso a paso, con ejercicios de verificación instantánea.

Exámenes Anteriores

Más temas en AP Estadística

Iniciar sesión o crear cuenta

IGCSE, A-Level & AP