Least-Squares Regression · Regresión de Mínimos Cuadrados
| English | Español |
|---|---|
| least-squares line/liːst skweəz laɪn/ | Recta de mínimos cuadrados |
| coefficient of determination/ˌkəʊɪˈfɪʃənt ɒv dɪˌtɜːmɪˈneɪʃn/ | Coeficiente de determinación |
Why "least squares"?
- Many lines could pass through a cloud — which is best?
- The least-squares line 最小二乘线 is the one that makes the sum of squared residuals as small as possible.
- Squaring keeps errors positive and punishes big misses extra hard.
- Minimizing that total is what pins down the unique best-fit slope and intercept.
¿Por qué "mínimos cuadrados"?
- Por una nube de puntos pueden pasar muchas rectas — ¿cuál es la mejor?
- La recta de mínimos cuadrados 最小二乘线 es aquella que hace que la suma de los residuos al cuadrado sea lo más pequeña posible.
- Elevar al cuadrado mantiene los errores positivos y penaliza con mayor fuerza los desvíos grandes.
- Minimizar ese total es lo que fija la pendiente y la ordenada en el origen únicas para el mejor ajuste.
r-squared: variation explained
- The coefficient of determination 决定系数 $r^2$ is the fraction of the variation in $y$ explained by the model.
- It's literally the square of the correlation, so $0 \le r^2 \le 1$.
- $r^2 = 0.64$ means "$64\%$ of the variation in $y$ is explained by the linear relationship with $x$."
- The rest ($36\%$) is due to other factors and scatter.
r-cuadrado: variación explicada
- El coeficiente de determinación 决定系数 $r^2$ es la fracción de la variación en $y$ explicada por el modelo.
- Es literalmente el cuadrado de la correlación, por lo que $0 \le r^2 \le 1$.
- Un $r^2 = 0.64$ significa que el "$64\%$ de la variación en $y$ está explicada por la relación lineal con $x$".
- El resto ($36\%$) se debe a otros factores y a la dispersión.
s: typical prediction error
- The standard deviation of the residuals $s$ is the typical size of a prediction error.
- It's in the units of $y$: "predictions are typically off by about $s$."
- Smaller $s$ = tighter fit; larger $s$ = looser predictions.
- $s$ answers "how far off, in real units?" while $r^2$ answers "what fraction explained?"
s: error típico de predicción
- La desviación estándar de los residuos $s$ es el tamaño típico de un error de predicción.
- Está en las unidades de $y$: "las predicciones suelen estar equivocadas aproximadamente en $s$".
- Un $s$ pequeño indica un ajuste ajustado; un $s$ grande indica predicciones más amplias.
- $s$ responde a "¿qué tan lejos, en unidades reales?", mientras que $r^2$ responde a "¿qué fracción está explicada?".
Slope from summary stats
- You can build the line from summary statistics without the raw data:
- Slope: $b = r\dfrac{s_y}{s_x}$ — correlation scaled by the ratio of spreads.
- Intercept: the line always passes through $(\bar{x}, \bar{y})$, so $a = \bar{y} - b\bar{x}$.
- These two formulas recover $\hat{y} = a + bx$ from $r$, the means, and the standard deviations.
Pendiente a partir de estadísticas resumidas
- Se puede construir la recta usando solo estadísticas resumidas, sin necesidad de los datos crudos:
- Pendiente: $b = r\dfrac{s_y}{s_x}$ — la correlación escalada por la razón entre las dispersiones.
- Ordenada en el origen: la recta siempre pasa por $(\bar{x}, \bar{y})$, por lo tanto $a = \bar{y} - b\bar{x}$.
- Estas dos fórmulas permiten recuperar $\hat{y} = a + bx$ a partir de $r$, las medias y las desviaciones estándar.
Don't confuse the two fit numbers. $r^2$ is a unitless fraction ("$64\%$ of variation explained"); $s$ is a typical error in the units of $y$ ("off by about $s$"). And when you compute the slope, mind the order: $b = r\,s_y/s_x$ — it's $s_y$ (response spread) over $s_x$ (explanatory spread), not the reverse.
No confunda los dos números del ajuste. $r^2$ es una fracción adimensional ("$64\%$ de variación explicada"); $s$ es un error típico en las unidades de $y$ ("se equivoca en aproximadamente $s$"). Y al calcular la pendiente, tenga cuidado con el orden: $b = r\,s_y/s_x$ — es $s_y$ (dispersión de la respuesta) sobre $s_x$ (dispersión de la variable explicativa), no al revés.
A fit has $r = 0.8$, $s_x = 2$, $s_y = 10$, $\bar{x}=5$, $\bar{y}=60$.
- Slope: $b = 0.8 \times \dfrac{10}{2} = 4$.
- Intercept: $a = 60 - 4(5) = 40$, so $\hat{y} = 40 + 4x$.
- $r^2 = 0.64$: $64\%$ of the variation in $y$ is explained by the model.
Un ajuste tiene $r = 0.8$, $s_x = 2$, $s_y = 10$, $\bar{x}=5$, $\bar{y}=60$.
- Pendiente: $b = 0.8 \times \dfrac{10}{2} = 4$.
- Ordenada en el origen: $a = 60 - 4(5) = 40$, por lo tanto $\hat{y} = 40 + 4x$.
- $r^2 = 0.64$: El $64\%$ de la variación en $y$ está explicada por el modelo.
The least-squares line minimizes the sum of squared residuals. $r^2$ is the fraction of variation in $y$ explained (unitless, $0$–$1$); $s$ is the typical prediction error (units of $y$). From summary stats, $b = r\dfrac{s_y}{s_x}$ and the line passes through $(\bar{x}, \bar{y})$.
La recta de mínimos cuadrados minimiza la suma de los residuos al cuadrado. $r^2$ es la fracción de variación en $y$ explicada (adimensional, entre $0$ y $1$); $s$ es el error típico de predicción (unidades de $y$). A partir de estadísticas resumidas, $b = r\dfrac{s_y}{s_x}$ y la recta pasa por $(\bar{x}, \bar{y})$.
The best-fit least-squares line · La recta de ajuste por mínimos cuadrados
The line that makes the total squared vertical gap smallest. · La recta que hace que la suma total de los cuadrados de las distancias verticales sea mínima.
With r = 0.8, s_x = 2, s_y = 10, find the slope b = r·(s_y/s_x). · Con r = 0.8, s_x = 2, s_y = 10, encuentre la pendiente b = r·(s_y/s_x).
b = 0.8 × (10/2) = 0.8 × 5 = 4.
If the correlation is r = 0.8, what is r-squared? · Si la correlación es r = 0.8, ¿cuál es el coeficiente de determinación?
r² = 0.8² = 0.64.
r² = 0.64 is best interpreted as... · r² = 0.64 se interpreta mejor como...
r² is the fraction of y's variation explained. · r² es la fracción de la variación de y explicada.
The least-squares line minimizes the sum of the squared residuals. · La recta de mínimos cuadrados minimiza la suma de los residuos al cuadrado.
That is exactly the criterion that defines it. · Ese es exactamente el criterio que la define.
Which quantity is a typical prediction error, measured in the units of y? · ¿Cuál cantidad es un error de predicción típico, medido en las unidades de y?
s is in y-units; r² and r are unitless. · s está en unidades de y; r² y r no tienen unidades.