Метод наименьших квадратов регрессии
| English | Русский |
|---|---|
| least-squares line/liːst skweəz laɪn/ | прямая наименьших квадратов |
| coefficient of determination/ˌkəʊɪˈfɪʃənt ɒv dɪˌtɜːmɪˈneɪʃn/ | коэффициент детерминации |
Почему «наименьшие квадраты»?
- Через облако точек может пройти множество прямых — какая из них лучшая?
- Прямая наименьших квадратов — это та, которая делает сумму квадратов остатков минимально возможной.
- Возведение в квадрат сохраняет ошибки положительными и дополнительно штрафует за большие отклонения.
- Минимизация этой суммы определяет уникальный лучший наклон и свободный член.
R-квадрат: объясненная вариация
- Коэффициент детерминации $r^2$ — это доля вариации $y$, объясненная моделью.
- Это буквально квадрат коэффициента корреляции, поэтому $0 \le r^2 \le 1$.
- $r^2 = 0.64$ означает "$64\%$ вариации в $y$ объясняется линейной зависимостью от $x$."
- Оставшаяся часть ($36\%$) обусловлена другими факторами и разбросом.
s: типичная ошибка предсказания
- Стандартное отклонение остатков $s$ — это типичный размер ошибки предсказания.
- Оно выражено в единицах $y$: «предсказания обычно ошибаются примерно на $s$».
- Меньшее $s$ = более тесная подгонка; большее $s$ = более разбросанные прогнозы.
- $s$ отвечает на вопрос «насколько отклонение в реальных единицах?», а $r^2$ — «какая доля объяснена?».
Наклон из сводных статистик
- Вы можете построить прямую по сводным статистикам без исходных данных:
- Наклон: $b = r\dfrac{s_y}{s_x}$ — корреляция, масштабированная через отношение размахов.
- Свободный член: прямая всегда проходит через $(\bar{x}, \bar{y})$, следовательно $a = \bar{y} - b\bar{x}$.
- Эти две формулы позволяют восстановить $\hat{y} = a + bx$ по $r$, средним значениям и стандартным отклонениям.
Не путайте два показателя качества. $r^2$ — это безразмерная доля («$64\%$ вариации объяснено»); $s$ — это типичная ошибка в единицах $y$ («отклонение примерно на $s$»). А при вычислении наклона соблюдайте порядок: $b = r\,s_y/s_x$ — это $s_y$ (размах ответной переменной) деленное на $s_x$ (размах объясняющей переменной), а не наоборот.
Качество модели характеризуется параметрами $r = 0.8$, $s_x = 2$, $s_y = 10$, $\bar{x}=5$, $\bar{y}=60$.
- Наклон: $b = 0.8 \times \dfrac{10}{2} = 4$.
- Свободный член: $a = 60 - 4(5) = 40$, следовательно $\hat{y} = 40 + 4x$.
- $r^2 = 0.64$: $64\%$ вариации в $y$ объясняется моделью.
Прямая наименьших квадратов минимизирует сумму квадратов остатков. $r^2$ — это доля вариации в $y$, объясненная моделью (безразмерная величина, $0$–$1$); $s$ — это типичная ошибка предсказания (в единицах $y$). По сводным статистикам находятся $b = r\dfrac{s_y}{s_x}$, а прямая проходит через $(\bar{x}, \bar{y})$.
Лучшая прямая методом наименьших квадратов
Линия, минимизирующая общую сумму квадратов вертикальных расстояний.
При r = 0.8, s_x = 2, s_y = 10, найдите наклон b = r·(s_y/s_x).
b = 0.8 × (10/2) = 0.8 × 5 = 4.
Если корреляция r = 0.8, каков коэффициент детерминации r²?
r² = 0.8² = 0.64.
r² = 0.64 лучше всего интерпретируется как...
r² — это доля вариации y, объясненной моделью.
Линия наименьших квадратов минимизирует сумму квадратов остатков.
Это именно критерий, который её определяет.
Какая величина является типичной ошибкой прогноза, измеренной в единицах y?
s выражается в единицах y; r² и r безразмерны.