Sampling and estimation · Muestreo y estimación
| English | Español |
|---|---|
| sample/ˈsæmpl/ | muestra |
| population/ˌpɒpjʊˈleɪʃn/ | población |
| stratified/ˈstrætɪfaɪd/ | estratificado |
| systematic/ˌsɪstəˈmætɪk/ | sistemático |
| cluster/ˈklʌstə/ | por conglomerados |
| sampling distribution/ˈsæmplɪŋ ˌdɪstrɪˈbjuːʃn/ | distribución muestral |
| standard error/ˈstændəd ˈerə/ | error estándar |
| Central Limit Theorem/ˈsentrəl ˈlɪmɪt ˈθɪərəm/ | Teorema del Límite Central |
| confidence interval/ˈkɒnfɪdəns ˈɪntəvl/ | intervalo de confianza |
The poll that predicted the election
- A survey of 1000 people can predict the voting behaviour of 60 million. How?
- Sampling 样本 lets you draw conclusions about a whole population 总体 from a small, carefully chosen subset. The mathematics behind it is the foundation of all statistical inference.
La encuesta que predijo las elecciones
- Una encuesta de 1000 personas puede predecir el comportamiento electoral de 60 millones. ¿Cómo?
- El muestreo permite obtener conclusiones sobre una población completa a partir de un subconjunto pequeño y cuidadosamente seleccionado. Las matemáticas detrás de esto son la base de toda inferencia estadística.
Populations and samples
- A population is the entire group you want to study. A sample is a small group from the population.
- Good sampling needs randomness — every member must have a known chance of being selected.
- Sampling methods: simple random, stratified 分层 (proportional from each subgroup), systematic 系统 (every $k$th member), cluster 整群.
Stratified sampling. A school has 600 boys and 400 girls. A stratified sample of 50: $\dfrac{600}{1000} \times 50 = 30$ boys and $\dfrac{400}{1000} \times 50 = 20$ girls.
The sample mean is nearly normal whatever the population shape
Poblaciones y muestras
- Una población es el grupo completo que deseas estudiar. Una muestra es un grupo pequeño extraído de la población.
- Un buen muestreo requiere aleatoriedad: cada miembro debe tener una probabilidad conocida de ser seleccionado.
- Métodos de muestreo: aleatorio simple, estratificado (proporcional en cada subgrupo), sistemático (cada $k$-ésimo miembro), por conglomerados.
Muestreo estratificado. Una escuela tiene 600 estudiantes hombres y 400 estudiantes mujeres. Una muestra estratificada de 50: $\dfrac{600}{1000} \times 50 = 30$ hombres y $\dfrac{400}{1000} \times 50 = 20$ mujeres.

La media muestral es casi normal independientemente de la forma de la población
The sampling distribution · La distribución muestral
X̄ ~ N(μ, σ²/n)
By the Central Limit Theorem, sample means follow a normal curve — narrower for bigger samples. · Por el Teorema del Límite Central, las medias muestrales siguen una curva normal — más estrecha para muestras más grandes.
A school has 600 boys and 400 girls. A stratified sample of 50 needs how many boys? · Una escuela tiene 600 chicos y 400 chicas. Una muestra estratificada de 50 necesita cuántos chicos?
(600/1000) × 50 = 30 boys. · (600/1000) × 50 = 30 chicos.
The sampling distribution 抽样分布 of the mean
- The sample mean $\bar{X}$ is itself a random variable:
- The standard error 标准误 of the mean is $\dfrac{\sigma}{\sqrt{n}}$ — it shrinks as $n$ grows.
Statistics studies a sample to learn about a whole population
La distribución muestral de la media
- La media muestral $\bar{X}$ es en sí misma una variable aleatoria:
- El error estándar de la media es $\dfrac{\sigma}{\sqrt{n}}$ — disminuye conforme crece $n$.

La estadística estudia una muestra para aprender sobre una población completa
A population has σ = 8. For a sample of n = 64, what is Var(X̄) = σ²/n? · Una población tiene σ = 8. Para una muestra de n = 64, ¿cuál es Var(X̄) = σ²/n?
Var(X̄) = σ²/n = 64/64 = 1.
A population has σ = 10 and n = 25. The standard error σ/√n = ? · Una población tiene σ = 10 y n = 25. El error estándar σ/√n = ?
σ/√n = 10/√25 = 10/5 = 2.
Match each sampling idea to its meaning. · Asocia cada idea de muestreo con su significado.
The CLT makes sample means normal; their spread is σ²/n, giving the confidence interval. · El TLC hace que las medias muestrales sean normales; su dispersión es σ²/n, lo que da el intervalo de confianza.
The Central Limit Theorem 中心极限定理
- By the Central Limit Theorem, for a large sample ($n \geq 30$), $\bar{X}$ is approximately normal, whatever the population's shape.
- This is one of the most powerful results in all of mathematics — it lets us use the normal distribution even when the data isn't normal.
CLT applies to the mean, not the data. The Central Limit Theorem says the distribution of $\bar{X}$ becomes normal — not the individual data points. The raw data can have any shape.
A 95% confidence interval 置信区间 reaches 1.96 standard errors each side of the sample mean
El Teorema del Límite Central
- Por el Teorema del Límite Central, para una muestra grande ($n \geq 30$), $\bar{X}$ es aproximadamente normal, independientemente de la forma de la población.
- Este es uno de los resultados más poderosos en todas las matemáticas: nos permite utilizar la distribución normal incluso cuando los datos no lo son.
El TLC se aplica a la media, no a los datos. El Teorema del Límite Central indica que la distribución de $\bar{X}$ se vuelve normal, no los puntos de datos individuales. Los datos crudos pueden tener cualquier forma.

Un intervalo de confianza del 95% abarca 1.96 errores estándar a cada lado de la media muestral
By the Central Limit Theorem, the sample mean is approximately normal for a large sample, whatever the population shape. · Por el Teorema del Límite Central, la media muestral es aproximadamente normal para una muestra grande, independientemente de la forma de la población.
The CLT makes X̄ approximately normal as the sample size grows. · El TLC hace que X̄ sea aproximadamente normal a medida que crece el tamaño de la muestra.
The Central Limit Theorem says the individual data points become normally distributed for large samples. · El Teorema del Límite Central dice que los datos individuales se distribuyen normalmente para muestras grandes.
The CLT applies to the sample mean X̄, not the individual data points. The raw data can have any shape. · El TLC se aplica a la media muestral X̄, no a los datos individuales. Los datos crudos pueden tener cualquier forma.
Confidence intervals
- A confidence interval gives a range that probably contains the true mean.
- For a normal population with known $\sigma$ (or a large sample), a 95% interval is:
- From a random sample find unbiased estimates of the mean and variance ('unbiased' = correct on average), and a confidence interval for a population proportion; random numbers help choose the sample.
Intervalos de confianza
- Un intervalo de confianza proporciona un rango que probablemente contiene la media verdadera.
- Para una población normal con $\sigma$ conocido (o una muestra grande), un intervalo al 95% es:
- A partir de una muestra aleatoria, encuentra estimadores insesgados de la media y la varianza ('insesgado' = correcto en promedio), y un intervalo de confianza para una proporción poblacional; los números aleatorios ayudan a seleccionar la muestra.
A sample of n = 64 has σ = 8. What is the margin 1.96 × σ/√n for a 95% interval? (2 dp) · Una muestra de n = 64 tiene σ = 8. ¿Cuál es el margen 1.96 × σ/√n para un intervalo del 95%? (2 decimales)
1.96 × 8/√64 = 1.96 × 8/8 = 1.96.
You've got it
- $E(\bar{X}) = \mu$, $\text{Var}(\bar{X}) = \dfrac{\sigma^2}{n}$; CLT makes $\bar X$ ≈ normal for large $n$
- a 95% confidence interval: $\bar{x} \pm 1.96\dfrac{\sigma}{\sqrt{n}}$
- good sampling needs randomness
Lo has entendido
- $E(\bar{X}) = \mu$, $\text{Var}(\bar{X}) = \dfrac{\sigma^2}{n}$; el TLC hace que $\bar X$ ≈ sea normal para grandes valores de $n$
- un intervalo de confianza del 95%: $\bar{x} \pm 1.96\dfrac{\sigma}{\sqrt{n}}$
- un buen muestreo necesita aleatoriedad