Meça a mesma coisa vinte vezes e você não obterá a mesma resposta vinte vezes. Vinte alunos medem a mesma mesa. Os valores variam. Isso não é um…
Narração em inglês · Legendas em inglês + 中文 gravadas
1.1
Introduzindo Estatísticas: O Que Podemos Aprender com os Dados?
Programa
Compreensão Permanente (VAR-1): Dado que a variação pode ser aleatória ou não, as conclusões são incertas.
Objetivo de Aprendizagem VAR-1.A: Identificar perguntas a serem respondidas, baseando-se na variação em dados de uma variável. [Habilidade 1.A]
VAR-1.A.1 Números podem transmitir informações significativas quando colocados em contexto.
Fonte: College Board AP Course and Exam Description
Estatística 统计学 é a ciência de aprender a partir de dados 数据 – números ou rótulos recolhidos do mundo real. Os dados variam, por isso descrevemos padrões e contabilizamos a variação 变异 em vez de esperar que cada valor coincida. Uma questão estatística antecipa uma resposta baseada em dados que variam.
Two distinctions run through the whole course. A parâmetro 参数 is a numerical summary of a whole população; a estatística 统计量 is a numerical summary of a amostra - we use the statistic to estimate the parameter we cannot measure directly. And estatística descritiva 描述统计 only summarise the data set in hand, while estatística inferencial 推断统计 use a sample to make and test claims about the larger population.
Compreensão Permanente (VAR-1): Dado que a variação pode ser aleatória ou não, as conclusões são incertas.
Objetivo de Aprendizagem VAR-1.B: Identificar variáveis em um conjunto de dados. [Habilidade 2.A]
VAR-1.B.1 Uma variável é uma característica que muda de um indivíduo para outro.
Objetivo de Aprendizagem VAR-1.C: Classificar tipos de variáveis. [Habilidade 2.A]
VAR-1.C.1 Uma variável categórica assume valores que são nomes de categorias ou rótulos de grupos.
VAR-1.C.2 Uma variável quantitativa é aquela que assume valores numéricos para uma quantidade medida ou contada.
Exemplos ilustrativos para VAR-1.C:
Variáveis categóricas:
Mão dominante
Faixa etária (jovem ou velho)
Grau mais alto obtido
Variáveis quantitativas:
Idade de uma estrutura
Altura de uma criança
Concentração de uma amostra
Fonte: College Board AP Course and Exam Description
A variável 变量 is a characteristic that can differ between individuals. Two kinds:
Categórica 分类 (qualitative): values are labels/groups (eye colour, brand).
Quantitativa 定量: values are numbers you can do arithmetic on (height, age). Quantitative variables are discretas (countable) or contínuas (measured).
Escolher o gráfico e o resumo corretos depende de qual tipo você tem.
Explorar
Categorical ou quantitativa?
Cada variável é ou categórica (ela rotula cada unidade com um grupo) ou quantitativa (um número medido que você pode tirar a média). Que tipo ela é decide os gráficos e resumos que você tem permissão para usar.
Compreensão Permanente (UNC-1): Representações gráficas e estatísticas nos permitem identificar e representar características-chave dos dados.
Objetivo de Aprendizagem UNC-1.A: Representar dados categóricos usando tabelas de frequência ou frequência relativa. [Habilidade 2.B]
UNC-1.A.1 Uma tabela de frequência fornece o número de casos que caem em cada categoria. Uma tabela de frequência relativa fornece a proporção de casos que caem em cada categoria.
Objetivo de Aprendizagem UNC-1.B: Descrever dados categóricos representados em tabelas de frequência ou relativas. [Habilidade 2.A]
UNC-1.B.1 Porcentagens, frequências relativas e taxas fornecem as mesmas informações que proporções.
UNC-1.B.2 Contagens e frequências relativas de dados categóricos revelam informações que podem ser usadas para justificar afirmações sobre os dados em contexto.
Fonte: College Board AP Course and Exam Description
Uma tabela de frequência 频数 lista a contagem (frequência) de cada categoria; uma tabela de frequência relativa 相对 frequência lista a proporção 比例 de cada categoria (contagem ÷ total). As frequências relativas permitem comparar grupos de tamanhos diferentes de forma justa.
1.4
Representando uma Variável Categórica com Gráficos
Programa
Compreensão Permanente (UNC-1): Representações gráficas e estatísticas nos permitem identificar e representar características-chave dos dados.
Objetivo de Aprendizagem UNC-1.C: Representar dados categóricos graficamente. [Habilidade 2.B]
UNC-1.C.1 Gráficos de barras (ou diagramas de barras) são usados para exibir frequências (contagens) ou frequências relativas (proporções) para dados categóricos.
UNC-1.C.2 A altura ou comprimento de cada barra em um gráfico de barras corresponde ao número ou proporção de observações que caem dentro de cada categoria.
UNC-1.C.3 Existem muitas maneiras adicionais de representar frequências (contagens) ou frequências relativas (proporções) para dados categóricos.
Objetivo de Aprendizagem UNC-1.D: Descrever dados categóricos representados graficamente. [Habilidade 2.A]
UNC-1.D.1 Representações gráficas de uma variável categórica revelam informações que podem ser usadas para justificar afirmações sobre os dados em contexto.
Objetivo de Aprendizagem UNC-1.E: Comparar vários conjuntos de dados categóricos. [Habilidade 2.D]
UNC-1.E.1 Tabelas de frequência, gráficos de barras ou outras representações podem ser usadas para comparar dois ou mais conjuntos de dados em termos da mesma variável categórica.
Fonte: College Board AP Course and Exam Description
Gráficos de barras 条形 mostram a contagem ou proporção de cada categoria como barras separadas; um gráfico circular mostra a quota de cada categoria do todo. As alturas das barras (ou fatias) permitem comparar categorias de relance. As barras podem estar ordenadas por tamanho ou por uma ordem natural de categorias.
Explorar
Mostre uma variável categórica como um gráfico de pizza
Um gráfico de pizza transforma a participação de cada categoria do todo em uma fatia: uma participação maior é uma fatia maior, e todas as fatias juntas formam 100%. É uma imagem de uma tabela de frequência relativa.
1.5
Representando uma Variável Quantitativa com Gráficos
Programa
Compreensão Permanente (UNC-1): Representações gráficas e estatísticas nos permitem identificar e representar características-chave dos dados.
Objetivo de Aprendizagem UNC-1.F: Classificar tipos de variáveis quantitativas. [Habilidade 2.A]
UNC-1.F.1 Uma variável discreta pode assumir um número contável de valores. O número de valores pode ser finito ou infinitamente contável, como com os números naturais.
UNC-1.F.2 Uma variável contínua pode assumir infinitos valores, mas esses valores não podem ser contados. Não importa quão pequeno seja o intervalo entre dois valores de uma variável contínua, sempre é possível determinar outro valor entre eles.
Exemplos ilustrativos para UNC-1.F:
Uma variável discreta:
Número de alunos em uma turma
Uma variável contínua:
Altura de uma criança
Objetivo de Aprendizagem UNC-1.G: Representar dados quantitativos graficamente. [Habilidade 2.B]
UNC-1.G.1 Em um histograma, a altura de cada barra mostra o número ou proporção de observações que caem dentro do intervalo correspondente àquela barra. Alterar as larguras dos intervalos pode mudar a aparência do histograma.
UNC-1.G.2 Em um gráfico de talo e folha, cada valor de dado é dividido em um "talo" (o primeiro dígito ou dígitos) e uma "folha" (geralmente o último dígito).
UNC-1.G.3 Um dotplot representa cada observação por um ponto, com a posição no eixo horizontal correspondendo ao valor de dado daquela observação, com valores quase idênticos empilhados uns sobre os outros.
UNC-1.G.4 Um gráfico cumulativo representa o número ou proporção de um conjunto de dados menor ou igual a um número dado.
UNC-1.G.5 Existem muitas maneiras adicionais de representar graficamente distribuições de dados quantitativos.
Fonte: College Board AP Course and Exam Description
Para números, use um gráfico de pontos 点图, diagrama de caule-e-folhas 茎叶图 ou histograma 直方 (barras sobre intervalos de valores chamados classes). Estes mostram a distribuição 分布 – como os valores se espalham. A largura da classe num histograma altera a imagem, por isso escolha-a para revelar a forma.
Em um histograma com larguras de classe desiguais, a área da barra é a frequência
Explorar
Explore como a largura da bin molda um histograma
Um histograma agrupa dados em bins de largura igual e desenha uma barra sobre cada um. Mude os bins e note como os mesmos dados podem parecer irregulares (muito estreitos) ou suaves (muito largos) — a forma é uma escolha.
Descrevendo a Distribuição de uma Variável Quantitativa
Programa
Compreensão Permanente (UNC-1): Representações gráficas e estatísticas nos permitem identificar e representar características-chave dos dados.
Objetivo de Aprendizagem UNC-1.H: Descrever as características das distribuições de dados quantitativos. [Habilidade 2.A]
UNC-1.H.1 As descrições da distribuição de dados quantitativos incluem forma, centro e variabilidade (dispersão), bem como quaisquer características incomuns, como valores atípicos, lacunas, aglomerados ou múltiplos picos.
UNC-1.H.2 Valores atípicos para dados de uma variável são pontos de dados incomummente pequenos ou grandes em relação ao restante dos dados.
UNC-1.H.3 Uma distribuição é assimétrica à direita (assimetria positiva) se a cauda direita for mais longa que a esquerda. Uma distribuição é assimétrica à esquerda (assimetria negativa) se a cauda esquerda for mais longa que a direita. Uma distribuição é simétrica se a metade esquerda for a imagem espelhada da metade direita.
UNC-1.H.4 Gráficos univariados com um único pico principal são conhecidos como unimodais. Gráficos com dois picos proeminentes são bimodais. Um gráfico onde a altura de cada barra é aproximadamente a mesma (sem picos proeminentes) é aproximadamente uniforme.
UNC-1.H.5 Uma lacuna é uma região de uma distribuição entre dois valores de dados onde não há dados observados.
UNC-1.H.6 Aglomerados são concentrações de dados geralmente separadas por lacunas.
UNC-1.H.7 Estatística descritiva não atribui propriedades de um conjunto de dados a uma população maior, mas pode fornecer a base para conjecturas para testes subsequentes.
Fonte: College Board AP Course and Exam Description
Describe four things (remember SOCS):
Forma 形状: symmetric, or assimétrica 偏斜 left/right (a long tail on that side), and how many peaks - one main peak is unimodal 单峰, two prominent peaks bimodal 双峰, and roughly equal bars uniforme 均匀.
Valores atípicos 离群值: unusual values far from the rest.
Centro: a typical value (mean or median).
Dispersão: how much the values vary (range, IQR, standard deviation).
Sempre descreva forma/centro/dispersão no contexto, com unidades.
A forma de uma distribuição: simétrica, assimétrica à direita (cauda longa à direita), ou assimétrica à esquerda
cumulative relative frequency graph/ˈkjuːmjʊlətɪv ˈrelətɪv ˈfriːkwənsi ɡræf/
累积相对频率图
lěi jī xiāng duì pín lǜ tú
1.7
Estatísticas Resumidas para uma Variável Quantitativa
Programa
Compreensão Permanente (UNC-1): Representações gráficas e estatísticas nos permitem identificar e representar características-chave dos dados.
Objetivo de Aprendizagem UNC-1.I: Calcular medidas de centro e posição para dados quantitativos. [Habilidade 2.C]
UNC-1.I.1 Uma estatística é um resumo numérico de dados amostrais.
UNC-1.I.2 A média é a soma de todos os valores de dados dividida pelo número de valores. Para uma amostra, a média é denotada por $x$: $\bar{x} = \dfrac{1}{n}\sum_{i=1}^{n} x_i$, onde $x_i$ representa o $i^{\text{th}}$ ponto de dados na amostra e $n$ representa o número de valores de dados na amostra.
UNC-1.I.3 A mediana de um conjunto de dados é o valor central quando os dados estão ordenados. Quando o número de pontos de dados é par, a mediana pode assumir qualquer valor entre os dois valores centrais. Em Estatística AP, o valor mais comumente usado para a mediana de um conjunto de dados com um número par de valores é a média dos dois valores centrais.
UNC-1.I.4 O primeiro quartil, Q1, é a mediana da metade do conjunto de dados ordenado do mínimo até a posição da mediana. O terceiro quartil, Q3, é a mediana da metade do conjunto de dados ordenado da posição da mediana até o máximo. Q1 e Q3 formam os limites para os 50% centrais de valores em um conjunto de dados ordenado.
UNC-1.I.5 O $p^{\text{th}}$ percentil é interpretado como o valor que tem $p\%$ dos dados menores ou iguais a ele.
Objetivo de Aprendizagem UNC-1.J: Calcular medidas de variabilidade para dados quantitativos. [Habilidade 2.C]
UNC-1.J.1 Três medidas de variabilidade (ou dispersão) comumente usadas em uma distribuição são a amplitude, a amplitude interquartil e o desvio padrão.
UNC-1.J.2 A amplitude é definida como a diferença entre o valor máximo de dados e o valor mínimo de dados. A amplitude interquartil (AIQ) é definida como a diferença entre o terceiro e o primeiro quartis: $Q3 - Q1$. Tanto a amplitude quanto a amplitude interquartil são formas possíveis de medir a variabilidade da distribuição de uma variável quantitativa.
UNC-1.J.3 O desvio padrão é uma maneira de medir a variabilidade da distribuição de uma variável quantitativa. Para uma amostra, o desvio padrão é denotado por $s$: $s_x = \sqrt{\dfrac{1}{n-1}\sum(x_i - \bar{x})^2}$. O quadrado do desvio padrão da amostra, $s^2$, é chamado de variância da amostra.
UNC-1.J.4 Alterar unidades de medida afeta os valores das estatísticas calculadas.
Objetivo de Aprendizagem UNC-1.K: Explicar a seleção de uma medida específica de centro e/ou variabilidade para descrever um conjunto de dados quantitativos. [Habilidade 4.B]
UNC-1.K.1 Existem muitos métodos para determinar valores atípicos. Dois métodos frequentemente usados neste curso são:
UNC-1.K.1.i Um valor atípico é um valor maior que $1.5 \times \text{IQR}$ acima do terceiro quartil ou mais que $1.5 \times \text{IQR}$ abaixo do primeiro quartil.
UNC-1.K.1.ii Um valor atípico é um valor localizado a 2 ou mais desvios padrões acima, ou abaixo, da média.
UNC-1.K.2 A média, o desvio padrão e a amplitude são considerados não resistentes (ou não robustos) porque são influenciados por valores atípicos. A mediana e a AIQ são consideradas resistentes (ou robustas), pois valores atípicos não afetam significativamente (se é que afetam) seu valor.
Fonte: College Board AP Course and Exam Description
Standard deviation: spread about the mean
Centro: a média 均值$\bar{x}=\dfrac{\sum x_i}{n}$ (média aritmética) e a mediana 中位数 (valor do meio). A mediana resiste aos valores extremos; a média é atraída para uma assimetria.
Dispersão: o intervalo, a amplitude interquartil 四分位距$\text{IQR}=Q_3-Q_1$ (middle 50%), and the desvio padrão 标准差$s_x=\sqrt{\dfrac{\sum(x_i-\bar{x})^2}{n-1}}$ (typical distance from the mean; its square is the variância 方差).
O resumo de cinco números 五数概括: min, $Q_1$, mediana, $Q_3$, max.
Use medidas resistentes (median, IQR) for skewed data; mean and standard deviation for roughly symmetric data.
A percentil 百分位数 de um valor é a porcentagem dos dados abaixo ou igual a ele – então a mediana é o percentil 50 e $Q_1$ o 25º. Um gráfico de frequência relativa cumulativa 累积相对频率图 torna os percentis fáceis de ler: para cada valor, plotar a proporção dos dados abaixo ou igual a ele, subindo de 0 a 1. Suba de um valor até a curva e vá até seu percentil, ou inverta os passos para encontrar o valor em um determinado percentil (a mesma leitura funciona a partir de uma tabela de frequência cumulativa).
Exemplo resolvido. Para os dados $4, 8, 6, 10, 7$: a média é $\bar{x}=\dfrac{4+8+6+10+7}{5}=\dfrac{35}{5}=7$. Ordenando para $4,6,7,8,10$, a mediana é o valor do meio, $7$. A média e a mediana concordam aqui porque os dados são aproximadamente simétricos.
Representações Gráficas das Estatísticas Resumidas
Programa
Compreensão Permanente (UNC-1): Representações gráficas e estatísticas nos permitem identificar e representar características-chave dos dados.
Objetivo de Aprendizagem UNC-1.L: Representar graficamente estatísticas resumidas para dados quantitativos. [Habilidade 2.B]
UNC-1.L.1 Juntos, o valor mínimo de dados, o primeiro quartil (Q1), a mediana, o terceiro quartil (Q3) e o valor máximo de dados compõem o resumo de cinco números.
UNC-1.L.2 Um diagrama de caixa é uma representação gráfica do resumo de cinco números (mínimo, primeiro quartil, mediana, terceiro quartil, máximo). A caixa representa os 50% centrais de dados, com uma linha na mediana e as extremidades da caixa correspondentes aos quartis. Linhas ("bigornas") estendem-se dos quartis até o ponto mais extremo que não é um valor atípico, e os valores atípicos são indicados por seu próprio símbolo além disso.
Objetivo de Aprendizagem UNC-1.M: Descrever estatísticas resumidas de dados quantitativos representados graficamente. [Habilidade 2.A]
UNC-1.M.1 Estatísticas resumidas de dados quantitativos, ou de conjuntos de dados quantitativos, podem ser usadas para justificar afirmações sobre os dados no contexto.
UNC-1.M.2 Se uma distribuição for relativamente simétrica, então a média e a mediana estarão relativamente próximas uma da outra. Se uma distribuição for assimétrica à direita, então a média geralmente estará à direita da mediana. Se a distribuição for assimétrica à esquerda, então a média geralmente estará à esquerda da mediana.
Fonte: College Board AP Course and Exam Description
Um diagrama de caixa 箱线图 desenha o resumo de cinco números: uma caixa de $Q_1$ a $Q_3$ com a mediana dentro, e bigodes até os valores extremos não outliers. Um ponto é um outlier 异常值 se estiver mais de $1.5\times\text{IQR}$ além de um quartil – uma regra que você pode ser solicitado a aplicar. Os diagramas de caixa são ideais para comparar vários grupos lado a lado.
Exemplo resolvido. Um conjunto de dados tem $Q_1=20$ e $Q_3=32$, logo $\text{IQR}=12$. As cercas de valores extremos são $Q_1-1.5(12)=2$ e $Q_3+1.5(12)=50$. Qualquer valor abaixo de $2$ ou acima de $50$ é sinalizado como um valor extremo.
Um diagrama de caixa e bigodes mostra os quartis e a amplitudeUm diagrama de caixa desenha o resumo de cinco números; a caixa abrange o IQR
Explorar
Explore o resumo de cinco números como um diagrama de caixa
Arraste $Q_1$, a mediana, e $Q_3$ para ver a caixa (seu comprimento é o IQR) e como a posição da mediana dentro da caixa revela assimetria — uma mediana próxima a $Q_1$ sinaliza uma distribuição com assimetria à direita.
Comparando Distribuições de uma Variável Quantitativa
Programa
Compreensão Permanente (UNC-1): Representações gráficas e estatísticas nos permitem identificar e representar características-chave dos dados.
Objetivo de Aprendizagem UNC-1.N: Comparar representações gráficas para vários conjuntos de dados quantitativos. [Habilidade 2.D]
UNC-1.N.1 Qualquer uma das representações gráficas, p. ex., histogramas, diagramas de caixa lado a lado, etc., pode ser usada para comparar duas ou mais amostras independentes em termos de centro, variabilidade, aglomerados, lacunas, valores atípicos e outras características.
Objetivo de Aprendizagem UNC-1.O: Comparar estatísticas resumidas para vários conjuntos de dados quantitativos. [Habilidade 2.D]
UNC-1.O.1 Qualquer um dos resumos numéricos (p. ex., média, desvio padrão, frequência relativa, etc.) pode ser usado para comparar duas ou mais amostras independentes.
Fonte: College Board AP Course and Exam Description
Para comparar dois ou mais grupos, compare forma, centro e dispersão, e mencione outliers – sempre com palavras comparativas ("O Grupo A tem uma mediana maior que o Grupo B") e no contexto. Não descreva apenas cada grupo separadamente; faça a comparação explicitamente.
Explorar
Compare distribuições com diagramas de caixa
Um diagrama de caixa desenha o resumo de cinco números. Colocar dois diagramas de caixa na mesma escala compara seu centro (mediana), dispersão (IQR = largura da caixa) e assimetria de relance — a maneira justa de comparar grupos.
1.10
A Distribuição Normal
Programa
Compreensão Permanente (VAR-2): A distribuição normal pode ser usada para representar algumas distribuições populacionais.
Objetivo de Aprendizagem VAR-2.A: Comparar uma distribuição de dados ao modelo de distribuição normal. [Habilidade 2.D]
VAR-2.A.1 Um parâmetro é um resumo numérico de uma população.
VAR-2.A.2 Alguns conjuntos de dados podem ser descritos como aproximadamente normalmente distribuídos. Uma curva normal tem formato de montanha e é simétrica. Os parâmetros de uma distribuição normal são a média populacional, $\mu$, e o desvio padrão populacional, $\sigma$.
VAR-2.A.3 Para uma distribuição normal, aproximadamente 68% das observações estão dentro de 1 desvio padrão da média, aproximadamente 95% das observações estão dentro de 2 desvios padrão da média e aproximadamente 99.7% das observações estão dentro de 3 desvios padrão da média. Isso é chamado de regra empírica.
VAR-2.A.4 Muitas variáveis podem ser modeladas por uma distribuição normal.
Exemplos ilustrativos para VAR-2.A:
Variáveis que podem ser modeladas por uma distribuição normal:
Temperatura corporal
Peso de uma fatia de pão
Objetivo de Aprendizagem VAR-2.B: Determinar proporções e percentis a partir de uma distribuição normal. [Habilidade 3.A]
VAR-2.B.1 Um escore padronizado para um valor de dado específico é calculado como (valor do dado − média)/(desvio padrão) e mede o número de desvios padrões que um valor de dado está acima ou abaixo da média.
VAR-2.B.2 Um exemplo de escore padronizado é um escore $z$, que é calculado como $z\text{-score} = \left(\dfrac{x_i - \mu}{\sigma}\right)$. Um escore $z$ mede quantos desvios padrões um valor de dado está da média.
VAR-2.B.3 Tecnologia, como uma calculadora, uma tabela normal padrão ou saída gerada por computador, pode ser usada para encontrar a proporção de valores de dados localizados em um intervalo dado de uma variável aleatória normalmente distribuída.
VAR-2.B.4 Dada a área de uma região sob o gráfico da curva de distribuição normal, é possível usar tecnologia, como uma calculadora, uma tabela normal padrão ou saída gerada por computador, para estimar parâmetros para algumas populações.
Objetivo de Aprendizagem VAR-2.C: Comparar medidas de posição relativa em conjuntos de dados. [Habilidade 2.D]
VAR-2.C.1 Percentis e escores $z$ podem ser usados para comparar posições relativas de pontos dentro de um conjunto de dados ou entre conjuntos de dados.
Fonte: College Board AP Course and Exam Description
A distribuição normal 正态分布 is a symmetric, bell-shaped model described by its mean $\mu$ and standard deviation $\sigma$. The regra empírica 经验法则 (68–95–99.7): about 68% of values lie within $1\sigma$ of the mean, 95% within $2\sigma$, and 99.7% within $3\sigma$.
A curva normal: uma probabilidade é a área sob ela, centrada na média
Uma $z$-score 标准分数 mede quantos desvios padrão um valor está da média:
$$z=\frac{x-\mu}{\sigma}.$$
Converta para uma pontuação $z$, em seguida, use a tabela normal ou tecnologia para encontrar a proporção (área) abaixo, acima ou entre valores – e inverta o processo para encontrar um valor a partir de um determinado percentil.
Exemplo resolvido. As pontuações dos testes são normalmente distribuídas com $\mu=500$ e $\sigma=100$. Uma pontuação de $700$ tem $z=\dfrac{700-500}{100}=2$. Pela regra empírica, $95\%$ das pontuações estão dentro de $2\sigma$, então $2.5\%$ ficam acima de $700$ – o que significa que uma $700$ está aproximadamente no $97.5$º percentil.
A curva normal e a regra empírica 68-95-99.7
Explorar
Explore a área sob a curva normal
A proporção de dados abaixo de um valor igual à área sob a curva à sua esquerda. Sombreie uma cauda ou uma banda central para ver a regra empírica 68–95–99.7 e leia um escore-z $z$ como uma área.