Estatística: população, amostra, variáveis e organização de dados
Uma escola pretende avaliar a qualidade da alimentação oferecida aos estudantes. Uma prefeitura precisa conhecer os meios de transporte utilizados pelos moradores. Uma empresa deseja compreender o tempo de espera de seus clientes. Em todos esses casos, não basta reunir números: é necessário definir quem será investigado, quais características serão observadas, como os dados serão coletados e de que maneira serão organizados.
A Estatística oferece métodos para planejar pesquisas, coletar informações, organizar dados, analisá-los e comunicar conclusões. Nesta postagem, estudaremos os conceitos que sustentam esse processo: população, amostra, variáveis estatísticas, formas de coleta e tabelas de distribuição de frequência.
EM13MAT202 — planejar e executar pesquisas amostrais, considerando a escolha da amostra, a elaboração de instrumentos, a coleta, a organização e a interpretação dos dados.
EM13MAT102 — analisar tabelas, gráficos e métodos de amostragem utilizados na comunicação de informações de natureza social, econômica e científica.
EM13MAT406 — construir e interpretar tabelas e representações estatísticas, utilizando frequências absolutas e relativas para analisar conjuntos de dados.
1. O que a Estatística investiga?
A Estatística é uma área da Matemática dedicada ao estudo de dados. Ela permite transformar observações isoladas em informações que ajudam a compreender fenômenos, comparar grupos, identificar padrões e tomar decisões.
Planejar
Definir o problema, os objetivos, o público investigado e as informações necessárias.
Coletar e organizar
Obter os dados de maneira adequada e apresentá-los em listas, tabelas ou distribuições.
Analisar e comunicar
Interpretar os resultados, reconhecer limitações e comunicar conclusões com clareza.
Os dados não falam por si mesmos. Uma tabela pode estar correta e, ainda assim, não responder à pergunta da pesquisa. Por isso, toda análise deve considerar o objetivo, a forma de coleta e as condições em que as informações foram produzidas.
A pergunta “os estudantes gostam da escola?” é ampla e pode produzir respostas pouco precisas. Para torná-la investigável, a equipe poderia perguntar: “qual é o nível de satisfação dos estudantes do Ensino Médio com os espaços de convivência da escola, em uma escala de 1 a 5?”.
A nova formulação identifica o grupo estudado, a característica observada e uma forma possível de registro.
2. População, censo, amostra e unidade estatística
A população estatística é o conjunto completo de elementos sobre os quais se deseja obter informações. Esses elementos podem ser pessoas, objetos, empresas, escolas, atendimentos, produtos ou acontecimentos.
Cada elemento da população é chamado de unidade estatística. Quando os dados são coletados de todos os elementos da população, realiza-se um censo. Quando apenas uma parte da população é investigada, essa parte recebe o nome de amostra.
| Conceito | Significado | Exemplo em uma pesquisa escolar |
|---|---|---|
| População | Todos os elementos de interesse da investigação. | Os 1.240 estudantes matriculados na escola. |
| Unidade estatística | Cada elemento individual da população. | Cada estudante matriculado. |
| Censo | Coleta realizada com toda a população. | Entrevistar os 1.240 estudantes. |
| Amostra | Parte da população selecionada para o estudo. | Entrevistar 160 estudantes selecionados. |
Por que utilizar uma amostra?
Um censo pode exigir muito tempo, dinheiro e equipe. Em algumas situações, também é inviável examinar todos os elementos. Para verificar a durabilidade de lâmpadas, por exemplo, o teste pode inutilizar os produtos. Uma amostra bem escolhida torna a pesquisa mais rápida e econômica.
Entretanto, a amostra precisa representar adequadamente a população. Se uma escola quiser conhecer a opinião de todos os estudantes, mas entrevistar somente integrantes de uma única turma, o resultado poderá refletir as características daquela turma, e não as da escola inteira.
Uma universidade possui 8.500 estudantes e deseja estimar o principal meio de transporte utilizado para chegar ao campus. Foram selecionados 600 estudantes de diferentes cursos, turnos e períodos.
População: os 8.500 estudantes da universidade.
Amostra: os 600 estudantes selecionados.
Unidade estatística: cada estudante.
Variável investigada: principal meio de transporte utilizado.
3. Variáveis estatísticas
Uma variável estatística é uma característica observada em cada unidade da população ou da amostra. Em uma pesquisa com estudantes, podem ser registradas variáveis como turno, idade, altura, quantidade de livros lidos e nível de satisfação.
As variáveis são classificadas inicialmente em qualitativas ou quantitativas. Cada grupo possui dois subtipos.
Não possui ordem natural.
Possui uma ordem natural.
Resulta de uma contagem.
Resulta de uma medição.
Variáveis qualitativas
As variáveis qualitativas registram categorias. Uma variável é qualitativa nominal quando suas categorias não apresentam uma ordenação natural. Exemplos: tipo sanguíneo, bairro de residência e meio de transporte.
Uma variável é qualitativa ordinal quando suas categorias podem ser organizadas segundo uma ordem. Exemplos: nível de satisfação — insatisfeito, indiferente, satisfeito — e grau de escolaridade.
Variáveis quantitativas
As variáveis quantitativas são registradas numericamente. Uma variável é quantitativa discreta quando resulta de uma contagem e assume valores isolados, geralmente números inteiros. Exemplos: número de irmãos, quantidade de faltas e número de livros emprestados.
Uma variável é quantitativa contínua quando resulta de uma medição e pode assumir qualquer valor dentro de um intervalo, de acordo com a precisão do instrumento. Exemplos: altura, massa, temperatura e tempo.
| Variável | Possíveis valores | Classificação | Justificativa |
|---|---|---|---|
| Tipo de conexão com a internet | Fibra, cabo, rádio, dados móveis | Qualitativa nominal | As categorias não possuem ordem natural. |
| Avaliação de um serviço | Ruim, regular, bom, excelente | Qualitativa ordinal | As categorias podem ser ordenadas. |
| Número de moradores da residência | 1, 2, 3, 4, ... | Quantitativa discreta | O valor é obtido por contagem. |
| Consumo mensal de água | Valores medidos em m³ | Quantitativa contínua | O valor é obtido por medição. |
Pratique 1 — População, amostra e variáveis
Ver respostas detalhadas
4. Coleta de dados
A coleta de dados deve ser planejada de acordo com a pergunta da pesquisa. Antes de elaborar um questionário ou realizar medições, é necessário definir quais informações serão realmente úteis, quem poderá fornecê-las e como serão registradas.
O que se deseja compreender?
Quem será investigado?
Quais dados serão necessários?
Como os dados serão obtidos?
Dados primários e dados secundários
Dados primários
São coletados diretamente pelos responsáveis pela pesquisa para atender ao objetivo específico da investigação.
Exemplos: respostas de questionários, entrevistas, observações e medições realizadas pela equipe.
Dados secundários
Já foram coletados anteriormente por outras pessoas ou instituições e são reutilizados em uma nova análise.
Exemplos: dados do IBGE, registros escolares, relatórios públicos e bancos de dados.
Principais técnicas e instrumentos
| Técnica | Como ocorre | Possível aplicação |
|---|---|---|
| Questionário | Os participantes respondem a um conjunto padronizado de perguntas. | Investigar hábitos de leitura de muitos estudantes. |
| Entrevista | O pesquisador conduz perguntas e pode solicitar esclarecimentos. | Compreender experiências e opiniões com maior profundidade. |
| Observação | Comportamentos ou acontecimentos são registrados segundo critérios definidos. | Contar veículos que passam por uma avenida. |
| Medição | Um instrumento é utilizado para determinar valores de uma grandeza. | Registrar temperatura, altura, massa ou tempo. |
| Consulta documental | Informações são obtidas em registros e bases já existentes. | Analisar matrículas, frequência escolar ou indicadores demográficos. |
Como formular perguntas adequadas?
Uma pergunta de pesquisa deve ser clara, objetiva e neutra. Ela não deve induzir uma resposta nem reunir duas questões diferentes em uma única frase.
Formulação inadequada: “Você concorda que a excelente biblioteca da escola deveria permanecer aberta por mais tempo?”
A palavra “excelente” apresenta uma avaliação positiva e pode influenciar o participante.
Formulação mais adequada: “Você considera necessário ampliar o horário de funcionamento da biblioteca?”
Formulação inadequada: “Você considera o laboratório confortável e bem equipado?”
Uma pessoa pode considerar o espaço confortável, mas não bem equipado. Nesse caso, uma única resposta não representará sua opinião.
Melhoria: apresentar uma pergunta sobre conforto e outra sobre os equipamentos.
- o objetivo da pesquisa está claramente definido;
- a população e a amostra foram identificadas;
- as variáveis são relevantes para o problema;
- as perguntas não induzem respostas;
- as alternativas cobrem as respostas possíveis;
- a privacidade dos participantes será preservada;
- o modo de registro será igual para todos.
5. Organização inicial dos dados
Após a coleta, os dados aparecem geralmente na ordem em que foram registrados. Esse conjunto inicial é chamado de dados brutos. Para facilitar a análise, os valores podem ser organizados em ordem crescente ou decrescente, formando um rol.
Quantidade de livros lidos por dez estudantes durante um semestre:
Ordenando os valores:
O rol facilita a identificação do menor e do maior valor, das repetições e da posição ocupada por cada observação.
Codificação e tratamento dos registros
Em pesquisas extensas, as respostas podem ser codificadas para agilizar o registro. Entretanto, a equipe deve manter um documento que explique o significado de cada código. Também é necessário verificar respostas ausentes, duplicidades, erros de digitação e unidades de medida diferentes.
Pratique 2 — Coleta e organização de dados
Ver respostas detalhadas
6. Tabelas e distribuições de frequência
Quando uma variável apresenta valores repetidos, uma tabela de distribuição de frequência permite resumir os dados. Cada valor ou categoria é acompanhado da quantidade de vezes em que aparece.
Frequência absoluta
A frequência absoluta, indicada por \(f_i\), corresponde ao número de observações de determinado valor ou categoria. A soma de todas as frequências absolutas deve ser igual ao número total de observações.
Frequência relativa e percentual
A frequência relativa, indicada por \(f_{ri}\), compara a frequência absoluta de uma categoria com o total de observações.
A soma das frequências relativas é igual a 1, podendo haver pequena diferença por arredondamento. Em porcentagem, a soma deve resultar em 100%.
Frequência acumulada
A frequência acumulada é obtida somando as frequências até determinado valor ou classe. Ela é especialmente útil quando a variável possui ordem, pois permite responder a perguntas como “quantos estudantes gastam até 20 minutos?” ou “qual percentual apresentou resultado inferior a determinado limite?”.
Vinte estudantes informaram o tempo, em minutos, utilizado no deslocamento até a escola. Após a organização, foram obtidos os valores 10, 15, 20, 25, 30 e 35 minutos.
| Tempo (min) | Frequência absoluta \(f_i\) | Frequência relativa | Percentual | Frequência acumulada |
|---|---|---|---|---|
| 10 | 2 | 0,10 | 10% | 2 |
| 15 | 4 | 0,20 | 20% | 6 |
| 20 | 6 | 0,30 | 30% | 12 |
| 25 | 4 | 0,20 | 20% | 16 |
| 30 | 3 | 0,15 | 15% | 19 |
| 35 | 1 | 0,05 | 5% | 20 |
| Total | 20 | 1,00 | 100% | — |
Na linha correspondente a 20 minutos, a frequência acumulada é 12. Isso significa que 12 estudantes gastam até 20 minutos no deslocamento. Como \(12/20=0{,}60\), esse grupo representa 60% dos estudantes pesquisados.
7. Distribuições de frequência com intervalos de classe
Quando uma variável quantitativa assume muitos valores diferentes, apresentar uma linha para cada valor pode tornar a tabela extensa. Nesse caso, os dados podem ser agrupados em intervalos de classe.
As alturas foram agrupadas em intervalos de 0,10 m.
| Altura, em metros | Frequência absoluta | Percentual | Frequência acumulada |
|---|---|---|---|
| 1,50 ≤ h < 1,60 | 6 | 15% | 6 |
| 1,60 ≤ h < 1,70 | 14 | 35% | 20 |
| 1,70 ≤ h < 1,80 | 13 | 32,5% | 33 |
| 1,80 ≤ h < 1,90 | 7 | 17,5% | 40 |
| Total | 40 | 100% | — |
O intervalo \(1{,}60\leq h<1{,}70\) inclui a altura 1,60 m, mas não inclui 1,70 m. Assim, uma observação que vale exatamente 1,70 m pertence à classe seguinte. Essa convenção evita que um mesmo valor seja contado em duas classes.
Amplitude de classe
A amplitude de uma classe é a diferença entre seu limite superior e seu limite inferior. No exemplo anterior, cada classe possui amplitude de 0,10 m.
8. Como construir uma tabela de frequência
Verificar registros, unidades e dados ausentes.
Construir um rol quando necessário.
Determinar as frequências absolutas.
Obter frequências relativas e acumuladas.
Uma tabela deve apresentar título, identificação clara das variáveis, unidades de medida, totais e, quando os dados vierem de outra instituição, a fonte. Casas decimais e critérios de arredondamento devem permanecer consistentes.
Pratique 3 — Tabelas e distribuições de frequência
Ver respostas detalhadas
9. Síntese da aprendizagem
| Etapa | Pergunta principal | Conceitos envolvidos |
|---|---|---|
| Delimitação | O que queremos investigar e sobre quem? | Problema, objetivo e população. |
| Seleção | Todos serão investigados ou apenas uma parte? | Censo, amostra e representatividade. |
| Definição | Quais características serão observadas? | Variáveis qualitativas e quantitativas. |
| Coleta | Como as informações serão obtidas? | Questionário, entrevista, observação, medição e registros. |
| Organização | Como resumir os dados sem perder seu significado? | Rol, tabelas e frequências absoluta, relativa e acumulada. |
Esses conceitos formam a base de toda investigação estatística. Nas próximas postagens, veremos como representar os dados por gráficos, analisar criticamente informações e calcular medidas que resumem uma distribuição.