¿Cómo funciona la estadística? (explicado por un experto en Matemáticas)
La estadística es el conjunto de métodos que usamos para recolectar datos, organizarlos, resumirlos y sacar conclusiones sobre un fenómeno, aun cuando esos datos tengan variabilidad (ruido), sean incompletos o provengan de muestras.
En términos simples: la estadística responde preguntas como:
- “¿Qué tan frecuente es algo?”
- “¿Cuál es el valor típico?”
- “¿Qué tanto varían los resultados?”
- “¿Se debe a la casualidad o hay un efecto real?”
Explicación paso a paso
Vamos de lo más básico a lo más “formal”:
1) Definir el objetivo (la pregunta)
Antes de calcular nada, la estadística exige claridad:
- ¿Queremos estimar un promedio?
- ¿Comparar dos grupos?
- ¿Ver relación entre variables?
- ¿Probar una hipótesis?
Esto determina qué técnica usarás después.
2) Elegir una población y tomar datos (muestra)
- Población: todo el conjunto de interés (por ejemplo, “todos los estudiantes”).
- Muestra: un subconjunto (por ejemplo, “500 estudiantes que encuestamos”).
Clave: casi nunca podemos medir a toda la población, por eso trabajamos con muestras y luego “generalizamos” con cautela.
3) Clasificar el tipo de dato
Los datos pueden ser:
- Cualitativos (categorías): color de ojos, tipo de producto, etc.
- Cuantitativos:
- Discretos (conteos): número de fallas
- Continuos (mediciones): altura, peso
Esto importa porque cambia cómo se resumen y qué pruebas son válidas.
4) Resumir los datos (estadística descriptiva)
Aquí la idea es “poner orden”:
a) Medidas de tendencia central
- Media (promedio): la “balanza” del conjunto.
- Mediana: el “valor del centro” cuando ordenas.
- Moda: el valor más repetido.
b) Medidas de dispersión (variabilidad)
- Rango: máximo - mínimo
- Varianza y desviación estándar: cuánta “dispersión” hay alrededor del centro.
Esto responde: “¿Los datos están concentrados o muy repartidos?”
c) Gráficos
Histogramas, boxplots, diagramas de barras… ayudan a ver forma, asimetría, valores atípicos, etc.
5) Entender la variabilidad con probabilidad
Aunque tengamos un conjunto observado, la estadística usa probabilidad para modelar el azar:
- Si repitiésemos el experimento muchas veces, los resultados variarían.
- La probabilidad nos dice qué variaciones son “razonables” y cuáles no.
6) Inferencia: pasar de muestra a población (estadística inferencial)
Aquí entran dos ideas centrales:
a) Estimación (estimar parámetros)
Por ejemplo, estimar la media poblacional
Lo típico incluye:
- Un intervalo de confianza (rango plausible para el parámetro).
- Una medida de incertidumbre (por ejemplo, error estándar).
b) Prueba de hipótesis (decidir si algo parece real)
Ejemplo: “¿El nuevo medicamento reduce la presión?”
Pasos generales:
- Planteas una hipótesis nula
: “no hay efecto” (o el efecto es 0). - Planteas una hipótesis alternativa
: “sí hay efecto”. - Calculas una estadística de prueba (un número que mide qué tan raro sería observar esos datos si
fuera cierto). - Usas un valor p o un umbral para decidir.
No es una “verdad automática”, sino una evaluación basada en el modelo probabilístico.
7) Modelos y relación entre variables
Cuando hay varias variables, se usa:
- Correlación: relación lineal (no implica causalidad).
- Regresión: modela cómo cambia una variable al variar otra(s).
- Modelos más complejos: si el patrón no es lineal o si hay categorías, conteos, etc.
8) Interpretación y verificación
Un informe estadístico serio termina con:
- supuestos del método (normalidad, independencia, tamaño muestral, etc.),
- calidad del dato,
- posibles sesgos (muestreo, medición, confusión),
- y la interpretación correcta del resultado.
Analogía
Imagina que eres un arquitecto y vas a estimar el “estado real” de una ciudad construida por muchas cuadras.
- La población es toda la ciudad.
- La muestra son unas cuantas cuadras que inspeccionas.
- La estadística descriptiva es como decir: “En las cuadras inspeccionadas, el promedio de altura de los edificios es X y la variación es Y”.
- La estadística inferencial es como afirmar: “Con cierta confianza, estimamos que en toda la ciudad el promedio es cercano a X, y el rango probable es…”.
- Las pruebas de hipótesis son como decidir: “¿Es razonable pensar que la ciudad cambió por una nueva política de construcción o podría ser solo variación normal?”
Así, no “ves” toda la ciudad, pero usas lógica matemática y probabilidad para concluir de manera controlada.
Tres ideas erróneas comunes
“Un promedio describe todo.”
Falso: dos conjuntos pueden tener la misma media y distribuciones totalmente distintas (por ejemplo, uno muy disperso y otro muy concentrado). Por eso importan también dispersión y forma.“Correlación significa causalidad.”
Que dos variables se muevan juntas no prueba que una cause la otra. Puede haber una tercera variable (confusión) o una relación espuria.“El valor p (o un resultado estadístico) confirma la verdad absoluta.”
No. Un valor p informa sobre la compatibilidad de los datos con una hipótesis bajo un modelo. No “prueba” una verdad universal; cuantifica evidencia en un marco probabilístico.