Índice de contenido
Capítulo 10
La distribución t
En este capítulo
Características de la distribución tRelación entre la distribución Z y la distribución tComprender y utilizar la tabla tLa distribución t es uno de los pilares del análisis de datos. A lo mejor has oído hablar de la prueba t, por ejemplo, que se utiliza a menudo para comparar dos grupos en estudios médicos y experimentos científicos. En este breve capítulo comento las principales características y aplicaciones de la distribución t. Explico la relación existente con la distribución normal (más información en el capítulo 9) y cómo utilizar la tabla t para encontrar probabilidades y percentiles.
Aspectos básicos de la distribución t
Este apartado ofrece una visión general de la distribución t, sus características principales, cuándo se utiliza y cuál es su relación con la distribución Z (ver el capítulo 9).
Comparación entre la distribución t y la distribución Z
La distribución normal es aquella que tiene la consabida forma de campana, con media μ y desviación estándar σ (encontrarás más información sobre la distribución normal en el capítulo 9). La distribución normal más frecuente es la normal estándar, también llamada distribución Z, en la que la media es 0 y la desviación estándar es 1.
La distribución t es similar a la distribución normal estándar. Ambas están centradas en el cero y tienen forma de campana, pero en comparación con la distribución Z, la t es más corta y más plana, y su desviación estándar es proporcionalmente mayor, razón por la cual las colas de ambos lados son más gruesas.
La figura 10-1 muestra una comparación entre la distribución t y la distribución Z en sus formas más genéricas.
La distribución t generalmente se utiliza para estudiar la media de una población, no para estudiar los elementos de una población, En particular, se recurre a ella en muchos casos cuando se utilizan datos para estimar la media poblacional, por ejemplo para estimar el precio medio de todas las viviendas de nueva construcción en California. O también cuando se utilizan datos para verificar una afirmación referida a la media poblacional; por ejemplo, ¿es cierto que las viviendas de nueva construcción en California tienen un precio medio de 500.000 dólares?
Estos procedimientos se denominan intervalos de confianza y contrastes de hipótesis, y se tratan en los capítulos 13 y 14, respectivamente.
La relación entre la distribución normal y la distribución t es que la distribución t se utiliza a menudo para analizar la media de una población cuando dicha población tiene una distribución normal (o casi normal). Adquiere especial relevancia cuando el conjunto de datos es pequeño o cuando se desconoce la desviación estándar de la población (cosa que ocurre con frecuencia).
Cuando los estadísticos utilizan el término “distribución t”, no se refieren a una única distribución. Existe una familia entera de distribuciones t específicas, en función del tamaño de muestra que se esté utilizando para estudiar la media poblacional. Cada distribución t se caracteriza por lo
que los estadísticos han dado en denominar “grados de libertad”. Cuando tienes una población y el tamaño de muestra es n, los grados de libertad para la distribución t correspondiente son n–1. Por ejemplo, un tamaño muestral de 10 utiliza una distribución t con 10–1 (es decir, nueve) grados de libertad, lo cual se designa como t 9 (leído “te subnueve”). Cuando hay dos poblaciones se utilizan otros grados de libertad (se habla de ello en el capítulo 15).
Efecto de la variabilidad en las distribuciones t
Las distribuciones t basadas en tamaños muestrales pequeños tienen una desviación estándar mayor que las basadas en tamaños muestrales grandes. Su forma es más plana y sus valores están más dispersos. La razón es que los resultados basados en conjuntos de datos pequeños son más variables que los basados en conjuntos de datos grandes.
Cuanto más grande sea el tamaño muestral, mayor será el número de grados de libertad y más se parecerán las distribuciones t a la distribución normal estándar (distribución Z). Un punto de corte aproximado donde la distribución t y la distribución Z son similares es alrededor de n=30.
La figura 10-2 muestra el aspecto de varias distribuciones t con diferentes tamaños muestrales, comparados con la distribución normal estándar (distribución Z).
Uso de la tabla t
Cada distribución normal tiene su propia media y desviación estándar que la caracterizan, de manera que buscar probabilidades para cada distribución normal no es un camino viable. Por suerte, puedes normalizar los valores de cualquier distribución normal y convertirlos en valores de una distribución normal estándar (distribución Z, cuya media es 0 y cuya desviación estándar es 1), y luego utilizar una tabla Z (incluida en el apéndice) para encontrar probabilidades. (En el capítulo hallarás más información sobre las distribuciones normales.)
Una distribución t, en cambio, no está caracterizada por su media y su desviación estándar, sino por el tamaño muestral del conjunto de datos utilizado (n). Por desgracia, no existe una única distribución t estándar que puedas utilizar para transformar los números y encontrar probabilidades en una tabla. Como no sería humanamente posible crear una tabla de probabilidades y valores t correspondientes para todas las distribuciones t posibles, los estadísticos crearon una tabla que muestra ciertos valores de distribuciones t para algunos grados de libertad y algunas probabilidades. Esta tabla se llama tabla t y la hallarás en el apéndice. En este apartado te explico cómo encontrar probabilidades, percentiles y valores críticos (para intervalos de confianza) utilizando la tabla t.
Encontrar probabilidades con la tabla t
Cada fila de la tabla t (incluida en el apéndice) representa una distribución t diferente, caracterizada por sus grados de libertad (gl). Las columnas representan diversas probabilidades comunes del tipo “mayor que”, como por ejemplo 0,40, 0,25, 0,10 y 0,05. Los números dispuestos a lo largo de una fila son los valores de la distribución t (los valores t) correspondientes a las probabilidades “mayor que” indicadas en las cabeceras de las columnas. Las filas están ordenadas por grados de libertad.
Otro término para referirse a una probabilidad del tipo “mayor que” es probabilidad de cola derecha, lo cual indica que estas probabilidades representan áreas situadas en el extremo derecho (cola derecha) de la distribución t.
Por ejemplo, la segunda fila de la tabla t es para la distribución t 2 (dos grados de libertad, leído te sub dos). El segundo número (0,816) es el valor de la distribución t 2 cuya área a la derecha (su probabilidad de cola derecha) es 0,25 (ver la cabecera de la columna 2). Dicho de otro modo, la probabilidad de que t 2 sea mayor que 0,816 es 0,25. En notación probabilística esto es p(t 2 >0,816)=0,25. El siguiente número de la fila dos de la
probabilidad de que 2 sea mayor que 0,816 es 0,25. En notación probabilística esto es 2 >0,816)=0,25. El siguiente número de la fila dos de la tabla t es 1,886, situado en la columna 0,10. Esto significa que la probabilidad de ser mayor que 1,886 en la distribución t 2 es 0,1. Como 1,886 está a la derecha de 0,816, su probabilidad de cola derecha es más baja.
Encontrar percentiles para la distribución t
La tabla t (incluida en el apéndice) también puede utilizarse para encontrar percentiles para una distribución t. Un percentil es un número de una distribución cuya probabilidad “menor que” es el porcentaje dado; por ejemplo, el percentil 95 de la distribución t con n–1 grados de libertad es el valor de tn-1 cuya probabilidad de cola izquierda (probabilidad “menor que”) es 0,95 (y cuya probabilidad de cola derecha es 0,05). (Encontrarás más información sobre percentiles en el capítulo 5.)
Imagina que tienes una muestra de tamaño 10 y quieres encontrar el percentil 95 de la distribución t correspondiente. Tienes n–1 = 9 grados de libertad, así que buscas en la fila para gl = 9. El percentil 95 es el número por debajo del cual están el 95% de los valores y por encima del cual están el 5% de los valores, de manera que quieres que el área de la cola derecha sea 0,05. Avanzas por la fila hasta llegar a la columna correspondiente a 0,05 y encuentras que t 9 =1,833. Éste es el percentil 95 de la distribución t que tiene 9 grados de libertad.
Al aumentar el tamaño muestral hasta n=20, el valor del percentil 95 disminuye; si miras en la fila correspondiente a 20–1=19 grados de libertad y en la columna 0,05 (una probabilidad de cola derecha igual a 0,05), verás que t 19 =1,729. Observa que el percentil 95 para la distribución t 19 es más pequeño que el percentil 95 para la distribución t 9 (1,833). La razón es que un número más alto de grados de libertad indica una desviación estándar más pequeña, de manera que los valores t están más concentrados en torno a la media y entonces alcanzas el percentil 95 con un valor de t más pequeño. (Ver el apartado “Efecto de la variabilidad en las distribuciones t” en este mismo capítulo.)
Escoger valores t* para intervalos de confianza
Los intervalos de confianza estiman parámetros de una población, como la media poblacional, utilizando un estadístico (por ejemplo la media muestral) más/menos un margen de error. (En el capítulo 13 encontrarás toda la información que necesitas, y algo más, sobre los intervalos de confianza.) Para calcular el margen de error de un intervalo de confianza, necesitas un valor crítico (el número de errores estándares que sumas y restas para obtener el margen de error que quieres; ver el capítulo 13). Si el tamaño muestral es grande (por lo menos 30), utilizas valores críticos de la distribución Z (ver el capítulo 13) para construir el margen de error. Si el tamaño muestral es pequeño (menos que 30) o desconoces la desviación estándar de la población, utilizas la distribución t para encontrar valores críticos.
Para que te resulte más fácil encontrar valores para la distribución t, puedes utilizar la última fila de la tabla t, donde están los niveles de confianza más habituales, por ejemplo 80, 90 y 95%. Para encontrar un valor crítico, busca tu nivel de confianza en la fila de abajo del todo de la tabla; así sabrás qué columna de la tabla t necesitas. Busca la intersección entre esa columna y la fila correspondiente a tu número de grados de libertad. (En el capítulo 13 encontrarás fórmulas para los grados de libertad.) El número hallado es el valor crítico (o valor t) para tu intervalo de confianza. Por ejemplo, si quieres un valor t para un intervalo de confianza del 90% cuando tienes 9 grados de libertad, vas al final de la tabla, localizas la columna del 90% y buscas la intersección con la fila correspondiente a gl=9. El resultado es un valor t* de 1,833 (redondeado).
La primera fila de la tabla t muestra probabilidades de cola derecha para la distribución t. Sin embargo, los intervalos de confianza requieren probabilidades de cola izquierda y probabilidades de cola derecha (porque sumas y restas el margen de error). Por tanto, a cada cola le corresponde la mitad de la probabilidad que queda después de restar el intervalo de confianza. Es importante que tengas esto en cuenta. Por ejemplo, un valor t* para un intervalo de confianza del 90% tiene una probabilidad “mayor que” del 5% y una probabilidad “menor que” del 5% (coges el 100% menos el 90% y divides por 2). En la primera fila de la tabla t tendrías que buscar por 0,05 (en lugar de buscar el 10%, como quizá podrías verte inclinado a hacer), pero en la última fila de la tabla sencillamente buscas el 90% (el resultado obtenido con cualquiera de ambos métodos acaba estando en la misma columna).
Cuando busques valores t* para intervalos de confianza, utiliza como guía la última fila de la tabla t, no las cabeceras de la parte de arriba de la tabla.
Estudiar comportamientos con la tabla t
Existen aplicaciones informáticas para calcular todas las probabilidades, percentiles o valores críticos que puedas necesitar para cualquier distribución t (o cualquier otra distribución), pero es probable que en los exámenes no puedas utilizarlas. De todos modos, una de las mayores ventajas de utilizar una tabla para encontrar probabilidades (en lugar de utilizar una aplicación informática) es que la tabla puede darte información sobre el comportamiento de la propia distribución, es decir, puede darte una perspectiva más amplia. A continuación comento algunas de las cosas que puedes averiguar sobre la distribución t analizando la tabla t (incluida en el apéndice).
En la figura 10-2 puedes ver que, a medida que los grados de libertad aumentan, los valores de cada distribución t se concentran más y más en torno a la media, hasta llegar a parecerse mucho a la distribución Z. La tabla t también confirma esta pauta. Debido a la forma en que está configurada la tabla t, si eliges una columna cualquiera y la recorres en sentido descendente, verás que los grados de libertad (y el tamaño muestral) aumentan y la probabilidad de cola derecha permanece igual. Simultáneamente los valores t se hacen cada vez más pequeños, lo cual
indica que están cada vez más cerca de la media (y, por tanto, más concentrados en torno a la media).
La penúltima fila de la tabla t está etiquetada con una z en la columna gl. Esto indica el “límite” de los valores t cuando el tamaño muestral (n) se hace infinito. Los valores t de esta fila son aproximadamente iguales que los valores z de la tabla Z (incluida en el apéndice) correspondientes a las mismas probabilidades “mayor que”. Esto confirma lo que ya sabes: a medida que el tamaño muestral aumenta, la distribución t y la distribución Z son cada vez más parecidas. Por ejemplo, en la fila 30 de la tabla t, el valor t que corresponde a una probabilidad de cola derecha igual a 0,05 (columna 0,05) es 1,697. Este valor está muy cerca de z=1,645, el valor correspondiente a un área de cola derecha igual a 0,05 en la distribución Z (mira en la fila Z de la tabla t).
No hace falta un tamaño muestral enorme para que los valores de la distribución t se aproximen a los valores de una distribución Z. Por ejemplo, cuando n=31 y gl=30, los valores de la tabla t ya están muy cerca de los valores correspondientes de la tabla Z.
Artículos relacionados
Graficar datos del Banco de México con R
El paquete ‘siebanxicor’ proporciona series de datos de consulta del Banco de México. En otras palabras, permite recuperar series temporales de todos los indicadores disponibles en el …
Leer másLa estadística en pocas palabras
Descubrir en qué consisten los procesos estadísticos. Aprovechar laestadística para triunfar en la vida cotidiana,en el terreno profesional y en los estudios.
Leer másDominar el análisis de negocios
¿Cuánto te costó realmente tu última compra? Este artículo introduce el concepto de costo de oportunidad — el valor de todos los recursos empleados, no solo el precio pagado — con ejemplos cotidianos …
Leer más

