domingo, 23 de junio de 2019

PRUEBA T DE STUDENT : CASO I


CASO 1: Diferencia de medias para una población (T de student, muestras pequeñas)
El Test de la t de Student para una muestra permite comprobar si es posible aceptar que la media de la población es un valor determinado. Se toma una muestra y el Test permite evaluar si es razonable mantener la Hipótesis nula de que la media es tal valor.
Se trata de un Test paramétrico; o sea, parte de la suposición de que la variable analizada en el conjunto de la población sigue una variabilidad, una distribución como la de la campana de Gauss. Por lo tanto, podemos pensar que la distribución normal es un buen modelo de esa población.
Puede observarse que se construye un estadístico que sigue la distribución t de Student si es cierta la Hipótesis nula. Por lo tanto, como siempre, el cálculo del estadístico a la muestra que tenemos es un número.
Un número que pondremos en relación con la distribución del estadístico en caso de ser cierta la Hipótesis nula. Si cae en una zona central de esa distribución de probabilidad 0.95 (el 95%, porcentualmente) mantendremos la Hipótesis nula. Si cae fuera de esa zona, la rechazaremos y nos descartamos por la alternativa. Este es el proceder de siempre en Estadística.




Nota: Se considera práctico utilizar la distribución t solamente cuando se requiera que el tamaño de la muestra sea menor de 30, ya que para muestras más grandes los valores t y z son aproximadamente iguales, y es posible emplear la distribución normal en lugar de la distribución t.









EJERCICIO RESUELTO

Las duraciones medias de lámparas producidas por una compañía han sido en el pasado de 1120 horas. Una muestra de 8 lámparas de la producción actual dio una duración media de 1070 horas con una desviación típica de 125 horas.

















GRÁFICO

EJERCICIO PROPUESTO




  • En una prueba de aptitud la puntuación media de los estudiantes es de 72 puntos y la desviación estándar es de 8 puntos. ¿Cuál es la probabilidad de que dos grupos de estudiantes, formados de 28 y 36 estudiantes, respectivamente, difieran en su puntuación media en:

    1. 3 ó más puntos.
    2. 6 o más puntos.
    3. Entre 2 y 5 puntos.
    REFERENCIAS

    Biplot.usal.es. (2019). [online] Available at: http://biplot.usal.es/problemas/libro/5%20Contrastes.pdf [Accessed 15 Jun. 2019].
    Estadistica.net. (2019). [online] Available at: http://www.estadistica.net/Algoritmos2/guia-pvalor.pdf [Accessed 15 Jun. 2019].
    https://estadisticaorquestainstrumento.wordpress.com/2012/12/16/test-de-la-t-de-student-para-una-muestra/



    PRUEBA T DE STUDENT: CASO II


    CASO 2: DIFERENCIA DE MEDIAS PARA DOS POBLACIONES
     (T de student, muestras pequeñas)
    Se lo utiliza para el análisis de prueba de hipótesis en donde intervienen muestras < 30. Y se establece el lineamiento de la T de student, utilizando la varianza como diferenciación de la prueba Z. Una prueba de 2 muestras se puede utilizar para comparar si las medias de dos grupos independientes son diferentes. Esta prueba se deriva bajo el supuesto de que ambas poblaciones están normalmente distribuidas y poseen varianzas iguales. Si bien el supuesto de normalidad no es crítico (Pearson, 1931; Barlett, 1935; Geary, 1947), el supuesto de varianzas iguales es crítico si los tamaños de las muestras son notablemente diferentes (Welch, 1937; Horsnell, 1953).
    Algunos profesionales primero realizan una prueba preliminar para evaluar varianzas iguales antes de realizar el clásico procedimiento t de 2 muestras. Sin embargo, este enfoque presenta serias desventajas debido a que estas pruebas de varianzas están sujetas a supuestos y limitaciones importantes. Por ejemplo, numerosas pruebas de varianzas iguales, como la clásica prueba F, son sensibles a desviaciones con respecto a la normalidad.
    Otras pruebas que no se basan en el supuesto de normalidad, como la de Levene/Brown-Forsythe, tienen poca potencia para detectar una diferencia entre varianzas. B.L. Welch desarrolló un método de aproximación para comparar las medias de dos poblaciones normales independientes cuando las varianzas no son necesariamente iguales (Welch, 1947).
    Debido a que la prueba t modificada de Welch no se deriva bajo el supuesto de varianzas iguales, los usuarios pueden comparar las medias de dos poblaciones sin primero tener que determinar la existencia de varianzas iguales.
    EJERCICIO RESUELTO
    La resistencia a la rotura de un componente eléctrico constituye una característica importante de un cierto proceso. Un fabricante utiliza un material nuevo de fabricación frente al material clásico.
    Se recoge una muestra de 10 elementos usando el primer componente y otra de 10 elementos usando el segundo componente. Se pueden considerar a los dos procesos como dos tratamientos o dos niveles diferentes de un factor dado.



    Se tiene que la media muestral del componente nuevo es y¯1 = 16,76 y la del componente antiguo es y¯2 = 17,92.
    Se pretende averiguar si existen diferencias significativas entre ambos tratamientos a nivel de resistencia. En este caso, se considera que los datos proceden de una más de una distribución normal, y que el diseño es completamente aleatorizado.
    El contraste de hipótesis que se tiene que realizar es bilateral:
    Fijamos α = P {error tipo I} = P {Rechazar H0|H0 siendo cierta} Suponiendo normalidad y suponiendo que σ2 = σ2, se utiliza el estadístico siguiente:

    Se compara el valor de este estadístico con el valor de una distribución t de Student.


    EJERCICIO PROPUESTO



    REFERENCIAS


    Biplot.usal.es. (2019). [online] Available at: http://biplot.usal.es/problemas/libro/5%20Contrastes.pdf [Accessed 15 Jun. 2019].
    Estadistica.net. (2019). [online] Available at: http://www.estadistica.net/Algoritmos2/guia-pvalor.pdf [Accessed 15 Jun. 2019].

    PRUEBA T DE STUDENT: CASO III


    CASO 3: PRUEBA DE HIPOTESIS PARA PROPORCIONES T DE STUDENT

    Si se consideran las proporciones como medias y se aplica la prueba t utilizada para comparar medias poblacionales los resultados no son fiables ya que la estimación del error típico que realiza el programa no coincide con la del estadístico de prueba.
    Harry Hutchings es propietario de un gimnasio y afirma que la ingestión de ciertas vitaminas aumente la fuerza corporal. Se seleccionan aleatoriamente 10 estudiantes atletas y se les aplica una prueba de fuerza muscular. Después de dos semanas de tomar las vitaminas y de entrenamiento se les aplica nuevamente la prueba. Los resultados se muestran a continuación:

    Nivel del significancia: 0,01

    Cálculo del valor estadístico de prueba:



    Regla de la decisión: alfa 0.01
    Gl: 10-1= 9


    Decisión: como t es 0.07 y es menor que 2,821 aceptamos la hipótesis nula y concluimos que no existió reducción en la fuerza muscular de los atletas.


    EJERCICIO PROPUESTO
    El expendio Pollos Deliciosos asegura que 90% de sus órdenes se entregan en menos de 10 minutos. En una muestra de 25 órdenes, 10 se entregaron dentro de ese lapso. Puede concluirse en el nivel de significancia 0,01, que menos de 90% de las órdenes se entregan en menos de 10 minutos?

    PRUEBA T DE STUDENT : CASO IV



    CASO 4: PRUEBA DE HIPÓTESIS PARA LA DIFERENCIA DE PROPORCIONES

    En ocasiones deseamos saber si dados dos muestras derivadas de poblaciones diferentes o iguales, presentan diferencias significativas en sus parámetros o no presentan alguna diferencia dada una variable dada, en este caso, el parámetro seleccionado viene dado por la proporción entre cada una de las poblaciones. 


    Una vez obtenidos cada uno de los parámetros anteriormente definidos, queda definir el estadístico que se contrastara con los resultados generados en la prueba de hipótesis de las dos muestras.

    EJERCICIO RESUELTO


    Supongamos que se desea comparar el efecto de dos dietas. Es decir, queremos saber si el cambio de peso (kg. adelgazados) de distintas personas obesas, que han seguido o bien la dieta 1 o bien la dieta 2, depende de la dieta seguida por cada uno.




    Si nos fijamos en los datos de la figura, tenemos dos variables:
    §  Variable cuantitativa: pérdida o reducción de peso
    §  Variable cualitativa dicotómica: la dieta (dos grupos: dieta 1 y dieta 2)

    Nuestro objetivo es comparar la media de los kilogramos adelgazados por parte de los sujetos que siguieron la dieta 1 con la media de los kilogramos adelgazados por los que siguieron la dieta 2.

    El planteamiento es el siguiente: se toma como hipótesis nula que la media de kilogramos adelgazados con ambas dietas es la misma.
    Así, si denominamos µ a la media de kilogramos adelgazados en cada grupo tendremos:

    H0: μdieta1 = μdieta2 (Ambas dietas tienen igual efecto)
    H1: μdieta1 ≠ μdieta2 (Ambas dietas tienen distinto efecto)

    A partir de estas hipótesis hay que comprobar si la diferencia que existe entre las dos medias es debida a que realmente es más efectiva una dieta que la otra o bien, si las diferencias observadas se podrían explicar simplemente por azar.
    Para resolver el problema aplicamos la expresión de la t de Student para comparar dos medias:
    Podemos ver que la t de Student se obtiene dividiendo el efecto (diferencia en el peso adelgazado en uno y otro grupo) entre un error (en este caso, error estándar de la diferencia de medias) que expresa la variabilidad aleatoria esperada.
    Como en la mayoría de los test estadísticos, todo el secreto está en dividir la diferencia observada por un término de error que estima la variabilidad biológica aleatoria.
    ·         Si la diferencia observada es mucho mayor que la variabilidad biológica aleatoria esperada, entonces el consiente t tendrá un valor grande y diremos que hay diferencias significativas.
    ·         Si la diferencia observada es pequeña en relación a la variabilidad biológica esperada, entonces la t tendrá un valor pequeño y no podremos decir que existen diferencias significativas.
    Como hay 30 individuos en total y se comparan dos grupos, nuestra t tiene 28 grados de libertad (g.l. = 30-2 = 28).
    El valor de t no es significativo, ya que el valor tabulado para un error α=0,05 es superior t28,α/2=0.025=2.0484 al encontrado.
    Luego no se rechaza la hipótesis nula y se concluye que no hay diferencias significativas entre el peso medio perdido con las dos dietas.
    La varianza de la pérdida de peso en el grupo de los que han seguido la dieta 1 es de 85,8 y en los que han seguido la dieta 2 es de 71,1. Ahora tenemos que usar una varianza común llamada varianza ponderada s 2. Para calcularla se hace una media ponderada entre las dos varianzas. Se pondera cada varianza por los grados de libertad (ni-1) de su grupo:

    La desviación estándar ponderada (sp) será:
    Una vez que sabemos cuál es la desviación estándar ponderada, ya podemos calcular el EEDM, mediante la siguiente expresión:

    EJERCICIO PROPUESTO

    Harry Hutchings es propietario de un gimnasio y afirma que la ingestión de ciertas vitaminas aumente la fuerza corporal. Se seleccionan aleatoriamente 10 estudiantes atletas y se les aplica una prueba de fuerza muscular. Después de dos semanas de tomar las vitaminas y de entrenamiento se les aplica nuevamente la prueba. 


    DISTRIBUCION HIPERGEOMETRICA


    HIPERGEOMÉTRICA
    La distribución hipergeométrica es una distribución discreta que modela el número de eventos en una muestra de tamaño fijo cuando usted conoce el número total de elementos en la población de la cual proviene la muestra. Cada elemento de la muestra tiene dos resultados posibles (es un evento o un no evento). Las muestras no tienen reemplazo, por lo que cada elemento de la muestra es diferente. Cuando se elige un elemento de la población, no se puede volver a elegir. Por lo tanto, la probabilidad de que un elemento sea seleccionado aumenta con cada ensayo, presuponiendo que aún no haya sido seleccionado.

    Utilice la distribución hipergeométrica para muestras obtenidas de poblaciones relativamente pequeñas, sin reemplazo. Por ejemplo, la distribución hipergeométrica se utiliza en la prueba exacta de Fisher para probar la diferencia entre dos proporciones y en muestreos de aceptación por atributos cuando se toman muestras de un lote aislado de tamaño finito.
    La distribución hipergeométrica se define por 3 parámetros: tamaño de la población, conteo de eventos en la población y tamaño de la muestra.
    FÓRMULA 

    EJERCICIO RESUELTO

    En una urna o recipiente hay un total de N objetos, entre los cuales hay una cantidad a de objetos que son defectuosos, si se seleccionan de esta urna n objetos al azar, y sin reemplazo, ¿cuál es la probabilidad de obtener x objetos defectuosos?
    Solución:
    N = 10 objetos en total
    a = 3 objetos defectuosos
    n = 4 objetos seleccionados en muestra
    x = 2 objetos defectuosos deseados en la muestra

    La pretensión es demostrar que las probabilidades asociadas a cada uno de los resultados no son constantes.

     Luego la probabilidad de obtener 2 objetos defectuosos entre los 4 seleccionados al azar sería:

    EJERCICIO PROPUESTO
    Para evitar que lo descubran en la aduana, un viajero ha colocado 6 tabletas  de narcótico en una botella que contiene 9 píldoras de vitamina que son similares en apariencia. Si el oficial de la aduana selecciona 3 tabletas aleatoriamente para analizarlas,
    a) ¿Cuál es la probabilidad de que el viajero sea arrestado por posesión de narcóticos?,
    b) ¿Cuál es la probabilidad de que no sea arrestado por posesión de narcóticos?.

    REFERENCIAS:

    ¿ QUE SON LAS PRUEBAS PARAMÉTRICAS?


    PRUEBAS PARAMÉTRICAS
    Las pruebas paramétricas son una herramienta estadística que se utiliza para el análisis de los factores de la población. Esta muestra debe cumplir ciertos requisitos como el tamaño, ya que mientras más grande sea, más exacto será el cálculo.
    Este método requiere que se especifique la forma de distribución de la población materna estudiada. Puede tratarse, por ejemplo, de una distribución normal, como ocurre en general cuando se trata de muestras de gran tamaño. En general, estas pruebas sólo pueden aplicarse a variables numéricas.
    Las pruebas paramétricas están basadas en la ley de distribución de la variable que se estudia. A pesar de que existen muchos tipos de leyes de distribución, éstas se basan en las normales, que tiene dos parámetros: la media y la desviación estándar. Lo suficiente para conocer la probabilidad.  
    Referencias: 



    DISTRIBUCIÓN POISSON


    ¿QUÉ ES LA DISTRIBUCIÓN DE POISSON?
    La distribución de Poisson se emplea para describir varios procesos, entre otros la distribución de las llamadas telefónicas que llegan a un conmutador, la demanda de servicios en una institución asistencial por parte de los pacientes, los arribos de los camiones y automóviles a la caseta de cobro y el número de accidentes en un cruce. Los ejemplos citados tienen un elemento en común, pueden ser descritos por una variable aleatoria discreta que asume valores enteros (0,1,2,3,4,5 y así sucesivamente).
    La Distribución de Poisson se llama así en honor a Simeón Dennis Poisson, francés que desarrolló esta distribución basándose en estudios efectuados en la última parte de su vida.
    El número de enfermos que llegan a un consultorio en cierto intervalo de tiempo será de 0,1,2,3,4,5 o algún otro número entero. De manera análoga, si se cuenta el número de automóviles que llegan a una caseta de cobro durante un periodo de diez minutos, el número será entero.
    Fórmula
    Su función de probabilidad viene definida por:

    k puede ser 0 ,1,2,3,4…….. (es lo que me preguntan)
    λ ,es el número medio de resultados en el intervalo dado
    Ejercicio Resuelto
    Si un banco recibe en promedio 6 cheques sin fondo por día, ¿cuáles son las probabilidades de que reciba, a) cuatro cheques sin fondo en un día dado, b) 10 cheques sin fondos en cualquiera de dos días consecutivos?
    a)      x = variable que nos define el número de cheques sin fondo que llegan al banco en un día cualquiera = 0, 1, 2, 3, ....., etc, etc.
    l = 6 cheques sin fondo por día
    e = 2.718
    b)     x= variable que nos define el número de cheques sin fondo que llegan al banco en dos días consecutivos = 0, 1, 2, 3, ......, etc., etc.
    l = 6 x 2 = 12 cheques sin fondo en promedio que llegan al banco en dos días consecutivos
    Nota: l siempre debe de estar en función de x siempre o dicho de otra forma, debe “hablar” de lo mismo que x.

    Ejercicio Propuesto
    Una empresa electrónica observa que el número de componentes que fallan antes de cumplir 100 horas de funcionamiento es una variable aleatoria de Poisson. Si el número promedio de estos fallos es ocho, 1. ¿cuál es la probabilidad de que falle un componente en 25 horas? 2. ¿y de que fallen no más de dos componentes en 50 horas? 3. ¿cuál es la probabilidad de que fallen por lo menos diez en 125 horas?