Análisis Exploratorio de Datos

1 Análisis Exploratorio de DatosCapítulo 2 Análisis Explo...
Author: Juanita Oliva
0 downloads 2 Views

1 Análisis Exploratorio de DatosCapítulo 2 Análisis Exploratorio de Datos II-2001

2 Clasificación/Tipo de DatosCualitativo (Categorías) Nominal  Viña = 1 ; Santiago = 2 ; Temuco = 3 ..etc. Ordinal  Pobre = 1; Aceptable = 2; Bueno = 3; Excelente = 4 Cuantitativo (Números) Intervalo  estatura, viscosidad, distancia, duración...etc Razón  temperatura, peso...etc NOTA: El tipo de Estadísticas que se pueden obtener o calcular depende del tipo de dato que se trate. Por ejemplo promedio, mediana y varianza no tienen sentido con datos categóricos (si con proporciones)

3 Escalas de Medida Clasificación : Nominal, Ordinal, Intervalos y RazónVariables : Discretas y Continuas Categóricas, Cuantitativas Organización :  Frecuencia absoluta  Frecuencia relativa A partir de nivel ordinal :  Frecuencia absoluta acumulada  Frecuencia relativa acumulada j i = 1 j i = 1

4 Tipos de Variables Tanto en la escala intervalar como en la de razón es posible distinguir dos tipos de variables aleatorias: Variables Discretas: una que puede tomar sus valores de un conjunto de puntos aislados (subconjunto de valores en IR) Variables Continuas: una que puede tomar sus valores en un conjunto donde todos sus elementos son puntos de acumulación (un intervalo en IR). Siempre es posible tratar una variable continua como discreta mediante la construcción de “intervalos de clase” representando cada uno de los intervalos por su valor medio denominado “marca de clase” Variables Categóricas o Cualitativas Variables Cuantitativas

5 Organización/PresentaciónPara estudiar las características de una variable se ordenan los valores observados de la muestra en k clases denominadas c1, c2, .. ck. Frecuencia Absoluta. Se llama frecuencia absoluta de la clase ci al número total de individuos u observaciones que pertenece a dicha clase y se denota por ni. Como las clases c1, c2, ck una partición de la muestra, es fácil verificar que n = S ni  número total de observaciones o tamaño de la muestra k i = 1

6 Organización/PresentaciónFrecuencia Relativa. Se llama frecuencia relativa de la clase ci a la proporción de individuos que pertenecen a la clase sobre el total de individuos o tamaño de la muestra. Se de nota por fi. Se puede verificar que fi = nótese que S fi = 1 k i = 1 ni n

7 Presentación de Datos CualitativosReglas: Partición de la Población Cada observación debe pertenecer a una, y sólo una clase o categoría. Todas las observaciones deben ser pertenecer a una. Tablas  Tabligrama. Gráficos de Barras  Diagrama de Pareto. Gráficos Circulares o de Torta .

8 Ejemplo: Tablas Clase Descripción Frecuencia 1 2 3 4 5 6 107 60 51 258

9 Escala Nominal Usa números como una manera de separar los elementos de la población en diferentes clases o categorías. El número asignado a la observación sólo sirve como un nombre para distinguir la categoría a la cual pertenece la observación. La variable induce una partición sobre la población la información puede clasificarse en clases o categorías. Cada clase debe estar perfectamente definida y diferenciada de las demás. La recopilación se reduce a contar el número de individuos en la muestra que pertenece a cada clases: Ejemplos : Clasificación de alumnos por Cursos : primero (1), segundo (2),...., sexto (6) año; Sexo : masculino (M), femenino (F); Colegio : SEK (1); Alemán(2), Ruben Castro(3), etc.

10 Escala Nominal Diagrama de Pareto 107 60 51 25 10 8 120 100 80Frecuencia 60 51 40 25 20 10 8 1 2 3 4 5 6 Clase

11 Escala Nominal 6 5 3% 4% Diagrama Circular 4 10% 1 40% 3 20% 2 23%

12 Escala Ordinal Dónde existe un orden implícito entre las mediciones. El valor numérico es usado sólo como una manera de arreglar los elementos de acuerdo al orden establecido. La variable admite grados de calidad:existe una relación de orden total entre las clases. No es posible cuantificar la diferencia entre los individuos pertenecientes a las distintas clases. Ejemplo calificaciones de A (muy bueno), B (bueno), C (satisfactorio), D (admisible), E (deficiente)

13 Escala Ordinal Diagrama de Bloques 9 8 7 6 5 4 3 2 1 Pobre RegularPobre Regular Aceptable Bueno Muy Bueno

14 Escala Intervalar Considera no sólo la información pertinente al orden, sino además, el tamaño relativo de los intervalos a que pertenece cada uno de los individuos. En este nivel es posible cuantificar la diferencia de todos los individuos pertenecientes a los intervalos, clases o categorías distintas. Está involucrado en concepto de distancia, y la distancia entre dos medias puede ser expresada en función de esta unidad. Ejemplos: temperatura al interior de un silo, interés sólo clasificar en intervalos de cinco grados {(0, 5°), (5, 10°), .....,(30, 35°)}. Puntaje promedio PAA, interesa clasificar en tramos de 25 puntos.

15 Histogramas: valores discretos y continuos.Escala Intervalar Tabligramas. Tablas de Frecuencia. Histogramas: valores discretos y continuos. Usar 5 a 20 clases (intervalos o grupos). (considerar anchos de clases, límites y marca de clase). (polígono de frecuencias – dibujar en marca de clase). Frecuencia Acumulada - Ojiva. (graficar en límite superior).

16 Ejemplo: Tabligrama Ejemplo: 40 Datos Diagrama de Tallos-y-hojas Diagrama de Tallos-y-hojas El trabajar con datos agrupados en una tabla de frecuencia facilita el cálculo de parámetros en la muestra, pero los valores obtenidos sólo serán aproximados de los valores reales de la población. Los valores reales – pero desconocidos – son fijos e invariables. En tanto los valores extraidos de la muestra – aunque conocidos ellos variarán de muestra en muestra

17 Tabla de Frecuencias Límites 102,5-111,5 111,5-120,5 120,5-129,5K := N° Clases  log n  7 R := Rango = máx { xi } - mín { xi } = = 55 A := Amplitud = ( R + 1 ) / K = ( ) / 7 = 8 Límites 102,5-111,5 111,5-120,5 120,5-129,5 129,5-138,5 138,5-147,5 147,5-156,5 156,5-165,5 Marca 107 116 125 134 143 152 161 Conteo /// //// //// /// //// // //// / Frecuencias ABS - REL - REL. AC. 3 5 8 7 6 Calcular el número de clases K appx = 1 + 3,3 log n o bien k < = sqrt(n) Calcular Rango R = máx {xi} – min {xi} Calcular el ancho o amplitud de cada clase A = (R + 1)/ K; aproximar a la unidad de medición más próxima. Fijar el ancho de modo tal que los valores entre dos clases tengan una unidad más de precisón, de modo que ningún valor quede justo entre dos clases. Por otro lado el ancho de clase debe ser tal que se mantenga el número de clases calculado o varíe, a lo más, en uno Hacer la primera marca de clase igual al valor m{inimo observado Calcular marcas de clase y límites de clases Determinar el número de observaciones en cada celda: n Dibujar histograma o diagrama de torta. { "@context": "http://schema.org", "@type": "ImageObject", "contentUrl": "http://slideplayer.es/3339947/11/images/17/Tabla+de+Frecuencias+L%C3%ADmites+102%2C5-111%2C5+111%2C5-120%2C5+120%2C5-129%2C5.jpg", "name": "Tabla de Frecuencias Límites 102,5-111,5 111,5-120,5 120,5-129,5", "description": "K := N° Clases  1 + 3.3 log n  7. R := Rango = máx { xi } - mín { xi } = 162 - 107 = 55. A := Amplitud = ( R + 1 ) / K = ( 55 + 1 ) / 7 = 8. Límites. 102,5-111,5. 111,5-120,5. 120,5-129,5. 129,5-138,5. 138,5-147,5. 147,5-156,5. 156,5-165,5. Marca. 107. 116. 125. 134. 143. 152. 161. Conteo. /// //// //// /// //// // //// / Frecuencias. ABS - REL - REL. AC. 3. 5. 8. 7. 6. Calcular el número de clases K appx = 1 + 3,3 log n. o bien k < = sqrt(n) Calcular Rango R = máx {xi} – min {xi} Calcular el ancho o amplitud de cada clase A = (R + 1)/ K; aproximar a la unidad de medición más próxima. Fijar el ancho de modo tal que los valores entre dos clases tengan una unidad más de precisón, de modo que ningún valor quede justo entre dos clases. Por otro lado el ancho de clase debe ser tal que se mantenga el número de clases calculado o varíe, a lo más, en uno. Hacer la primera marca de clase igual al valor m{inimo observado. Calcular marcas de clase y límites de clases. Determinar el número de observaciones en cada celda: n. Dibujar histograma o diagrama de torta.", "width": "800" } 18 Histograma 9 8 7 6 5 4 3 2 1 107 116 125 134 143 152 161 { "@context": "http://schema.org", "@type": "ImageObject", "contentUrl": "http://slideplayer.es/3339947/11/images/18/Histograma+9+8+7+6+5+4+3+2+1+107+116+125+134+143+152+161.jpg", "name": "Histograma 9 8 7 6 5 4 3 2 1 107 116 125 134 143 152 161", "description": "Histograma 9 8 7 6 5 4 3 2 1 107 116 125 134 143 152 161", "width": "800" } 19 Polígono de Frecuencias9 8 7 6 5 4 3 2 1 99 107 116 125 134 143 152 161 170 { "@context": "http://schema.org", "@type": "ImageObject", "contentUrl": "http://slideplayer.es/3339947/11/images/19/Pol%C3%ADgono+de+Frecuencias.jpg", "name": "Polígono de Frecuencias", "description": "9. 8. 7. 6. 5. 4. 3. 2. 1. 99. 107. 116. 125. 134. 143. 152. 161. 170.", "width": "800" } 20 Frecuencia Acumulada: Ojiva40 39 38 37 36 35 34 33 32 31 30 29 28 27 26 25 24 23 22 21 20 19 18 17 16 15 14 13 12 11 10 9 8 7 6 5 4 3 2 1 99 107 116 125 134 143 152 161 170 { "@context": "http://schema.org", "@type": "ImageObject", "contentUrl": "http://slideplayer.es/3339947/11/images/20/Frecuencia+Acumulada%3A+Ojiva.jpg", "name": "Frecuencia Acumulada: Ojiva", "description": "40. 39. 38. 37. 36. 35. 34. 33. 32. 31. 30. 29. 28. 27. 26. 25. 24. 23. 22. 21. 20. 19. 18. 17. 16. 15. 14. 13. 12. 11. 10. 9. 8. 7. 6. 5. 4. 3. 2. 1. 99. 107. 116. 125. 134. 143. 152. 161. 170.", "width": "800" } 21 Escala de Razón Esta escala se usa cuando no sólo el orden y tamaño del intervalo son importantes. La única diferencia entre la escala de razón y la intervalar es que en la primera se puede definir un cero absoluto y en la segunda no Buscar ejemplos de Escala intervalar Buscar ejemplos de Escala de razón Tarea : Discuta la diferencia entre Precisión y Exactitud , { "@context": "http://schema.org", "@type": "ImageObject", "contentUrl": "http://slideplayer.es/3339947/11/images/21/Escala+de+Raz%C3%B3n+Esta+escala+se+usa+cuando+no+s%C3%B3lo+el+orden+y+tama%C3%B1o+del+intervalo+son+importantes..jpg", "name": "Escala de Razón Esta escala se usa cuando no sólo el orden y tamaño del intervalo son importantes.", "description": "La única diferencia entre la escala de razón y la intervalar es que en la primera se puede definir un cero absoluto y en la segunda no. Buscar ejemplos de Escala intervalar. Buscar ejemplos de Escala de razón. Tarea : Discuta la diferencia entre Precisión y Exactitud ,", "width": "800" } 22 Extraer Información desde la MuestraMediciones de Tendencia Central Mediciones de Dispersión Coeficiente de Variación La Regla Empírica { "@context": "http://schema.org", "@type": "ImageObject", "contentUrl": "http://slideplayer.es/3339947/11/images/22/Extraer+Informaci%C3%B3n+desde+la+Muestra.jpg", "name": "Extraer Información desde la Muestra", "description": "Mediciones de Tendencia Central. Mediciones de Dispersión. Coeficiente de Variación. La Regla Empírica.", "width": "800" } 23 Medidas de Tendencia CentralEstas medidas tienden a ubicarse en el centro del conjunto. Proporcionan un valor simple y representativo, que resume un gran volumen de información. Medidas de Tendencia Central. Proporcionan un valor simple y representativo, que resume un gran volumen de unformación. Estas medidas tienden a ubicarse en el centro del comnjunto. La medidas más utilizadas son: Media aritmética o promedio Media geométrica Media armónica Moda Mediana Semi Rango Media Aritmética Media Geométrica Media Armónica Moda Mediana Semi Rango { "@context": "http://schema.org", "@type": "ImageObject", "contentUrl": "http://slideplayer.es/3339947/11/images/23/Medidas+de+Tendencia+Central.jpg", "name": "Medidas de Tendencia Central", "description": "Estas medidas tienden a ubicarse en el centro del conjunto. Proporcionan un valor simple y representativo, que resume un gran volumen de información. Medidas de Tendencia Central. Proporcionan un valor simple y representativo, que resume un gran volumen de unformación. Estas medidas tienden a ubicarse en el centro del comnjunto. La medidas más utilizadas son: Media aritmética o promedio. Media geométrica. Media armónica. Moda. Mediana. Semi Rango. Media Aritmética. Media Geométrica. Media Armónica. Moda. Mediana. Semi Rango.", "width": "800" } 24 Medidas de Dispersión Miden la “dispersión” de valores dentro del conjunto de datos respecto de alguna medida de tendencia central. Medidas de Dispersión Miden la “dispersión” de valores dentro del conjunto de datos respecto de una medida de tendemcia central. Las medidas más conocidas son: Variancia Desviación Estándar Desviación Media Rango Ranago Cuartílico Rango Percentil Varianza Desviación Estándar Desviación Media Rango Rango Cuartílico Rango Percentil { "@context": "http://schema.org", "@type": "ImageObject", "contentUrl": "http://slideplayer.es/3339947/11/images/24/Medidas+de+Dispersi%C3%B3n+Miden+la+dispersi%C3%B3n+de+valores+dentro+del+conjunto+de+datos+respecto+de+alguna+medida+de+tendencia+central..jpg", "name": "Medidas de Dispersión Miden la dispersión de valores dentro del conjunto de datos respecto de alguna medida de tendencia central.", "description": "Medidas de Dispersión. Miden la dispersión de valores dentro del conjunto de datos respecto de una medida de tendemcia central. Las medidas más conocidas son: Variancia. Desviación Estándar. Desviación Media. Rango. Ranago Cuartílico. Rango Percentil. Varianza. Desviación Estándar. Desviación Media. Rango. Rango Cuartílico. Rango Percentil.", "width": "800" } 25 Medidas de Tendencia y DispersiónMediana 0,5000 Moda 0,4500 Media Aritmética 0,4000 0,3500 0,3000 0,2500 0,2000 0,1500 Q Q Q Q4 0,1000 0,0500 0,0000 1 2 3 4 5 6 7 Rango { "@context": "http://schema.org", "@type": "ImageObject", "contentUrl": "http://slideplayer.es/3339947/11/images/25/Medidas+de+Tendencia+y+Dispersi%C3%B3n.jpg", "name": "Medidas de Tendencia y Dispersión", "description": "Mediana. 0,5000. Moda. 0,4500. Media. Aritmética. 0,4000. 0,3500. 0,3000. 0,2500. 0,2000. 0,1500. Q1 Q2 Q3 Q4. 0,1000. 0,0500. 0,0000. 1. 2. 3. 4. 5. 6. 7. Rango.", "width": "800" } 26 Tipo de Variable fM  fi = i = 1, 2, 3, ..., k. ni nVariables Categóricas: (Escala Nominal) Moda (Medida del centro) Tasa de Variación (Medida de Dispersión) fM  fi = i = 1, 2, 3, ..., k. ni n V = 1 – fM = = nM n - nM Escala Nominal (nombres) La única medida de tendencia central posible de utilizar en este nivel es la Moda o más estrictamente la Clase Modal; esto es, la clase mayoritaria dentro de la muestra, la frecuencia de ocurrencia es mayor que en cualquier otra clase fM  fi i = 1, 2, 3, ..., k dónde fi = ---- La clase Modal no es igualemente significativa en todos los casos; es muy distinto fM = 0,50 que fM= 0,20. En el primer caso el 50% de las observaciones pertenecen a la clase modal, en el segundo sólo el 20%. Tasa de Variación, mide la importancia de la clase Modal como medida central V = 1 – fM = = La tasa de Variación entrega la “proporción” de la muestra contenida en la clase Modal. Nótese que es altamente V  0 si es poco V  1 A ni n nM n n - nM n SI Moda { } Significativa, entonces {

27 Ejemplo En un estudio de mercado se considera una muestra de 1100 fumadores averiguando la marca de cigarrillo que fuman, se obtienen la siguiente Tabla Marca A B C D Frecuencia Frec. Relativa , , , ,273 fM = 0,  Clase modal C TV = 1 – 0,282 = 0,  Tasa de variación

28 Tipo de Variable Variables Categóricas: (Escala Nominal)Moda (Mo) (Medida del centro) Tasa de Variación (V) (Medida de Dispersión) Variables Cualitativas: (Escala Ordinal) Moda, Mediana (Me) Tasa de Variación, Indice de Dispersión (ID) , Cuartíles Qi = Cj  j : min S fj > i/ Cj : clase j Mediana = C(Q2) D = rango clase es su N° de Orden K : N° total de clases ( rango C(Q3) – rango C(Q1)) (K –1) Escala Ordinal Aquí tienen sentido los conceptos de frecuencia acumulada, lo que da origen a nuevas medidas de la tendencia central y de la dispersión basados en los llamados percentiles o cuantiles o clases cuantiles. Se destcan Cuartil: de orden i-ésimo (i = 1, 2, 3, 4) al menor valor de la variable cuya frecuencia relativa acumulada sea mayor o igual a (i/4) Sólo podemos definir lam clase cuartil de orden i-ésimo Qi, i = 1, 2, 3, 4 1ra. Clase cuya frecuencia relativa acumulada es igual o superior a i/4

29 fM = 0,286  CM = P Med =C(Q2)  CMed = SEjemplo 2.4 : Se tiene la impresión que el servicio prestado por una sucursal bancaria no es buena; por lo tanto, la gerencia ordena un estudio al respecto. Se toma una muestra de 70 respuestas de clientes opinando sobre el servicio recibido Calificación P R S B E Frec. Absoluta Frec. Relativa , , , , ,086 Frec Acumul Frec Aculm.Relat , , , , ,000 fM = 0,  CM = P Med =C(Q2)  CMed = S V = 1 - fM = 1 – 0, = 0,714 D = = = 0,75 rC(Q3) – rC(Q1) (K-1) 4 – 1 5 –1 Q1 = 0,286 > 0,25  P Q2 = 0,686 > 0,50  S Q3 = 0,914 > 0,75  B Q4 =  E

30  Medidas de homogeneidadVariables Categóricas: (Escala Nominal) Moda ( Medida del centro ) Tasa de Variación ( Medida de Dispersión ) Variables Cualitativas: (Escala Ordinal) Moda, Mediana Tasa de Variación, Índice de Dispersión Variables Cuantitativas: (Escala Intervalar) Moda, Mediana, Media, Media Truncada Tasa de Variación, Índice de Dispersión, Varianza Rango, Rango Inter-cuartílico (IQR), MEDA  Medidas de homogeneidad Señal de Ruido  = - log CV = æ S 2 ö S ç ÷ ç ÷ è X 2 ø X

31 Escala Intervalar Existen dos maneras de realizar los cálculos de las madidas características de datos de escala inervalar, con ... Datos Agrupados: cuando los datos disponibles se presentan ya “trabajados” en tablas de frecuencias y no se cuenta con los datos originales. Datos No agrupados: cuando los datos se presentan como “materia” en bruto

32 Tendencia Central: PromedioDatos Agrupados: Datos NO Agrupados: å = n i X 1 X = X : Media Aritmética Xi : i-ésimo valor observado n : Tamaño Muestra xi ai ni Xi+1 fi : Frec. relativa Clase i = Xi : Marca Clase i X : Media Aritmética k : N° de clases ni : Frec. absoluta Clase i n : Tamaño Muestra ai : Amplitud de Clase i _ n å = k i X f 1 * X =

33 Tendencia Central: ModaL : Límite inferior Clase modal aM : Amplitud Clase Modal D1 : nM - n1 D2 : nM - n2 nM : Frec. absoluta Clase Modal n1 : Frec. absoluta Clase anterior a Clase Modal n2 : Frec. absoluta Clase posterior a Clase Modal ÷ ø ö ç è æ + = 2 1 D M a L o xM aM n1 nM n2 D1 D2 Datos Agrupados: Datos NO Agrupados: Es el valor que ocurre con mayor frecuencia: el valor más común. Puede que no exista moda. Puede que exista más un valor Modal V = Tasa de Variación = 1 – fM

34 Tendencia Central: MedianaL : Límite inferior Clase Mediana (C Me) Ne-1 : Frec. Acumulada hasta antes (C Me) ne : Frecuencia Absoluta (C Me) ae : Amplitud (C Me) n : Tamaño de la muestra e e-1 n N 2 a L Me ) ( - + = Datos Agrupados: xe ae Ne-1= fi S i = e-1 i = 1 ne Datos NO Agrupados: Si los datos se ordenan de orden ascendente de magnitud, entonces la Mediana está dada por: Si n es impar , la Mediana es exactamente el valor del medio Si n es par , la Mediana es el promedio de los valores centrales Me = n + 1 2

35 Dispersión: Varianza MuestralDatos Agrupados: Datos NO Agrupados: fi : Frec. relativa Clase i Xi : Marca Clase i X : Media Aritmética ni : Frec. absoluta Clase i n : Tamaño Muestra k : N° de clases _ å = k i - X f 1 2 ) ( S2 = ae ne xi xi-1 xk x ni nk å = n i - X 1 2 ) ( S2 = _ s2 : Variancia Muestral X : Media Aritmética Xi : i-ésimo valor observado n : Tamaño Muestra

36 Dispersión: Desviación MediaDatos Agrupados: Datos Agrupados: Datos NO Agrupados: MD : Desviación Media X : Media Aritmética Xi : i-ésimo valor observado n : Tamaño Muestra MD = å = n i - X 1 _ fi : Frec. relativa Clase i Xi : Marca Clase i X : Media Aritmética ni : Frec. absoluta Clase i n : Tamaño Muestra k : N° de clases | | : valor absoluto ae ne xi xi-1 xk _ x ni nk å = 1 i f MD = - X k

37 Rango Inter-CuartílicoRQ = (Q3– Q1) / 2 L : Límite inferior Qi; i = 1,2,3,4 NQí-1 : Frec. Absoluta acumulada hasta antes de la clase Qi aQi : Amplitud cuartil i-ésimo nQi : Frecuencia Absoluta de la clase del cuartil i-ésimo n : Tamaño de la muestra i Q n N a L ÷ ø ö ç è æ - * + = 1 4 Datos Agrupados: ae nQ NQ -1= fi S i = Q -1 i = 1 Datos NO Agrupados: Si los datos se ordenan de orden ascendente de magnitud, entonces el cuartil Qi, para i = 1, 2, 3, 4 está dado por Qi = Puede ser necesario interpolar entre valores sucesivos Nota Q2 = Me i(n + 1) 4 xQ

38 Dispersión: Rango PercentilRP = (P90 – P10) L : Límite inferior percentil i-ésimo NPí-1 : Frec. Absoluta acumulada hasta antes de la clase percentil i-ésimo aPi : Amplitud percentil i-ésimo nPi : Frecuencia Absoluta de la clase del percentil i-ésimo n : Tamaño de la muestra i P n N a L ÷ ø ö ç è æ - * + = 1 100 Datos Agrupados: xP ae nP NP -1= fi S i = P -1 i = 1 Datos NO Agrupados: Si los datos se ordenan de orden ascendente de magnitud, entonces el percentil Pi, para i = 1, 2, .., 99 está dado por Pi = Puede ser necesario interpolar entre valores sucesivos Nota P50 = Me i(n + 1) 100

39 Gráficos de Cajas Representación visual para describir, simultáneamente, varias características importantes tales como Centro Dispersión Desviación de la asimetría Identificación de las observaciones (valores atípicos) Q Q Q3 3 I RQ Mediana Valores Atípicos (rangQ3- rangQ1) / (K-1) D = Índice de Dispersión =

40 Gráficos de Cajas Comparaciones gráficas entre conjuntos de datos 1 2 3

41 Características de forma: SimetríaCoeficiente de Simetría de Fisher 1 =  Sesgo. 3 S m3 2,5 5 7,5 10 12,5 15 17,5 20 0,01 0,02 0,03 0,04 0,05 0,06 0,07 0,08 0,09 0,00 0,05 0,10 0,15 0,20 0,25 0,30 0,35 0,40 0,45 -4 -3 -2 -1 1 2 3 4 0,01 0,02 0,03 0,04 0,05 0,06 0,07 0,08 0,09 2,5 5 7,5 10 12,5 15 17,5 20 1 < 0 1 = 0 1 > 0 Distribución, tiende a concentrarse en Valores Altos de la Variable Mo > MA > Me Distribución, es simétrica respecto a la Media Mo = MA = Me Distribución, tiende a concentrarse en Valores Bajos de la Variable Mo < MA < Me

42 Características de forma: AchatamientoCoeficiente 2 =  Curtosis 4 S m4 0,00 0,05 0,10 0,15 0,20 0,25 0,30 0,35 0,40 0,45 -2 -1 1 2 0,00 0,05 0,10 0,15 0,20 0,25 0,30 0,35 0,40 0,45 -4 -3 -2 -1 1 2 3 4 0,00 0,05 0,10 0,15 0,20 0,25 0,30 0,35 0,40 0,45 -4 -3 -2 -1 1 2 3 4 5 -5 2 < 0 2 = 0 2 > 0 Distribución tiende a concentrarse alrededor de la Media. Variancia Pequeña Aguzada Distribución tiende a dispersarse Variancia grande Achatada. Distribución “Normal”

43 Ejercicio: Se desea determinar las características de resistencia a la ruptura bajo cargas de tensión del concreto ofrecido por cierto proveedor. Para ello se les solicita 125 probetas de 0,5 pies de diámetro por 1 pie de longuitud. La carga de tensión se mide en lb/pug2. El laboratorio de resitencia de materiales proporciona la tabla de frecuencias Clase Límites Marca Frecuencia Frecuencia Frecuencia Frecuencia de Clase de Clase Absoluta Abs. Acuml Relativa Relat. Acuml. ,5- 412, , ,032 2 412,5- 417, ,040 0,072 ,5- 422, ,064 0,136 4 422,5- 427, ,112 0,248 5 427,5- 432, ,104 0,352 6 432,5- 437, ,152 0,504 7 437,5- 442, ,160 0,664 8 442,5- 447, ,120 0,784 9 447,5- 452, ,096 0,880 10 452,5- 457, ,048 0,929 11 457,5- 462, ,056 0,984 12 462,5- 467, ,016 1,000 Determine: Todas las medidas de localización, escala, simetria y forma

44 Análisis de una muestra estratificadaV1 n2 V2 Em nm Vm m- estratos Supongamos que la variable admite una clasificación en k-clases, representadas por X1, X2,.....Xk.

45 Análisis de una muestra estratificadanih = Cantidad de individuos de la submuestra del estrato “h” que pertenece a Ci.

46 Análisis de una muestra estratificadaEntonces:

47 Ejemplo Calcular Centros 1,25 1,75 2,25 Frecuencias AbsolutasSe tiene 3 criaderos de aves. En el criadero (1) se ponen 50 pollos recién nacidos; en el (2) 200 pollos y en el (3) 100 pollos. Al cabo de un cierto tiempo se pesan los 350 pollos, encontrándose que algunos están muertos y los vivos pesan entre 1,00 [kg]. y 2,50 [kg]. Para los efectos del registro los pollos muertos se supondrán de peso cero, y el cero actuará como centro del supuesto intervalo. Los otros intervalos serán 1,00 ; 1,50 1,50 ; 2,00 2,00 ; 2,50. Calcular Centros 1,25 1,75 2,25 Frecuencias Absolutas (1) (2) (3) Note que existen 3 estratos y 4 clases

48 Análisis Muestra EstratificadaFrecuencia Relativa Histograma Apilado por Peso 0,1 0,2 0,3 0,4 0,5 0,6 0,7 1,25 1,75 2,25 1,00 1,50 2,00 2,50 Peso Criadero 1 Criadero 2 Criadero 3

49 Análisis Muestra EstratificadaFrecuencia Relativa Histograma por Estrato y por Peso 0,5 0,4 0,3 Criadero 1 Criadero 2 Criadero 3 0,2 0,1 Peso 1,25 1,75 2,25 1,00 1,50 2,00 2,50

50 Ejemplo Estrato (1) P1=1/7 Estrato (2) P2=4/7Xi fi1 fi1X1 Xi-X1 ( )2 fi1( )2 0 0,1 0 -1,525 2,325 0,2325 1,25 0,2 0,250 -0,275 0,0756 0,0151 1,75 0,6 1,050 0,225 0,0501 0,0304 2,25 0,1 0,225 0,725 0,525 0,0525 X1=1,525 V1=0,331 Estrato (2) P2=4/7 fi2 fi2X1 Xi-X2 ( )2 fi2( )2 0, ,662 2,76 0,138 0,10 0,125 -0,412 0,17 0,017 0,75 1,312 0,088 0, 01 0,007 0,1 0,225 0,588 0,34 0,034 X2=1,662 V2=0,196

51 Estratos Ph Media Varianza PhXh PhVh Xh-X (X-Xh)2 Ph( )2 Xh VhEstrato (3) P3=2/7 fi3 fi3X1 Xi-X3 ( )2 fi3( )2 0, ,475 2,17 0,217 0,30 0,375 -0,225 0,05 0,015 0,50 0,875 0,275 0, 08 0,040 0,20 0,225 0,775 0,60 0,060 X3=1,475 V3=0,0332 Estratos Ph Media Varianza PhXh PhVh Xh-X (X-Xh)2 Ph( )2 Xh Vh (1) 1/7 1, , , , , , ,00057 (2) 4/7 1, , , , , , ,00057 (3) 2/7 1, , , , , , ,00557 1, , ,0067

52 Estrato (1) P1=1/7 Xi fi1 fi1X1 Xi-X1 ( )2 fi1( )2 0 0, ,525 2,325 0,2325 1,25 0,2 0, ,275 0,0756 0,0151 1,75 0,6 1,050 0,225 0,0501 0,0304 2,25 0,1 0,225 0,725 0,525 0,0525 X1=1,525 V1=0,331 Estrato (2) P2=4/7 fi2 fi2X1 Xi-X2 ( )2 fi2( )2 0, ,662 2,76 0,138 0,10 0, ,412 0,17 0,017 0,75 1,312 0,088 0, 01 0,007 0,10 0,225 0,588 0,34 0,034 X2=1,662 V2=0,196 Estrato (3) P3=2/7 fi3 fi3X1 Xi-X3 ( )2 fi3( )2 0, ,475 2,17 0,217 0,30 0, ,225 0,05 0,015 0,50 0,875 0,275 0, 08 0,040 0,20 0,225 0,775 0,60 0,060 X3=1,475 V3=0,0332

53 Resultados Se ha obtenido, entonces: Media Total X = 1,589Varianza promedio dentro de los estratos Vintra= 0,254 Varianza entre estratos Vinter= 0,0067 Varianza Total VT= 0,2607

54 Estadística BivariadaSupongamos que se toma una muestra de tamaño n de una población y que se está investigando, o se desea estudiar, dos características de la misma. Sean estas características X e Y. Siguiendo los procedimientos habituales, la Muestra se divide en r clases Ai para la variable X s clases Bj para la variables Y Existirán elementos que pertenecerán simultánea-mente a AiBj. Los datos los podemos ordenar en una tabla o matriz llamada Tabla de Contingencia

55 Tabla de Contingencia Y B1 B2 ..... Bj ..... Bs Total XA1 n11 n n1j n1s n1 A2 n21 n n2j n2s n2 Ai ni1 ni nij nis ni Ar nr1 nr nrj nrs nr Total n1 n nj ns n  X n  = n _

56 Tabla de Contingencia Y B1 B2 ..... Bj ..... Bs Total XA1 f11 f f1j f1s f1 A2 f21 f f2j f2s f2 Ai fi1 fi fij fis fi Ar fr1 fr frj frs fr Total f1 f fj fs f  X f  = 1 _

57 Estadística BivariadaNotación: fij := frecuencia conjunta = fr(xi,yj) fi = = frecuencia marginal = f j = = frecuencia marginal = fi/j = = frecuencia condicional =

58 å å å å nij = nij fij = f = 1 n = n n n = n Tabla de Contingencia  rFrecuencia Absoluta de la clase conjunta AiBj. (Valor observado en la celda (i,j) de la Tabla de Contingencia) nij r s fij å å = Frecuencia Relativa “conjunta” de la clase conjunta correspondiente a la intersección de Ai y Bj. f = 1 n ij i = 1 j = 1 s å = Frecuencia Absoluta de la clase Ai; para i= 1, ,2, ... ,r (Independiente de la clases Bj a la que estén asociadas Suma de los valores de la fila i-ésima ) n n i ij j = 1 r å n = n Frecuencia Absoluta de la clase Bj; para j= 1, ,2, ... ,s (Independiente de las clases Ai a la que estén asociadas. Suma de los valores de la columna j-ésima) j ij i = 1

59 Tabla de Contingencia Para frecuencias relativas , i = 1,....,r se tiene: Además se verifica que: (Suma de los valores de la fila i-ésima de la tabla de contingencia de frecuencias)

60 n f = n n f = n Frecuencia MarginalDado el experimento anterior, cuando sólo interesa conocer la frecuencia de ocurrencia de cada una de las variables por separado se habla de Frecuencia Marginal de la variable n Frecuencia (relativa) “marginal” de la variable X, Conjunto de valores pertenecientes a las clases Ai, considerandolas independientemente de las calses Bj f = i n i n f = j Frecuencia (relativa) “marginal” de la variable Y, Conjunto de valores pertenecientes a las clases Bj, considerandolas independientemente de las calses Ai n j

61 Tabla de Contingencia EjemploUna tela se clasifica en tres categorías A, B y C según cantidad y severidad de pequeñas imperfecciones. La empresa tiene 5 telares, en un mes dado de producción se registraron los siguientes datos. # piezas de tela en la clasificación Telar A B C Marginal Marginal

62 Independencia EstadísticaSe dice que X es independiente de Y si las frecuencias condicionales de X/Y son todas iguales; es decir, no dependen de la clase condicionante, esto es fi/1 = fi/2 = fi/3 = = fi/s = fi· .... A i = 1, 2, 3, ... , r i1 n i2 n i3 n is n S i1 n + i2 n + i3 n .... is n n .... fi· = = = = = = n n n 1 n + 2 n + 3 n .... s n n 1 2 3 ·· = i i/j f j j/i ij Luego  similarmente  Como   

63 Frecuencia CondicionalCuando se “pregunta” por la frecuencia relativa de una de las varia-bles, digamos X, restrigida a los elementos observados de una clase dada de la otra; esto es, estudiar el comportamiento de una variable dado un valor fijo de la otra. = j i/j f ij ij n Frecuencia (relativa) de la variable X en la clase conjunta AiBj, “dado” que sólo nos interesa respecto a lo observado en la clase Bj de la variable Y; para i = 1, 2, .., r = j n Es decir, la distribución de frecuencias relativas según X cuanto se toma sólo elementos pertenecientes a la clase Bj según Y Nótese que se “trabaja” sobre un tamaño de muestra reducido al número de observaciones marginal de la variable condicional o dada Constituye la distribución de frecuencia relativa condicional de la variable X dada la clase Bj de la variable Y. Nótese que se trabaja “condicionado” sobre un tamaño de muestra “reducido” al número de observaciones de la clase Bj dada f1/j, f2/j, f3/j, ... , fr/j

64 Estadística Bivariada Independencia EstadísticaNotación: Análogamente, se tiene: fj/i = = frecuencia condicional = Independencia Estadística X e Y son variables estadísticamente independientes ssi: ó

65 Estadística BivariadaIndependencia Estadística como  Asociación de Variables Datos no agrupados Cov(x,y) = Datos agrupados : Cov(x,y) = Coeficiente de Correlación = r = Cov (x,y) Sx Sy

66 Ejercicio Fallas Anuales 2 20 15 10 45 3 12 7 5 24 4 4 10 2 16Temperatura Marginal Averías Marginal Obtener : Distribuciones marginales Distribuciones condicionales (4 averías), Media y Varianza condicional

67 Ejercicio Fallas Anuales 2 0,20 0,15 0,10 0,45 3 0,12 0,07 0,05 0,24Temperatura Marginal Averías 2 0,20 0,15 0, ,45 3 0,12 0,07 0, ,24 4 0,04 0,10 0, ,16 ,05 0, ,15 Marginal , , , ,00 fj/4 ={ 2/8; 5/8; 1/8} Xj/4 =137,5 Vj/4= 2/8( ,5)2 +5/8( ,5)2 +1//8( ,5)2 =

68 Curvas de Regresión X Y

69 Curvas de regresión (Lineal)x , y son variables independiente y dependiente respectivamente. Además  una variable estadística que representa el error. Los parámetros 0 y 1 pueden ser estimados a partir de los datos {(xi , yi)}i=1,...,n mediante método de mínimos cuadrados. Entonces Sea ;

70 Modelo Estadístico (Lineal)b + = x y 1 y b + = x mx 1 x x: variable independiente y y : variable dependiente  : una variable estadística que representa el error.

71 Modelo Estadístico (Lineal)b + = x y 1 y b1 b0 x

72 Modelo Estadístico (Lineal)b + = x y 1 x y b + = x yi 1 b + = x mx 1 ei ei ei y x Los parámetros 0 y 1 pueden ser estimados a partir de los datos {(xi , yi)}i=1,...,n mediante método de mínimos cuadrados. Esto es, minimizar el error cuadrático medio  min S ei2

73

74 Ejemplo: Curvas de RegresiónLímites de Clase Ingreso Estandarizado de una Población Marca de Clase 105 Consumo Promedio de Leche Semanal N° de Personas Encuestadas 0,5 2,13 532 1,5 2,82 647 2,5 3,70 692 3,5 4,25 867 4,5 4,86 865 5,5 5,16 513 7,0 5,23 530 9,0 5,57 181 x

75 Modelo Estadístico: Ejemplox y SCx SCy SCxy SCE 0,5 2,13 14,06 4,35 7,82 2,70 0,32 1,5 2,82 7,56 1,95 3,84 3,10 0,08 2,5 3,70 3,06 0,27 0,90 3,51 0,04 3,5 4,25 0,56 0,00 -0,03 3,91 0,11 4,5 4,86 0,06 0,42 0,16 4,32 0,30 5,5 5,16 1,56 0,89 1,18 4,72 0,19 7,0 5,23 1,03 2,79 5,33 0,01 9,0 5,57 22,56 1,84 6,44 6,14 34,0 33,72 57,00 10,74 23,10 1,37 4,215 b1 b0 x = y = S

76 y x ˆ - x b1 y b0 SCxy SCxy ˆ b1 SCx SCx SCE - 1 SCy Ejemplo= 23,10 SCx = 57,00 = SCx b1 ˆ SCxy y x = 4,215 = 4,25 ˆ - x b1 y b0 = 10,74 % de Ajuste del Modelo = 1 = - 1,37 0,872  87,2% SCE SCy

77 Ejemplo: Curvas de Regresiónt V(t) V(t) Sea xt = sen t yt = V(t) Luego y(t) = 0 + 1 xt + t

78 % de Ajuste del Modelo =

79 Ajuste Lineal Linear Fit: Y = a + bx Consumo Ingreso 0.1 1.7 3.3 4.96.6 8.2 9.8 6.02 5.32 4.61 3.90 3.19 2.48 1.78 a = b = Linear Fit: Y = a + bx

80 Ajuste Logarítmico Logarithm Fit: Y = a + b*ln(x) Consumo Ingreso 0.11.7 3.3 4.9 6.6 8.2 9.8 6.02 5.32 4.61 3.90 3.19 2.48 1.78 Logarithm Fit: Y = a + b*ln(x)

81 Ajuste Polinomial Power Fit: Y = a xb Consumo Ingreso 0.1 1.7 3.3 4.96.6 8.2 9.8 6.02 5.32 4.61 3.90 3.19 2.48 1.78 Power Fit: Y = a xb a = b =

82 Modelo Logístico a 1+b*e-cx Logistic Model: Y = Consumo Ingreso 0.11.7 3.3 4.9 6.6 8.2 9.8 6.02 5.32 4.61 3.90 3.19 2.48 1.78 Logistic Model: Y = a 1+b*e-cx a = b = c =

83 Modelo de Richard Richard’s Model: Y = a 1+b*e(b-cx)(1/d) ConsumoIngreso Consumo 0.1 1.7 3.3 4.9 6.6 8.2 9.8 6.02 5.32 4.61 3.90 3.19 2.48 1.78 Richard’s Model: Y = a 1+b*e(b-cx)(1/d) a = b = c = d =

84 Asociación ExponencialIngreso Consumo 0.1 1.7 3.3 4.9 6.6 8.2 9.8 6.02 5.32 4.61 3.90 3.19 2.48 1.78 Exponential Association (3): Y = a (b - e-cx) a = b = c =

85 Transformaciones Sea yi = h ( xi ) con i = 1,...,n1. Lineales yi = axi + b y = ax + b Sy = a Sx 2. No lineales yi = h( xi ) y = h(x) h”(x) SX2 Sy2 Sx2  h’ (x)2 En particular h(x) = ln x y = ln x ( Sx2 / x2 ) Sy2  ( Sx2 / x2 ) = CV 2

86 Relaciones Linealizables1. y = K x ln y = a0 + a1 ln x 2. y = K  (  / x ) y = a0  a1 x-1 3. y = K ex ln y = a0 + a1 x 4. y = K e-/x ln y = a0 + a1 x-1 5. yt = K +  cos t y = a0 + a1 xt siendo xt = cos t 6. y() = y - 1 = a0 + a1 x y-1 dy = a1 w = dy dx dx ln w = ln a1 + ( 1 -  ) ln y

87 Transformaciones 3. Box-Cox Transformaciones (1964) h (x) = X() =( x + m ) - 1   x > -m ln ( x + m )  = 0 m > 0

88 Transformaciones Sea yi = h ( xi ) con i = 1,...,nLineales No lineales yi = a + bxi • y = a + b ln x y = a + bx • y = a e bx sy = b sx 3. Linealizables y = a x b  ln y = ln a + b ln x y = a  ( b / x )  y = a  b x-1 y = a e bx  ln y = ln a + b x y = a e-b/x  ln y = ln a - b x-1 yt = a + b cos t  y = a + b xt siendo xt = cos t