1 Universidad Privada “San Pedro” Cursos doctorales de Metodología de la Investigación Empleo de la Estadística Descriptiva e Inferencial, en el diseño, procesamiento y análisis de investigaciones científicas. Dr. René Suárez Martínez MsM PhD Profesor Titular Consultante ISCM-H Fac Calixto García, IPK, ENSAP, INSAT
2 ESTADÍSTICA Nos instruye sobre la manera adecuada de: recoger, procesar, validar presentar y analizar datos de la realidad, teniendo presente la variabilidad inherente en ellos. DESCRIPTIVA INFERENCIAL
3 LA ESTADÍSTICA: Contribuye a la formulación de leyes acerca del hombre, la sociedad o el ambiente, mediante el estudio y registro de hechos o fenómenos observados o experimentados en dicha realidad. Permitiendo confirmar o rechazar tales leyes. Se vale esencialmente de modelos científicos de tipo determinista o aleatorio (estocástico). Constituye una de las tecnologías más útiles cuando la variabilidad y la incertidumbre forman parte de los eventos o fenómenos que se investigan.
4 Puede ser definida como:Sistematización, recogida, ordenación y presentación de los datos referentes a un fenómeno que presenta variabilidad o incertidumbre para su estudio metódico, con objeto de deducir las leyes que rigen esos fenómenos, y poder de esa forma hacer previsiones sobre los mismos, tomar decisiones u obtener conclusiones. Descriptiva Probabilidad Inferencia
5 Estadística Descriptiva: Trata la organización, presentación y síntesis de la información.Estadística Inferencial: Permite sacar conclusiones aplicables a una población más amplia que la muestra estudiada.
6 Estadística Descriptiva:Su empleo permite resumir o caracterizar los elementos esenciales de un universo mediante el cálculo de determinadas medidas: VARIABLES Cualitativas, emplean tasas, razones, proporciones porcentajes Cuantitativas, emplean medidas de tendencia central, variabilidad y posición relativa
7 LA ESTADÍSTICA INTERVIENE EN EL:
8 Plantear hipótesis sobre una población Los trabajadores que fuman más ausencia al trabajo que los no fumadores ¿En qué sentido? ¿Mayor número? ¿Tiempo medio? Decidir qué datos recoger (diseño de experimentos) Qué individuos pertenecerán al estudio (muestras) Fumadores y no fumadores en edad laboral. Criterios de exclusión ¿Cómo se eligen? ¿Descartamos los que padecen enfermedades crónicas? Qué datos recoger de los mismos (variables) Número de bajas Tiempo de duración de cada baja ¿Sexo? ¿Sector laboral? ¿Otros factores? Recoger los datos (muestreo) ¿Estratificado? ¿Sistemáticamente? Describir (resumir) los datos obtenidos tiempo medio de baja en fumadores y no (estadísticos) % de bajas por fumadores y sexo (frecuencias), gráficos,... Realizar una inferencia sobre la población Los fumadores están de baja al menos 10 días/año más de media que los no fumadores. Cuantificar la confianza en la inferencia Nivel de confianza del 95% Significación del contraste: p=2%
9 Formulación de las hipótesisASPECTOS A TOMAR EN CUENTA Descriptiva Inferencial Formulación de las hipótesis Variables imprescindibles a incluir Control de errores y sesgos Seguir el diseño Procesar adecuadamente los datos Analizarlos convenientemente
10 El azar y la probabilidadesAzar: Agregado de factores o causas complejas, parcialmente desconocidas. Probabilidad: Medida con variación desde 0 hasta 1, del grado de creencia de una hipótesis o afirmación.
11 Media Media aritmética de los datos (suma de los valoresobservados dividido por el tamaño muestral). La media es como el centro de gravedad. La MEDIA es la medida de tendencia central más informativa, ya que tiene en cuenta el valor de todas las observaciones, sin embargo tiene unos INCONVENIENTES
12 Inconvenientes Poco representativa cuando existen valores extremos. No se debería utilizar en variables cualitativas ordinales En estos casos usar la MEDIANA que da mejor información
13 Mediana Valor que divide en dos partes iguales el número deobservaciones (n). Para calcular una mediana se ordenan las observaciones de menor a mayor: Si n es impar, la mediana es la observación situada en el orden (n+1)/2, es decir, el dato central.
14 Mediana Como hemos dicho, la mediana es másrepresentativa que la media en distribuciones con valores extremos. Las variables ordinales pueden describirse a través de la mediana, ya que la mediana no tiene en cuenta el valor del dato, sino su orden.
15 Moda Valor de la observación que ocurre con mayorfrecuencia. Si todos los valores son distintos, no hay moda. También puede haber más de una moda.
16 Escala Nominal Define un atributo en el que no hay un orden degradación implícito. Ejemplo: Estado civil Ciudad de nacimiento Atributos diferentes entre sí Los atributos son nombres A los nombres le podemos asignar número
17 Escala Nominal Estado civil:Casado, Soltero, Viudo, Divorciado
18 Escala Binaria Caso especial de la escala ordinal en que elatributo puede tomar solo dos valores. Ejemplo: Sexo Curado y no curados Fumador o no Sexo: Masculino 1 Femenino 2
19 Escala Ordinal Cuando al rasgo estudiado se le puede asignaruna relación de orden. Ejemplo. Nivel económico Grado de escolaridad Evolución de la enfermedad Curado 1 Mejorado 2 Empeorado 3
20 Variable Toda característica medida en un estudio, serealice su medición en números (por ejemplo edad, altura) o en términos de categorías (por ejemplo sexo, presencia o ausencia de una enfermedad). Recoger tantas variables como sean necesarias y tan pocas como sea posible.
21 Tipos de variables en el ProtocoloEjemplo de estudio de una vacuna antigripal: Variable principal o de respuesta: Diagnóstico de Neumonía. Variables de control: Hábito de fumar, enfermedad asociada, etc. Variables descriptoras: Sexo, edad, raza, estado civil
22 Variables Variable explicativa o variable independiente:Describe la intervención realizada por el investigador y se la considera la causa del fenómeno observado. Variable dependiente: Describe el resultado de la intervención
23 Variables Pueden expresarse en forma de: Número Proporción Razón
24 Número. Proporción. Razón.Número: 265 pacientes con HTA Proporción: 35 HTA renal de 265 HTA observados 35/265= 0.13 (Numerador incluido en el denominador) Razón: Razón de mujeres /hombres que ingresan por HTA es de 1:3. (El denominador no contiene al numerador).
25 ACOPIO DE LA INFORMACIÓNTrascripción y revisión Diseño Formulario PLANEAMIENTO EJECUCIÓN PROCESAMIENTO Verificación confección Base datos. Edición Validación Para que los datos lleguen a las bases de datos es necesario haber realizado antes otras operaciones. Estamos hablando de: La información luego de ser observada en cada sujeto debe haber sido registrada en algún documento o planilla de datos. Para poder registrar esa información, antes fue necesario diseñar el documento donde la misma iba a ser registrada. Estos procesos se conocen (ahora en orden ascendente de realización) como: Diseño del CRD que se realiza junto con la elaboración del protocolo del ensayo clínico en la etapa de Planificación Completamiento y recolección de los CRD que se realiza durante la etapa de ejecución del estudio y es el momento donde cada sujeto es evaluado según lo dispuesto en el protocolo. Por esta razón explicaremos con más detalle cada uno de estos procesos, pues son los que con seguridad cada investigador clínico, puede influir de manera directa.
26 DISEÑO DEL FORMULARIO. PREGUNTASCaracterísticas Abiertas Cerradas Establecen categorías NO SI Posibilidad de expresión personal más amplia Cada pregunta de cada modelo del CRD es clasificada en: Preguntas abiertas Preguntas cerradas Según la definición de cada una, aparecerán o no las posibles respuestas y se adoptará la forma que mejor permita recoger la misma.
27 Advertencias para preguntas abiertas Procurar que el individuo llene intuitivamente Tipo de respuesta : Alfanumérica casillas abiertas Ejemplos SEXO (M mas F Fem : |__| Se puede emplear aun en aquellos casos que se trate de respuestas numéricas con decimales. No olvidar punto decimal y unidad de medida (sin decimales) (con decimales) Talla : |__|__|__| cm Peso : |__|__|__|.|__| Kg. En el caso de las variables cuya respuesta será numérica la unidad de medida se considera indispensable. Si estamos hablando de un parámetro de laboratorio hay estudiar además si existe más de un método para dar dicha respuesta, lo cual estará dado además por las instituciones que participen en el estudio.
28 El Cuaderno de Recogida de DatosPreguntas Cerradas Tipo de respuesta : - Una sola elección - Múltiple elección Formato : Casillas cerradas ( ) Una sola elección De todas las categorías solo es posible escoger una Ejemplos: Sexo: Masculino 1 Femenino 2 Presencia de Eventos Adversos: Si 1 No 2 En el caso de las preguntas cerradas, son preguntas que responder es mucho más fácil que diseñar, pues si se olvida una posible respuesta en tiempo de diseño, será un problema más en tiempo de registro de información. Este tipo de variable debe cumplir con dos conceptos que son: 1.- Exhaustividad 2.- Exclusividad La primera se refiere a que cada elemento debe poder ser clasificado de alguna manera La segunda se refiere a que cada elemento que se estudie debe poder ser clasificado de forma única dentro de las posibles respuestas. Curso para los investigadores clínicos
29 PREGUNTAS CERRADAS Ejemplo:Variable que mide el tiempo de evolución de una enfermedad (no hay restricción en el protocolo) y tiene como respuesta: 1. - Entre 10 y 20 años 1 2. - Entre 20 y 30 años 2 Problemas: ¿ Qué sucede si un individuo tiene menos de 10 años o más de 30 ? ¿ Qué sucede si un individuo tiene 20 años ? Si suponemos que en el protocolo X se considera cualquier tiempo de evolución, y nuestra variable para medir la respuesta a esta pregunta solo tiene esas dos posibilidades entonces como responder las preguntas planteadas. En la primera pregunta no es posible clasificar la respuesta, luego la variable no ha cumplido el principio de exhaustividad. En la segunda pregunta hay ambigüedad en el momento de clasificar la respuesta. En este caso la variable no ha cumplido el principio de exclusividad. Cuando estamos ante preguntas como esta la solución pudiera parecer sencilla. Recoger una variable con dos casillas que describa el tiempo de evolución. En este caso hay que tener en cuenta que: Es obligatorio describir la unidad de medida en que se evaluará la respuesta Si se quisiera realizar un análisis por grupos debe tenerse en cuenta desde el principio y es aquí donde debe velarse porque se cumpla la exclusividad y la exhaustividad de esa nueva variable.
30 Preguntas Cerradas Tipo de respuesta : - Una sola elección- Múltiple elección Formato : Casillas cerradas ( ) Múltiple elección De todas las categorías es posible elegir más de una Ejemplos Síntomas: Dolor 1 Prurito 2 Fiebre 3 Es una forma de abordar una pregunta que en conjunto se refiere a una caracterización, pero donde cada elemento aporta una característica determinada. En tiempo de diseño puede pasar desapercibido, pero para poder almacenarlo correctamente en la base de datos será necesario realizar transformaciones a la variable original. Por esta razón se recomienda desde el diseño del CRD abordar cada respuesta como una nueva pregunta que se contestará de forma afirmativa o negativa, lo cual hará más claro la interpretación de los resultados porque. ¿ Cómo puede interpretarse una pregunta de múltiple elección cuando una casilla no está marcada? 1.- No aparece la característica 2.- Pudiera estar la característica, pero el investigador olvidó completarla. Dolor Si 1 No 2 Prurito Si 1 No 2 Fiebre Si 1 No 2
31 Consideraciones generalesNo dejar preguntas en blanco Letra legible Respaldo del dato en la historia clínica Instrucciones para la corrección de datos No olvidar datos retrospectivos Verificar cada página del CRD Tachar el dato con una línea horizontal, Anotar el nuevo dato al lado, Escribir fecha de la rectificación Escribir iniciales del investigador Edad : |3|5| 12/3/01 GJR 33 En el caso de que en la planificación no se halla especificado cómo completar la información missing deberá establecerse mediante documento escrito como se hará la misma y comunicar a todos los investigadores. Los bolígrafos son un recurso que no deben faltar en la planificación de los insumos material es del ensayo. Para ello se debe tener en cuenta complejidad del CRD, total de pacientes a evaluar. Si los CRD no están impresos en papel NCR debe tenerse en cuenta que cada CRD se debe llenar por duplicado. Se completará la información missing (no disponible) según las normas del protocolo No escribir con lápiz. Se escribirá con bolígrafo de tinta negra. Las preguntas abiertas deberán contestarse utilizando una caligrafía legible Cada dato registrado en el CRD deberá tener un respaldo en la Historia Clínica del sujeto. Demuestra la existencia del paciente y permite comprobar el proceder seguido Pueden existir datos que se completen retrospectivamente en un modelo después de su momento de llenado Ejemplo: En el modelo de Evaluación inicial de un ensayo en piel el resultado de un cultivo se tiene al cabo de 7 días, luego esta pregunta no puede contestarse en el momento en que se llena el modelo Curso para los investigadores clínicos
32 Manual del InvestigadorINSTRUCCIONES PARA: COMPLETAMIENTO DE LOS CRDs REVISION DE LOS CRDs CORRECCION DE LOS CRDs DIAGRAMA DE FLUJO CALENDARIO DE RECOGIDA DE DATOS En el manual del investigador se deben especificar todos los aspectos relacionados con el completamiento, revisión y corrección de los CRDs. INSTRUCCIONES PARA EL COMPLETAMIENTO Deberá aparecer como completar preguntas: - Cerradas - Abiertas - Con valores de tipo fecha - Con valores de tipo hora - Preguntas claves como: .- Las iniciales de los sujetos .- El codigo de identificacion INSTRUCCIONES PARA LA REVISION Deberá quedar explícito: Responsabilidad del Investigador clínico responsable de la revisión y firma de todos los modelos del CRD Que al pie de cada página deberá estampar su firma y completar la fecha en que se da por completada y revisada esa página del modelo INSTRUCCIONES PARA LA CORRECCION Responsabilidad del Investigador clínico en cuanto a la decisión de si un dato se considera missing Responsabilidad del investigador clínico en cuanto a la corrección de un dato Formato para realizar las correcciones SOBRE EL DIAGRAMA DE FLUJO Debe describirse en un diagrama la conducta a seguir con los sujetos en cuanto a: - Posibilidad de entrar en el estudio - Evaluaciones dentro del estudio - Posibilidad de interrumpir el estudio SOBRE EL CALENDARIO DE RECOGIDA DE DATOS Curso para los investigadores clínicos
33 Errores aleatorios Realidad
34 Errores aleatorios Riesgo (p) = Probabilidad de cometer errorde tipo 1 Riesgo = Probabilidad de cometer error de tipo 2 1- = probabilidad de que si a es superior a b el estudio concluya correctamente que así es. Este valor es el poder estadístico del ensayo e indi- ca la probabilidad que tenemos de detectar una di- ferencia si esta existe en realidad.
35 Formulación de hipótesisComparación de eficacia clínica de 2 ttos. a y b ( Toda diferencia observable entre la eficacia de ambos tratamientos es debida simplemente al azar o a la variabilidad biológica, ya que el efecto de los tratamientos en estudio no difiere sustancialmente de uno a otro.) HO: tto a = tto b (Hipótesis Nula)
36 Formulación de hipótesisHa: tto a difiere del tto b (Aparte de la variabilidad, los dos grupos estudiados difieren además en otro factor o característica, que es el efecto del tratamiento en estudio.)
37 Formulación de hipótesisSi la diferencia entre los ttos. es grande de habla de diferencia estadísticamente significativa. Se mide en términos de probabilidad, p. Nivel de significación (nivel ): Determina la evidencia que se que se aceptará en contra de HO para rechazarla. (entre 0.01 y 0.05) p<0.05 significa que la probabilidad de que la diferencia observada sea debida al azar es pequeña.
38 Sesgos Es la presencia de ERROR SISTEMATICOen una investigación que resulta de una estimación incorrecta de los hechos analizados. Es una interferencia o un factor que tiende a pro- ducir resultados o interpretaciones que se apartan sistemáticamente de los verdaderos.
39 Tipos de Sesgos Sesgo introducido por el investigador: Sesgo de medición (equipo de medición, cambio de método de medición, etc) Sesgo de selección (Ej. en diagnóstico, en la se- lección, de no respuesta) Sesgo de publicación (Ej. Publicación de resulta- dos positivos, sesgo de referencia)
40 Muestreo Abarca los distintos procedimientos para extraer muestras de poblaciones con el objeto de conocer sus características.
41 Muestreo Aleatorio Los elementos de la muestra se toman aleatoriamente de la población y con probabilidades conocidas. Con este tipo de muestras es que se posibilita llevar a cabo los objetivos de la inferencia estadística. Permite medir en términos de probabilidades el riesgo de efectuar inferencias erróneas.
42 Tipos Muestreo Simple Aleatorio: Aquel en el que cada individuo de la poblacion tiene las mismas posibilidades de salir en la muestra. Muestreo Sistemático: En el que se elige un individuo al azar y a partir de él, a intervalos constantes, se eligen los demás hasta completar la muestra. Muestreo estratificado: En él se divide la población en clases o estratos y se escoge, aleatoriamente, un número de individuos de cada estrato proporcional al número de componentes de cada estrato. Muestreo por conglomerados: Se eligen al azar unidades más amplias (conglomerados) donde de clasifican los elementos de la población.
43 Notaciones Parámetros Poblacionales Estadísticos Muestrales s pq=1-p
44 Distribuciones MuestralesConsideremos todas las muestras de tamaño N que se pueden extraer aleatoriamente de una población. Si para cada muestra calculamos un estadístico, se puede obtener una distribución muestral para el mismo. En cada distribución muestral se puede calcular la media, desviación estándar, etc. La desviación estándar de la distribución muestral de un estadístico se conoce como error típico del estadístico.
45 Distribución la Media Muestral (Varianza conocida)Si una variable aleatoria X sigue una distribución N( , ) donde y son conocidos entonces la media muestral de una muestra de tamaño n, sigue una distribución Por consiguiente la variable aleatoria Z definida por:
46 Ejemplo La altura de los estudiantes de una población se distribuye según una normal de media 167cm y desviación típica 3,2cm. Si se toma una muestra de 10 estudiantes. Calculemos la probabilidad de que la media muestral sea menor que 165 cm.
47 Distribución la Media Muestral (Varianza desconocida)Sea una muestra aleatoria de una variable aleatoria X, de tamaño n, si X tiene distribución normal N( , ) entonces la variable aleatoria T definida:
48 Distribución Muestral de la VarianzaSi S2 es la varianza insesgada de una muestra aleatoria de tamaño n de la variable X y esta se distribuye N(, ) entonces:
49 Distribución asintótica de la media muestralLas medias de las muestras de tamaño n extraídas de una población de parámetros y conocidos, siguen una distribución:
50 Distribución Muestral de ProporcionesLas proporciones muestrales de todas las muestras de tamaño n extraídas de una población en la que la probabilidad de éxito de un suceso es p, se ajustan a una normal:
51 Ejemplo Una fábrica de pasteles fabrica, en su producción habitual, un 3% de pasteles defectuosos. Un cliente recibe un pedido de 500 pasteles de la fábrica. ¿Cuál es la probabilidad de que encuentre más del 4% de pasteles defectuosos?
52 Ejemplo (continuación)La probabilidad pedida es que la proporción de pasteles defectuosos en la muestra sea mayor del 4%, es decir:
53 Estimación de ParámetrosLa teoría muestral se utiliza para obtener información sobre las muestras extraídas aleatoriamente de una población. El problema que aborda la estimación de parámetros, es inferir información sobre una población a partir de una muestra extraída de la misma. Los parámetros poblacionales se estiman a partir de los correspodientes estadísticos muestrales.
54 Tipo de Estimaciones PuntualesEstimación Insesgada: Si la media o valor esperado del estadístico coincide con el parámetro correspondiente de la población. Estimación Eficiente: Si las distribuciones muestrales de dos estadígrafos tienen la misma esperanza (o media), aquel que tenga menor error de estimación (varianza) será el más eficiente de ambos.
55 Estimaciones InsesgadasParámetro
56 Estimación por IntervalosLa estimación puntual no provee información de la incertidumbre del resultado. La incertidumbre se produce por la dispersión de la distribución muestral del estimador. La incertidumbre se expresa cuantitativamente mediante un intervalo que tenga una probabilidad especificada de contener el valor verdadero del parámetro. Este intervalo recibe el nombre de intervalo de confianza.
57 Intervalos de ProbabilidadEn una variable normal cualquiera con parámetros y se cumple: En el intervalo ( - ; + ) está el 68,26 % de la población. En el intervalo ( -2 ; +2 ) está el % de la población. En el intervalo ( -3 ; +3 ) está el % de la población.
58 Dado un porcentaje del N%, siempre es posible encontrar un intervalo simétrico respecto de la media de forma que dicho intervalo contenga al N% de población. Se denomina intervalo de probabilidad o confianza a aquel intervalo para el cual hay una seguridad del N% de que los parámetros muestrales se encuentren en dicho intervalo. Denominamos nivel de confianza al número: Donde es el nivel de significación.
59 Ejemplo Si queremos que el 88 % de la población esté en el intervalo, el nivel de confianza sería: Nivel de Confianza Nivel de Significación
60 Intervalo de probabilidad para la media de una variable normalSi la población sigue una distribución normal con parámetros desconocido y conocida entonces si tomamos una muestra de tamaño n sabemos que :
61 Para buscar Se obtienen de las tablas de la distribución normal estándar.
62 El intervalo indicado es el intervalo de confianza con un nivel de confianza del (1-) por ciento de la media.
63 Ejemplo Supongamos que la media muestral de una muestra de 9 elementos es de 15.4 y su desviación estándar es 2.3 y queremos calcular el intervalo de confianza del 95% para la media poblacional:
64 Intervalo de probabilidad para la media de una variable normalSea X una variable aleatoria normal con parámetros y desconocidos. Si se obtiene una muestra de tamaño n, entonces el intervalo de confianza del (1-)% de la media muestral es:
65 Ejemplo Supongamos que la media muestral de una muestra de 9 elementos es de 15.4 y su desviación estándar muestral es 2.1 y queremos calcular el intervalo de confianza del 95% para la media poblacional:
66 Intervalo de probabilidad para la varianza de una variable normalSea X una variable aleatoria normal con parámetros y desconocidos. Si se obtiene una muestra de tamaño n, entonces el intervalo de confianza del (1-)% de la varianza muestral es:
67 Ejemplo Un productor de fertilizantes, para controlar el buen embolsado de sus productos, pesa 15 bolsas del mismo, obteniendo una desviación típica de 0,50 kg. ¿Qué varianza puede inferirse con un 98% de confianza que tendrá la producción total?
68 Intervalo de probabilidad para pEl intervalo de confianza con nivel de confianza 1- para la proporción poblacional desconocida p es: Nota: Para aplicar este resultado, las muestras deben ser de tamaño Se utiliza la distribución muestral de las proporciones.
69 Ejemplo En 40 lanzamientos de una moneda se obtuvieron 24 caras. Hallar el intervalo de confianza del 95% para la proporción de caras que debe obtenerse en un número ilimitado de lanzamientos de una moneda.
70 Conclusiones Para hallar una estimación por intervalo de confianza de un parámetro poblacional se siguen los siguientes pasos: Fijar el coeficiente de confianza que se desea en la estimación. Calcular los estadísticos necesarios y determinar la distribución en el muestreo que tiene el estadístico empleado. Buscar el percentil que se necesita. Utilizar las fórmulas.
71 Conceptos Básicos de Probabilidades
72 Definiciones Experimento Aleatorio: Experimento cuyo resultado no se puede predecir con certeza. Ejemplo: Lanzar un dado. Espacio Muestral: El conjunto de todos los sucesos posibles. Ejemplo: {1, 2, 3, 4, 5, 6}. Se denota con la letra griega . Suceso Elemental: A cada elemento que forma parte del espacio muestral. Ejemplo: Que salga 2. Evento o suceso aleatorio: Un subconjunto del espacio muestral. Ejemplo: Que salga un número par. Suceso Imposible: Al que no tiene ningun elemento y lo representaremos por . Ejemplo: Que salga un 7. Suceso Seguro:Al formado por todos los posibles resultados. Ejemplo: Que salga un número entre 1 y 6.
73 Operaciones con sucesosIgualdad de sucesos: Dos sucesos A y B son iguales si están compuestos por los mismos elementos. Lo expresaremos por A = B. Intersección de sucesos: Llamaremos suceso intersección de los sucesos A y B, y lo representaremos por AB, al suceso: ocurren A y B a la vez. Unión de sucesos:Llamaremos suceso unión de los sucesos A y B y se representa por AB al suceso: ocurre A o bien ocurre B o bien ocurren ambos a la vez. Suceso contrario de otro: Dado un suceso A, llamaremos suceso contrario de A y se representa por , al suceso que tiene por elementos a todos aquellos que no pertenecen a A.
74 Ejemplo Sea el experimento aleatorio lanzar un dado.A= {2,4,6}, suceso aleatorio “que salga un número par”. B={1,2,3}, suceso aleatorio “que salga un número menor o igual que 4”. Entonces: AB={2,4}. AB={1,2,3,4,6}.
75 Definición clásica de ProbabilidadSi realizamos un experimento aleatorio en el que hay n sucesos elementales, todos igualmente probables, entonces si A es un suceso, la probabilidad de que ocurra el suceso A es:
76 Ejemplo Si lanzamos un dado normal al aire y consideramos el sucesoA = “sale par”, la probabilidad de ocurrencia de A se calcularía: Casos posibles hay 6, pues ={1, 2, 3, 4, 5, 6}. Casos favorables al suceso A son 3 pues A={2, 4, 6}. Por tanto:
77 Limitaciones El inconveniente que plantea la definición de anterior es que necesariamente los sucesos elementales tienen que tener la misma probabilidad de ocurrir. Además, se define el término probabilidad en términos de igualmente probables.
78 Definición AxiomáticaSea un espacio muestral y A un evento cualquiera de . Se define como probabilidad P a una función definida sobre los subconjuntos de que cumple los siguientes axiomas:
79 Propiedades
80 Probabilidad CondicionalSean A, B dos sucesos tales que P(B) > 0. La probabilidad de A condicionada a la ocurrencia de B, se define como: Regla de multiplicación : P(AB)= P(A / B)P(A)=P(B / A)P(A).
81 Sucesos IndependientesEl suceso A es independiente de B, si la P(A) no depende de la aparición de B, es decir: Propiedades: Si A y B son independientes y P(A)>0, P(B)>0 entonces: P(A B) = P(A)P(B). P(A B) = P(A) + P(B) - P(A)P(B).
82 Ejemplo Un grupo de estudiantes consta de 60 muchachas y 40 muchachos, de ellos 40 de ellos (24 muchachas y 16 muchachos) usan espejuelos. Si se elije al azar un estudiante, ¿cuál es la probabilidad de usar espejuelos y cuál es la probabilidad de usar espejuelos dado que salió un muchacho? A= Usar espejuelos, B= Ser un muchacho y A B= Ser un muchacho y usar espejuelos. Usar espejuelos no depende de que el sexo sea masculino; estos dos sucesos son independientes.
83 Ley de la Probabillidad TotalSea un espacio muestral, A1, …, An subconjuntos de que cumplen las siguientes propiedades:
84 Ejemplo En un colegio se imparten solo los idiomas inglés y francés. El 80% de los alumnos estudian inglés y el resto francés. El 30% de los alumnos de ingles son socios del club musical del colegio y de los que estudian francés son socios de dicho club el 40 %. Se elige un alumno al azar. Calcular la probabilidad de que pertenezca al club musical.
85 Teorema de Bayes Tomando en cuenta las condiciones anteriores se cumple que: Si las cosas que pueden ocurrir las tenemos clasificadas en los sucesos Ai de los cuales conocemos sus probabilidades P(Ai), y se observa un suceso A, la fórmula de Bayes nos da las probabilidades de los sucesos Ai , ajustadas o modificadas por A.
86 Variables Aleatorias TiposVariables que pueden tomar diferentes valores y el valor tomado es totalmente al azar. Tipos Discretas: Solo toman valores enteros y un número finito de ellos. Continuas: Pueden tomar tanto valores enteros como fraccionarios y un número infinito de ellos.
87 Función de ProbabilidadEs la ley que asocia a cada valor de la variable aleatoria X su probabilidad. Se define
88 Función de DistribuciónEs la ley que asocia a cada valor de la variable aleatoria X, la probabilidad acumulada de este valor . Se define: Propiedades:
89 Función de probabilidad discretaCaracterísticas:
90 Función de Distribución DiscretaSiendo X una variable aleatoria discreta, se define: Propiedad:
91 Ejemplo En una bolsa hay bolas numeradas : 9 bolas con un 1 , 5 con un 2 y 6 con un 3 . Sacamos una bola y vemos que número tienen. xi 1 2 3 Pi 9/20 5/20 6/20 Función de Probabilidad xi 1 2 3 Fi 9/20 14/20 20/20 Función de Distribución
92 Otras característicasMedia de una variable aleatoria discreta: Varianza de una variable aleatoria discreta:
93 Distribución ContinuaFunción de densidad f(x): cuando en un histograma de frecuencias relativas de una variable continua aumentamos el nº de clases, vemos que el polígono de frecuencias relativas se acerca a una función f(x) que llamaremos función de densidad y cumple las siguientes propiedades :
94 Función de Distribución ContinuaDefinición: Propiedades:
95 Otras característicasMedia de una variable aleatoria continua: Varianza de una variable aleatoria continua:
96 Análisis de Varianza
97 Propósito Esta técnica permite la comparación de la media de varios grupos de una variable cuantitativa. Se trata de una generalización de la t de Student para dos muestras independientes. En general, se tendrá una variable nominal (independiente) que formará los grupos a comparar y una cuantitativa continua (dependiente) cuyo valor medio se comparará en los grupos.
98 Estrategia de SoluciónUna forma de comparar las medias en cada grupo es comparar la variación de la media entre los grupos con la variación de las unidades dentro de los grupos. ¿Es la variación de la media entre los grupos mayor que la variabilidad detro de los grupos?
99 Fuentes de Variación La mayor parte de la variación es debida a las variaciones inherente que existe entre los individuos Parte de la variación es del efecto de los tratamientos. Generan Los pacientes que reciben el mismo tratamiento Variaciones dentro del grupo Los que reciben diferentes tratamientos Variaciones entre los grupos
100 Midiendo la Variación Variación dentro de los gruposLa variación entre grupos Variación de los sujetos (azar) Variación por el efecto de los tratamientos Variación dentro de los grupos = +
101 Supuestos del modelo Independencia: Cada conjunto de datos son muestras aleatorias de poblaciones por tanto todas las variables y las observaciones son independientes entre sí. Normalidad: Cada una de las poblaciones de las cuales provienen las muestras deben estar normalmente distribuidas. Homocedasticidad: La varianza de las poblaciones de donde proceden las muestras deben ser homogéneas, iguales.
102 Notaciones Estudiamos k grupos clasificados de acuerdo a los niveles 1,2... k del factor. En cada nivel tenemos n1, n2, ... nk observaciones independientes y obtenidas de forma aleatoria. Si designamos de forma general cada observación como yij, el subíndice i indica el grupo al que pertenece, j es el número de la observación dentro de ese grupo. Si juntamos todas las observaciones N=n1+n2+...+nk, calculamos la media global que vamos a denominar . También podemos calcular la media dentro de cada uno de los k grupos. La media para el grupo i la designamos como
103 Estructura de los datos1 2 … k Categorías Observaciones Total Media
104 Plantamiento de las hipótesis
105 Estimadores El ANOVA se define como un proceso mediante el cual la variación total se descompone en componentes atribuibles a diferentes fuentes Suma de Cuadrado dentro del grupo Suma de Cuadrado entre los grupos
106 Suma de cuadrado dentroSuma de cuadrado dentro de grupo: Es la desviación al cuadrado de cada observación del grupo con relación a su media. También se conoce con el nombre de cuadrado residual o error. Suma de cuadrado entre grupos: Es la suma de las desviaciones al cuadrado de la media particular de cada grupo con respecto a la media total. Suma de cuadrado total Suma de cuadrado dentro Suma de cuadrado entre + =
107 Para estimar las varianzas, es necesarios dividir los términos entre sus grados de libertad, dando como resultado el cuadrado medio. Cuadrado Medio Total CMtotal Cuadrado Medio Entre CMentre Cuadrado Medio Entre CMentre
108 Test Estadístico Bajo H0 , el cuadrado medio entre y dentro deben ser prácticamente iguales. Si hubiese efecto de algún tratamiento, el cuadrado medio entre grupos sería mayor que el cuadrado medio dentro. Se construye entonces el estadístico: 1, bajo la hipótesis nula >1, si difieren las medias
109 Distribución del test El estadígrafo de prueba es una razón de varianzas y, bajo la hipótesis nula sigue una distribución F de Fisher. G.L de CMentre G.L de CMdentro La regla de desición en este caso es: Rechazar H0 si la F calculada > F tabulada.
110 Tabla ANOVA N-1 Total N-k Dentro de Grupos k-1 Entre GruposRazón de Varianzas Cuadrado Medio GL Suma de Cuadrados Fuente de Variación
111 Ejemplo En un experimento para comparar los efectos de tres tratamientos alimentarios en niños menores de un año, un grupo de 10 niños se alimentó con leche materna (LM), otro con fórmula basal (FB) y el siguiente con fórmula de leche con nucleótidos suplementarios (FNS). Después de 4 semanas se midieron los niveles de unidad de lipoproteínas en mg/dl. Los resultados fueron los siguientes: LM 56 63 45 41 71 60 78 50 68 62 FB 40 48 38 28 44 66 22 54 FNS 57 64 73 79 67 84 61
112 Tabla ANOVA 224.84 29 6520.4 Total 7.091 27 4274.9 Dentro de Grupos 1122.7 2 2245.4 Entre Grupos Razón de Varianzas Cuadrado Medio GL Suma de Cuadrados Fuente de Variación
113 Regla de Decisión
114 Conclusiones Lo que nos permite concluir de que existe diferencias entre los niveles de lipoproteínas que generan los tres regímenes alimentarios comparados. Gran parte de la variación total observada en los datos puede ser atribuida al efecto de los tratamientos con un nivel de confiabilidad del 95%.