Trabajo estadística. Correlación entre variables cualitativas y cuantitativas

13 septiembre 2024

 

AUTORES

  1. Teresa Sicart Llombart. Enfermera. Alcañiz, Teruel.
  2. Andrea Yera Monfort. Enfermera.
  3. Lucía Martínez Perales. Enfermera.
  4. Eva Riveres Fernández. Enfermera.
  5. María Pomareta Pablos. Enfermera.
  6. Isabel Navarro Soler. Enfermera.

 

RESUMEN

En este trabajo se han estudiado características sobre una determinada muestra de personas de más de 18 años. Los entrevistados son allegados míos, tales como familiares, amigos, pareja…

Los datos que recogimos sobre ellos fueron: edad, sexo, altura (en cm), peso(kg), envergadura (en cm), perímetro de la cintura(cm), perímetro de la cadera (en cm), horas dedicadas al uso de redes sociales excluyendo WhatsApp, horas diarias permanecidas sentado, horas semanales dedicadas a hacer ejercicio y la frecuencia semanal con la que tomaban cierto tipo de alimentos.

A partir de esta información hice un filtrado con el que eliminamos los datos erróneos, debidos a incorrectas mediciones. A continuación, creamos una base de datos con toda esta información en R Comander. Gracias a este programa pudimos crear nuevas variables, realizar codificaciones…para el posterior análisis.

PALABRAS CLAVE

Análisis, variable y correlación.

ABSTRACT

In this work we have studied the characteristics of a sample of people over 18 years of age. The interviewees are close relatives of mine, such as family members, friends, partners….

The data we collected about them were: age, sex, height (in cm), weight (kg), wingspan (in cm), waist circumference (cm), hip circumference (in cm), hours spent using social networks excluding WhatsApp, daily hours spent sitting, weekly hours spent exercising and the weekly frequency with which they are certain types of food.

From this information I filtered out the erroneous data due to incorrect measurements. We then created a database with all this information in R Comander. Thanks to this program we were able to create new variables, make codifications… for the subsequent analysis.

The aim of the work is to describe and study variables of the sample.

KEY WORDS

Analysis, variable and correlation.

INTRODUCCIÓN

En primer lugar, se ha hecho un análisis completo de las variables: Sexo, Uso red, Sentado y Edad. La finalidad de este apartado es estudiar por separado las 2 primeras variables cualitativas y las dos últimas cuantitativas

En segundo lugar, se ha llevado a cabo un análisis descriptivo completo de la variable Sentado (comparando la distribución entre hombres y mujeres) y de la variable Edad entre los niveles de Uso red (normal y excesivo). Es decir, se ha realizado un estudio de una variable cuantitativa en función de una cualitativa en ambos casos.

Posteriormente se ha realizado un estudio de la variable Sexo y Uso red, el objetivo de este apartado era ver la relación de estas dos variables cualitativas.

Por último, se ha realizado un estudio entre dos variables cuantitativas, Edad y Peso. Su finalidad es comprobar si hay dependencia lineal y en caso de haberla construir una recta de regresión. Luego se ha repetido el ejercicio diferenciando entre hombres y mujeres.

El interés de este trabajo está en observar las relaciones existentes entre las diferentes variables.

OBJETIVO

El objetivo del trabajo es describir y estudiar variables de la muestra con el objetivo de ver cómo se correlacionan entre ellas. En cada uno de los apartados se estudian unas distintas ya sean variables cualitativas como cuantitativas.

METODOLOGÍA

En cada uno de los ejercicios aparecen capturas de como se han llegado a los resultados con la utilización de R commander.

DESARROLLO

1.ANÁLISIS DESCRIPTIVO UNIVARIANTE.

1.1. VARIABLE SEXO.

Comenzaremos describiendo la variable sexo, la cual es una variable categórica nominal.

Los gráficos que nos pueden ser útiles para describir esta variable son el diagrama de sectores y el de barras. En este caso he optado por utilizar el de sectores como bien se observa a continuación. Gracias a él es más fácil observar visualmente que la mayoría de los entrevistados pertenecen a la modalidad “Mujer”.

Posteriormente he calculado la tabla de frecuencias que nos aporta información como que hay 39 hombres y 65 mujeres, los cuales tienen respectivamente estos porcentajes: 37.5% y 62.5%.

Fotografía 1.

Tabla de frecuencias:

counts:

SexoRec

Hombre Mujer

39 65

percentages:

SexoRec

Hombre Mujer

37.5 62.5

1.2. VARIABLE USORED:

En este apartado haremos el análisis descriptivo univariante de la variable Usored.

Es una variable cualitativa ya que a partir de las horas semanales que los entrevistados dedicaban al uso de redes sociales, nosotros hemos creado dos grupos los que hacen uso excesivo y uso normal de las redes

Dado que es una variable cualitativa nominal y con pocas modalidades he optado por crear un gráfico de sectores. En ellos el tamaño de cada sector es proporcional a la frecuencia de cada una de las variables.

Tras haber visualizado el gráfico se observa que la modalidad que presenta una mayor frecuencia es la de uso excesivo de las redes (51.99%) que la de uso normal (40.08%).

Fotografía 2.

counts:

Usored

Normal Excesivo

50 54

percentages:

Usored

Normal Excesivo

48.08 51.92

Me ha parecido interesante calcular los datos númericos de la variable Redes, que es apartir de la cual luego hemos creado la de UsoRedes con los grupos de uso excesivo y normal.

La variable Redes es cuantitativa por ello he obtenido los resúmenes numéricos (no era ejercicio necesario, pero repito que lo he calculado porque me ha parecido interesante):

mean sd IQR cv skewness kurtosis 0% 25% 50% 75% 100% n

15.29808 11.85808 23 0.7751356 0.476704811.858080 5 14 28 49 104

La media de horas semanales dedicadas al uso de las redes es 15.3 y la desviación típica es 11.86.

1.3. VARIABLE SENTADO:

Ahora describiremos la variable Sentado.

Es cuantitativa puesto que recoge las horas diarias que permanecen sentados los entrevistados.

Los resúmenes numéricos serían estos:

mean sd IQR cv skewness kurtosis 0% 25% 50% 75% 100% n

8.995192 3.460242 4 0.3846769 0.2219479 -0.1276127 2 7 9 11 17 104

La media de horas que permanecen sentados los entrevistados es de casi 9 horas diarias. Y la desviación típica es de 3.46.

Si nos fijamos en el diagrama de caja parece que exista cierta simetría. Sin embargo, si observamos el histograma parece que haya una pequeña cola a la derecha, no mucha, pero lo suficiente como para que nos hayamos dado cuenta.

Para aclarar esta pequeña ambigüedad entre los gráficos nos fijaremos en el coeficiente de simetría que aparece en los resúmenes numéricos. Su valor es de 0.223, nos confirma que existe cierta asimetría hacia la derecha.

Por último, cabe comentar que su mediana es de 7, lo cual nos dice que la mitad de la muestra permanecerían al menos 7 horas o menos sentados y la otra mitad 7 horas o más.

Para observar la distribución de esta variable he optado por utilizar el gráfico de caja, donde de manera visual se ven los cuartiles, la mediana (coincide con el cuartil dos con el método average) y los máximos y mínimos:

Fotografía 3.

-Como he comentado en el análisis en este gráfico parece que hay simetría.

Otra representación gráfica podría ser el histograma o tallo y hojas ya que es cuantitativa:

Fotografía 4.

En el histograma se aprecia un poco de asimetría hacia la derecha.

1 | 2: represents 1.2

leaf unit: 0.1

n: 104

3 2 | 000

7 3 | 0000

10 4 | 000

15 5 | 00000

23 6 | 00000000

36 7 | 0000000000000

47 8 | 00000000000

(9) 9 | 000000005

48 10 | 00000000000000000000

28 11 | 0000000

21 12 | 00000000

13 13 | 0

12 14 | 0

11 15 | 000000

5 16 | 000

2 17 | 00

1.4. VARIABLE EDAD:

Ahora describiremos la variable Edad.

Se trata de una variable cuantitativa continua (puesto que hemos contabilizado los meses y entonces aparecen decimales).

Los resúmenes estadísticos serían: (está en letra tan pequeña porque si no aparecía en dos filas y era más difícil de visualizar).

mean sd IQR cv skewness kurtosis 0% 25% 50% 75% 100% n

28.70272 14.88638 25.9375 0.51864 0.9993611 -0.8092915 11.33333 18.66667 19.375 44.60417 59.58333 104

La media de la edad de los entrevistados es aproximadamente 28.7 años y la desviación típica de casi 14.9. La mediana es 19.38, lo que quiere decir que al menos la mitad tiene menos de 19 años aproximadamente y la otra mitad igual o más a 19.

Si observamos los gráficos hay una cierta heterogeneidad en torno a los 18 /19 años y en torno a los 70. Dado que ocurre esto ni el CV ni el CV nos aportan mucha información.

El coeficiente de simetría es de 0.9993611, lo que significa asimetría hacia la derecha como se muestra en el histograma:

Fotografía 5.

Otra forma de representar la variable sería el diagrama de caja. En ella de manera visual se observan entre otros datos los cuartiles y mediana que es 19.38.

Fotografía 6.

2.ANÁLISIS DESCRIPTIVO POR ESTRATOS.

2.1. VARIABLES SENTADO Y SEXO:

En este apartado realizaremos el análisis de la variable Sentado en función del Sexo.

A continuación, se muestra el diagrama de caja y el histograma de las horas permanecidas sentado en función del sexo:

Llaman la atención algunos atípicos del diagrama de caja de mujeres puesto que los datos 66,72 y 73 corresponden a personas que permanecen 15,16 y 17 horas sentadas respectivamente. Cabe añadir que la mujer del dato 66 tiene 25 años y las de los datos 72 y 73 tienen 18.

Fotografía 7.

Fotografía 8.

mean sd IQR cv skewness kurtosis 0% 25% 50% 75% 100% Sentado:n

Hombre 8.871795 3.473050 4 0.3914710 0.3677322 -0.4046747 3 7 8.0 11 16 39

Mujer 9.069231 3.477469 3 0.3834359 0.1423643 0.1297256 2 7 9.5 10 17 65

Como bien hemos visto anteriormente en la descripción de la variable Sexo una vez convertida ya en factor, el número de mujeres entrevistadas es mayor que el de los hombres. Si analizamos las horas que permanecen sentados los entrevistados diferenciando según sean mujeres y hombres, obtenemos que la media de las mujeres es de 9.07 mientras que la de los hombres es de 8.87, por tanto, mayor en las mujeres que en los hombres.

La desviación típica es aproximadamente la misma para ambos grupos, 3.473 para hombres y 3.477 para mujeres.

Con respecto al CV Cabe comentar que es de para los hombres 0.3914710 y de0.3834359 para las mujeres, aunque sea poca hay mayor dispersión en los hombres que en las mujeres (en torno a sus medias)

Dado que tanto la media como la desviación típica son dos buenas medidas es correcto calcular el coeficiente de simetría, siendo en mujeres (0.1423643) y en los hombres (0.3677322). Esto nos dice que hay una mayor asimetría hacia la derecha en el grupo de hombres que en el de mujeres. No es considerado como asimetría, para que fuese marcada en el grupo de los hombres tendría que ser de mas de 0.78 en valor absoluto para hombres y de 0.60 en valor absoluto para mujeres. Esto lo he calculado a partir de la fórmula que salía en la nota de la práctica.

Finalmente, su media, la cual coincide con el percentil 50, es 8 en hombres y 9.5 en mujeres. A través de ambos diagramas de caja vemos que es mayor en mujeres que en hombres.

2.2.VARIABLES EDAD Y USORED:

A continuación, se observa el estudio realizado de la variable Edad entre los niveles de la de Usored.

mean sd IQR cv skewness kurtosis 0% 25% 50% 75% 100% Edad:n

Normal 36.37833 16.34008 32.520833 0.4491708 0.03680046 -1.855090 16.16667 19.20833 38.45833 51.72917 59.58333 50

Excesivo 21.59568 8.76209 1.041667 0.4057335 3.13864719 9.042325 11.33333 18.50000 19.00000 19.54167 54.00000 54

En este apartado vamos a estudiar la variable edad entre los grupos de personas que hacen un uso excesivo y normal del uso de las redes sociales. 50 personas pertenecen al grupo de uso normal y 54 al de excesivo

La media de la edad de las personas que hacen un uso normal de las redes sociales es de 36.38 mientras que en el de las que hacen un uso excesivo la edad media es de 21.6. Con eso podemos decir que los jóvenes tienen más a utilizar las redes. La desviación típica es mayor en el grupo de los que hacen un uso normal (16.34008) que de los que hacen un uso excesivo (8.76209). Dado que tanto la media como la desviación típica son buenas medidas, el coeficiente de variación y de simetría tendrá sentido analizarlo.

El coeficiente de variación, es decir, la dispersión relativa en torno a su media, es un poco mayor en los entrevistados que hacen un uso normal (0.45) que de los que hacen uso excesivo (0.406).

Fijándonos en el coeficiente de asimetría observamos que en el grupo de los que hacen uno normal es pequeño y próximo a cero (0.03680046), por lo que se podríamos decir que es más o menos simétrica. Por otra parte, si nos fijamos en el grupo de los que hacen uso excesivo es asimétrica hacia la derecha por ser un número grande y positivo (3.13864719).

Por último, el percentil 50, y por tanto la mediana de la edad es de 38.46 en los que hacen uso normal y de 19 en los que hacen uso excesivo.

Para completar toda esta información de manera visual, a continuación, se muestran los histogramas y diagramas de caja:

Fotografía 9.

Con este gráfico observamos lo que hemos comentado anteriormente, mayor simetría en el conjunto de personas que hacen uso normal.

Fotografía 10.

-En el diagrama de caja de uso excesivo de la red llaman la atención algunos aspectos atípicos en el diagrama de caja de uso excesivo. Por ejemplo, el dato 11 corresponde a una persona que dedica unas 40 horas semanales al uso de las redes.

Diagrama de tallo y hojas:

1 | 2: represents 12, leaf unit: 1

Edad[Usored == «Normal»] Edad[Usored == «Excesivo»]

_________________________________________________________________________________________________________

| 1* |1 1

16 9999999888888886| 1. |888888888888888888888889999999999999999999 (42)

21 11000| 2* |001224 11

24 975| 2. |7 5

(1) 3| 3* |

| 3. |

(2) 43| 4* |4 4

23 998665| 4. |

17 44432111110| 5* |234 3

6 988766| 5. |

| 6* |

_________________________________________________________________________________________________________

n: 50 54

____________________________________________________________________________________________________

3.ANÁLIS CONJUNTO DE DOS VARIABLES CUALITATIVAS.

3.1. ANALISIS CONJUNTO DE LA VARIABLES SEXO Y USORED:

Vamos a realizar un estudio de la variable sexo y la escogida en el 2.2, que en mi caso Usored.

Como podemos observar son dos variables cualitativas, por tanto, para su estudio realizaremos una tabla de contingencia, un gráfico de barras y el test de independencia.

A continuación, aparece la tabla de contingencia:

requency table:

Usored

SexoRec Normal Excesivo

Hombre 17 22

Mujere 33 32

Row percentages:

Usored

SexoRec Normal Excesivo Total Count

Hombre 43.6 56.4 100 39

Mujere 50.8 49.2 100 65

Pearson’s Chi-squared test

data: Table

X-squared = 0.50331, df = 1, p-value = 0.478

A partir de estos datos podemos afirmar que hay un mayor número de mujeres que hacen un uso normal de las redes (33) que de hombres (17). Si quisiéramos dar esta información en porcentajes serían 50.8% %y respectivamente 43.6%.

Pero ocurre exactamente lo mismo en uso de redes excesivo, hacen más uso las mujeres (32), frente a los (22) hombres. Y en porcentajes serían 49.2%y 56.4% respectivamente.

Posteriormente he realizado el gráfico de barras, que nos permite comparar gráficamente la distribución de una variable para los diferentes niveles o categorías de la otra.

Fotografía 11

Este tipo de gráficos es muy útil, pues nos da información visual. Gracias a él corroboramos que las mujeres hacen un mayor uso de redes tanto normal como excesivo que los hombres.

3.2. ¿LA VARIABLE USORED ES INDEPENDIENTE DE LA VARIABLE SEXO?

Después de saber toda esta información con respecto a las dos variables cualitativas, conviene saber si entre ellas existe dependencia o independencia. Interesa saber si la distribución de una de ellas es la misma en cada uno de los niveles de la otra, para ello utilizamos el contraste de independencia. Este contraste plantea la hipótesis nula, que afirma que las variables son independientes en la población de la que se ha extraído la muestra, frente a la hipótesis alternativa de que no lo son. Como norma general, se rechaza la hipótesis nula cuando el p-valor es inferior a 0.05.

Para estudiarlo nos fijamos en el p-value que es 0.478 (obtenido en la tabla de contingencia). Dado que es un valor muy grande y superior a 0.05, podremos retener la hipótesis nula, es decir hay independencia. Esto significa que saber si es hombre o mujer, no aporta información acerca del uso de red que realiza y viceversa.

4. ANÁLISIS CONJUNTO DE DOS VARIABLES NUMÉRICAS.

4.1. VARIABLES EDAD Y ALTURA:

En este último apartado realizaremos un análisis de la relación existente entre la variable del apartado 2.4, que en mi caso es Edad y la altura.

Son dos variables cuantitativas y lo primero que haremos será construir el diagrama de dispersión que permitirá obtener información visual sobre el tipo de relación existente entre dos variables de tipo continuo y, además, sirven para detectar posibles datos atípicos.

Fotografía 12.

Este es el diagrama de dispersión obtenido. He seleccionado la opción de interactuar con el ratón, de esta manera yo he podido seleccionar los que me parecían atípicos. En este caso el único que me ha llamado la atención es el dato 68, que corresponde a una persona que tiene 16 años y mide 189 cm. Vamos a considerar que no es erróneo porque hemos preguntado y la información que hemos obtenido es verídica.

A primera vista ya se puede observar que no parece que hay mucha relación entre estas dos variables.

A continuación, calculamos el coeficiente de correlación lineal simple entre las variables en estudio, con la finalidad de cuantificar el grado de relación existente entre ellas.

Pearson correlations:

Altura Edad

Altura 1.0000 -0.1511

Edad -0.1511 1.0000

Number of observations: 104

Pairwise two-sided p-values:

Altura Edad

Altura 0.1259

Edad 0.1259

Adjusted p-values (Holm’s method)

Altura Edad

Altura 0.1259

Edad 0.1259

La matriz inicial (Pearson correlations) contiene 1 en la diagonal principal de la matriz (tiene sentido, ya que el coeficiente de correlación de una variable consigo misma es 1); y fuera de la diagonal obtenemos el coeficiente de correlación de la Altura y la Edad, que es -0.1511. A continuación, aparecen los p-valores. Como he dicho antes, un p-valor siempre va asociado a un contraste de hipótesis.

En este caso el p-value toma el valor de 0.1259(no habría relación lineal entre las variables).

Es un resultado que no sorprende mucho, ya habíamos visto en el diagrama de dispersión que aparentemente no existía relación.

Al ser dos variables en las que no haya relación lineal no calculamos la recta de regresión.

4.2. VARIABLES EDAD Y PESO.

Puesto que no ha salido que hay relación lineal y en este ejercicio interesa que sí que la haya para luego calcular la recta de regresión de una variable en función de la otra lo que he hecho ha sido repetirlo, pero en vez de con la altura con el peso.

Vamos a realizar el análisis entre la variable Edad y Peso.

Al principio puede parecer que no haya relación, pero me llamó la atención que en ciertos artículos dijesen que cuanto más mayor te haces, mayor tendencia a engordar. Es por ello que he escogido estas variables, para ver si eso podía ser verdad en mis entrevistados. (Los artículos aparecen en la bibliografía).

En primer lugar, construiremos el diagrama de dispersión (yo he seleccionado la opción de detectar atípicos interactuando con el ratón).

Fotografía 13.

Como se puede ver, los dos datos que llaman más la atención son 84 y 26. El primero corresponde a alguien que tiene 19 años y pesa 115 Kg, mientras que el segundo corresponde a una persona que tiene 54 años y pesa 110 Kg. Vamos a considerar que son atípicos y que por tanto los tenemos que eliminar del conjunto de datos para seguir realizando el estudio.

El diagrama de dispersión obtenido habiendo quitado los datos considerados como atípicos es:

Fotografía 14.

En el gráfico podemos observar varios grupos: el de los jóvenes (menos de 25 años) y los de más mayores (más de 45). Por otro lado, hay una zona central en la que casi no hay datos entre los 25 y 45. En concreto de gente de 40 años no hay datos. Es por ello que me faltaría tener más muestra entre estas edades para poder realizar un estudio más completo.

Como se puede ver entre el grupo de los jóvenes no hay relación lineal al igual que no lo hay entre las personas de mayor edad, sin embargo, es curioso como entre ambos grupos sí que parece que la haya.

Para ver si existe o no relación entre estas dos variables hemos calculado la matriz de correlación.

Pearson correlations:

Edad Peso

Edad 1.0000 0.3903

Peso 0.3903 1.0000

Number of observations: 102

Pairwise two-sided p-values:

Edad Peso

Edad <.0001

Peso <.0001

Adjusted p-values (Holm’s method)

Edad Peso

Edad <.0001

Peso <.0001

Podríamos realizar en vez de la matriz de correlación otro método como el test de correlación:

Pearson’s product-moment correlation.

data: Edad and Peso

t = 4.2395, df = 100, p-value = 0.00005001

alternative hypothesis: true correlation is not equal to 0

95 percent confidence interval:

0.2119344 0.5435380

sample estimates:

cor

0.3903219

> 0.3903219*0.3903219

[1] 0.1523512

La matriz inicial (Pearson correlations) contiene 1 en la diagonal principal de la matriz (tiene sentido, ya que el coeficiente de correlación de una variable consigo misma es 1); y fuera de la diagonal obtenemos el coeficiente de correlación de la Edad y Peso, que es 0.3903.

A continuación, aparecen los p-valores. Como he dicho antes, un p-valor siempre va a asociado a un contraste de hipótesis. Para rechazar la hipótesis nula el p-valor tendría que ser menor a 0.05.

Como vemos en la salida, el p-valor es muy pequeño (0,0001), con lo que concluimos que sí hay relación lineal entre las variables (eso no quiere decir que la relación lineal sea muy fuerte).

Residuals:

Min 1Q Median 3Q Max

-19.954 -7.102 -2.374 7.241 25.093

Coefficients:

Estimate Std. Error t value Pr(>|t|)

(Intercept) 56.02503 2.26932 24.69 < 2e-16 ***

Edad 0.29963 0.07068 4.24 0.00005 ***

Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ‘ 1

Residual standard error: 10.5 on 100 degrees of freedom

Multiple R-squared: 0.1524, Adjusted R-squared: 0.1439

F-statistic: 17.97 on 1 and 100 DF, p-value: 0.00005001

Tras obtener esta información únicamente nos vamos a centrar en tres datos. El primero es el que aparece al lado de Intercept que sería el término independiente (56.03).

En segundo lugar, nos fijamos en el dato que hay justo debajo que es el valor de la pendiente (0.3). La pendiente es interesante explicarla, ya que nos dice que cada año aumenta en 0.3. Dato que tiene sentido.

Por último, podemos ver el coeficiente de determinación, que coincide con el cuadrado de coeficiente de correlación. En este caso es 0.1524, lo que quiere decir que explicaría el 0.152(redondeando a tres decimales) de la variabilidad del peso en función de la edad.

PESO=56.02503+0.29963*Edad.

Si posteriormente quiero comprobar si el modelo de la recta de regresión es correcto debería construir un diagrama de dispersión de los residuos. La recta de regresión nos da 0, cosa que no es de extrañar. Tenemos que comprobar que los valores positivos y negativos están distribuidos de manera aleatoria alrededor del 0.

Fotografía 15.

4.3. VARIABLES EDAD Y PESO PARA HOMBRES Y MUJERES:

En muchas ocasiones interesa estudiar si el comportamiento de dos variables de tipo continuo (en cuanto a su diagrama de dispersión o recta de regresión) es el mismo para los grupos de población definidos por una tercera variable de tipo cualitativo. Es por ello que ahora repetiremos el ejercicio, pero con la salvedad de que ahora el estudio lo realizaremos distinguiendo la relación que hay entre Peso y Edad en los hombres y luego en las mujeres. Nos vamos a plantear si la relación entre las variables será el mismo par estos dos grupos.

En primer lugar, construiremos el diagrama de dispersión:

Fotografía 16:

Lo primero que me llama la atención de este gráfico es el que a pesar de que ambas rectas empiecen y acaben en diferentes lugares, son prácticamente paralelas lo que nos adelanta que la pendiente no será muy diferente.

No tienen la misma recta ni hombres ni mujeres por lo que tiene sentido hacer un estudio para los hombres y para las mujeres por separado. Es por lo que he filtrado el fichero para hacer un estudio únicamente de hombres y luego para mujeres.

4.3.1. VARIABLES EDAD Y PESO PARA HOMBRES:

Voy a comenzar realizando el estudio de los hombres. Para ello voy a calcular la matriz de correlación:

Pearson correlations:

Edad Peso

Edad 1.0000 0.4027

Peso 0.4027 1.0000

Number of observations: 37

Pairwise two-sided p-values:

Edad Peso

Edad 0.0135

Peso 0.0135

Adjusted p-values (Holm’s method).

Edad Peso

Edad 0.0135

Peso 0.0135

La matriz inicial (Pearson correlations) contiene 1 en la diagonal principal de la matriz (tiene sentido, ya que el coeficiente de correlación de una variable consigo misma es 1); y fuera de la diagonal obtenemos el coeficiente de correlación de la Edad y Peso, que es 0.403

O bien podría haber estos datos calculando la matriz de correlación o el test de correlación:

Pearson’s product-moment correlation

data: Edad and Peso.

t = 2.603, df = 35, p-value = 0.01346

alternative hypothesis: true correlation is not equal to 0

95 percent confidence interval:

0.09051548 0.64285588

sample estimates:

cor

0.4027231

> 0.4027231*0.4027231

[1] 0.1621859

Recordamos que un p-valor siempre va asociado a un contraste de hipótesis. Para rechazar la hipótesis nula el p-valor tendría que ser menor a 0.05.

Como vemos en la salida, el p-valor es muy pequeño (0.0135) con lo que concluimos que sí hay relación lineal entre las variables, aunque no sea muy fuerte. También observamos que el coeficiente de coeficiente de correlación es 0.4027231 y su cuadrado 0.1621859.

Como hemos afirmado que hay relación lineal calcularemos la recta de regresión

Call:

lm(formula = Peso ~ Edad, data = Hombres)

Residuals:

Min 1Q Median 3Q Max

-25.9068 -5.0724 0.1008 9.1367 17.3106

Coefficients:

Estimate Std. Error t value Pr(>|t|)

(Intercept) 64.7189 3.6093 17.931 <2e-16 ***

Edad 0.2813 0.1081 2.603 0.0135 *

Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ‘ 1

Residual standard error: 10.34 on 35 degrees of freedom

Multiple R-squared: 0.1622, Adjusted R-squared: 0.1382

F-statistic: 6.775 on 1 and 35 DF, p-value: 0.01346

Solo nos van a interesar 3 constantes como he dicho antes. El primero es el que aparece al lado de Intercept que sería el término independiente (64.7189).

En segundo lugar, nos fijaremos en el dato que hay justo debajo que es el valor de la pendiente (0.2813), que por cada año aumenta 0.28.

Por último, podemos ver el coeficiente de determinación, que coincide con el cuadrado de coeficiente de correlación. En este caso es 0.1622, lo que quiere decir que explicaría el 0.162(redondeando a tres decimales) de la variabilidad del peso en función de la edad para los hombres. Podemos comprobar que este dato ya lo habíamos calculado antes y, por tanto, es correcto.

PESO HOMBRES=64.7189+0.2813*Edad.

4.3.2. VARIABLES EDAD Y PESO PARA MUJERES

Pearson correlations:

Edad Peso

Edad 1.0000 0.4761

Peso 0.4761 1.0000

Number of observations: 65

Pairwise two-sided p-values:

Edad Peso

Edad <.0001

Peso <.0001

Adjusted p-values (Holm’s method)

Edad Peso

Edad <.0001

Peso <.0001

La matriz inicial (Pearson correlations) contiene 1 en la diagonal principal de la matriz (tiene sentido, ya que el coeficiente de correlación de una variable consigo misma es 1); y fuera de la diagonal obtenemos el coeficiente de correlación de la Edad y Peso, que es 0.4761.

O bien podría haber estos datos calculando la matriz de correlación o el test de correlación:

Pearson’s product-moment correlation

data: Edad and Peso

t = 4.2966, df = 63, p-value = 0.0000612

alternative hypothesis: true correlation is not equal to 0

95 percent confidence interval:

0.2626470 0.6450537

sample estimates:

cor

0.4760506

> 0.4760506*0.4760506

[1] 0.2266242

Como vemos en la salida, el p-valor es muy pequeño (0.0001) con lo que concluimos que sí hay relación lineal entre las variables, aunque no sea muy fuerte. También observamos que el coeficiente de correlación es 0.4760506 y su cuadrado 0.2266242.

Construimos la recta de regresión:

Call:

lm(formula = Peso ~ Edad, data = Mujeres)

Residuals:

Min 1Q Median 3Q Max

-14.7214 -5.1246 0.4803 3.0679 19.9219

Coefficients:

Estimate Std. Error t value Pr(>|t|)

(Intercept) 51.9656 2.0347 25.539 < 2e-16 ***

Edad 0.2789 0.0649 4.297 0.0000612 ***

Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ‘ 1

Residual standard error: 7.362 on 63 degrees of freedom

Multiple R-squared: 0.2266, Adjusted R-squared: 0.2143

F-statistic: 18.46 on 1 and 63 DF, p-value: 0.0000612

Solo nos van a interesar 3 constantes, como he dicho antes. El primero es el que aparece al lado de Intercept que sería el término independiente (51.9656).

En segundo lugar, nos fijaremos en el dato que hay justo debajo que es el valor de la pendiente (0.2789), por cada año aumenta en 0,279. (Es un pelín menor que en la de los hombres).

Por último, podemos ver el coeficiente de determinación, que coincide con el cuadrado de coeficiente de correlación. En este caso es 0.2266, lo que quiere decir que explicaría el 0.227(redondeando a tres decimales) de la variabilidad del peso en función de la edad para las mujeres.

PESO MUJERES: 51.9656+0.2789 * Edad.

CONCLUSIONES

En el ejercicio dos se ha realizado como hemos visto un análisis completo de dos variables cualitativas y dos cuantitativas.

Tras haber estudiado la variable cualitativa sexo podemos decir que es mayor el número de mujeres entrevistadas que el de hombre, 37.5% y 62.5% respectivamente.

En el estudio de la variable Usored hemos podido comprobar que se hace más uso excesivo (51.92%) que uso normal de las redes (20.08), aunque como bien podemos observar tanto en los porcentajes como el diagrama de sectores no es mucha la diferencia.

Con respecto al estudio de la variable cuantitativa Sentado se puede decir que la media de horas diarias que permanecen sentados los entrevistados es de casi 9 y que existe cierta asimetría a la derecha como se puede comprobar visualizando el histograma.

De la variable cuantitativa Edad podemos extraer información interesante como que la media de los entrevistados es de 28.7 años aproximadamente y que como ocurre con la variable anterior existe cierta asimetría en la derecha observable en el diagrama de caja.

En el tercer ejercicio se ha realizado el estudio de la variable sentado en función del sexo. Los datos obtenidos nos dicen que permanecen más horas sentadas las mujeres que los hombres con unas medias de 9.07 horas y 8.87 en hombres. También podemos añadir que hay una mayor asimetría en el grupo de los hombres que en el de las mujeres.

En el segundo apartado del ejercicio tres se ha llevado a cabo el análisis de la variable Edad entre los niveles de la variable Uso red. Tras realizar el estudio podemos afirmar que los jóvenes hacen un mayor uso de las redes, la media de uso normal es en 36.38 años mientras que la de uso excesivo es en 21.6 años. También se puede añadir que existe simetría en el uso normal mientras que en el de uso excesivo hay asimetría a la derecha.

En el ejercicio cuatro se ha llevado a cabo el Analís de dos variables cualitativas: Sexo y Usored. El gráfico de barras y la tabla de contingencia nos dan información como que existe un mayor porcentaje de mujeres que hacen un uso normal que hombres, 50.8% y 43.6 respectivamente. Lo mismo ocurre con el uso excesivo, hay un mayor número de mujeres (56.4%) que de hombres (49.2%). Por otra parte, gracias al p-value que es de 0.478 hemos podido concluir que no existe relación lineal entre las variables, retenemos la hipótesis nula puesto que es mayor que 0.05.

Por último, en el quinto ejercicio se han analizado las dos variables cuantitativas: Edad y Peso. A primera vista parece que no tengan relación, pero al realizar el estudio vemos que sí. No existe relación lineal entre el grupo de jóvenes y en el de los mayores, pero si la hay entre ambos grupos (observable en el diagrama de dispersión). El p- value es de 0.0001, por tanto, rechazamos la hipótesis nula, y el coeficiente de determinación es de 0.1524, lo que quiere decir que explicaría el 0.152(redondeando a tres decimales) de la variabilidad del peso en función de la edad. Como hay relación se ha construido la recta de regresión de fórmula: PESO=56.02503+0.29963*Edad.

Este mismo estudio se ha realizado diferenciando entre hombres y mujeres. El diagrama de dispersión nos llama la atención de este gráfico es el que a pesar de que ambas rectas empiecen y acaben en diferentes lugares, son prácticamente paralelas lo que nos adelanta que la pendiente no será muy diferente.

Realizando el estudio de los hombres no sale que el p-value es de 0.0135, por tanto, rechazamos la hipótesis nula, existe relación lineal. Dado que ocurre esto construimos la recta de regresión que es: PESO HOMBRES=64.7189+0.2813*Edad.

Tras hacer el estudio para las mujeres también concluimos que existe relación lineal, el p-value es 0.0001, y por tanto construimos la recta de regresión que es:

PESO MUJERES: 51.9656+0.2789 * Edad.

BIBLIOGRAFÍA

  1. Mora, A. C. (2019, enero 11). ¿Engordamos con la edad? Claves para evitarlo. Marca. https://cuidateplus.marca.com/alimentacion/nutricion/2019/01/11/engordamos-edad-claves-evitarlo-169152.html
  2. Mateos, A. S. (2016, septiembre 27). Por qué engordamos cuando nos hacemos mayores. La Vanguardia. https://www.lavanguardia.com/vivo/salud/20160927/41583606873/engordar-edad.html
  3. Chicana RC. Introducción al uso de R y R Commander para el análisis estadístico de datos [Internet]. R-project.org. [citado el 26 de agosto de 2024]. Disponible en: https://cran.r-project.org/doc/contrib/Chicana-Introduccion_al_uso_de_R.pdf
  4. R -Commander(2019).

ANEXOS

Fotografía 1.

.

Fuente: R-Commander

Fotografía 2.

 

Fuente: R-Commander

Fotografía 3.

Fuente: R-Commander

Fotografía 4.

Fuente: R-Commander

Fotografía 5.

Fuente: R-Commander

Fotografía 6.

Fuente: R-Commander

Fotografía 7.

Fuente: R-Commander

Fotografía 8.

Fuente: R-Commander

Fotografía 9.

Fuente: R-Commander

Fotografía 10.

Fuente: R-Commander

Fotografía 11.

Fuente: R-Commander

Fotografía 12.

Fuente: R-Commander

Fotografía 13.

Fuente: R-Commander

Fotografía 14.

Fuente: R-Commander

Fotografía 15.

Fuente: R-Commander

Fotografía 16.

Fuente: R-Commander

 

Publique con nosotros

Indexación de la revista

ID:3540

Últimos artículos