Aller au contenu principal

Section 3.1 – Étude statistique à deux variables et corrélation

Deux autres sujets que vous maîtrisez déjà sont les études statistiques à deux variables et le concept de corrélation des données. En effet, depuis l'an passé, nous avons souvent parlé de modélisation de fonction à partir de nuages de points, les études statistiques à deux variables sont exactement cela. Quant à elle, la corrélation fait référence à l'influence de la variable indépendante sur la variable dépendante. Nous apprendrons à qualifier et quantifier ces paramètres dans cette section.

3.1.1 – Études statistiques à deux variables

Lorsqu'on parle d'études statistiques à deux variables, il s'agit d'une étude statistique qui évalue en même temps deux types de données. Il existe des couples de données assez logiques, par exemple la taille et le poids d'une personne. Il existe aussi des couples moins logiques à placer ensemble, comme l'âge d'une personne et la longueur de ses cheveux. Cette « logique » aura un impact sur la corrélation entre les données.

Pour réaliser une étude statistique à deux variables, il suffit d'associer un caractère à l'axe des xx et l'autre à l'axe des yy. Ces couples de données constitueront des coordonnées dans un plan cartésien et il sera alors possible d'observer le lien entre ces données.

Voici un exemple prenant en compte la taille d'une personne et la longueur de ses jambes :

Elliot demande à ses collègues de lui fournir leur taille (en cm) et la longueur de leurs jambes (en cm), voici les résultats qu'il a obtenus.

1. Il faut maintenant placer ces données dans un plan cartésien.

Nous devons d'abord déterminer quelle donnée est associée à quelle variable (xx ou yy) :

  • xx : Taille
  • yy : Jambes

Nous pouvons aussi déterminer la graduation des deux axes en identifiant la plus grande donnée de chaque axe.

  • Taille : 197 cm, alors la graduation ira jusqu'à 200
  • Jambe : 102 cm, alors la graduation ira jusqu'à 105

2. Nous pouvons maintenant tracer le graphique et y placer les données.

Nuage de points représentant la taille (axe des x, gradué jusqu'à 200 cm) et la longueur des jambes (axe des y, gradué jusqu'à 105 cm) des collègues d'Elliot

Le tableau de distribution et le graphique sont les deux manières les plus utilisées pour présenter des études statistiques à deux variables. La première est plus précise mais la deuxième permet de mieux visualiser les tendances qui peuvent se dégager d'un ensemble de données.

3.1.2 – Interprétation qualitative (approximation) de la corrélation

En 3e secondaire, nous avons appris à modéliser des nuages de points pour qu'ils se conforment à des fonctions linéaires (le plus souvent) ou d'autres types de fonctions (exponentielle, quadratique, inverse). Pour interpréter la corrélation d'un ensemble de données, il faudra modéliser ces données et estimer la corrélation de celles-ci. Nous apprendrons à calculer précisément le coefficient de corrélation au prochain cours.

Corrélation : Liaison entre deux caractères telle que les variations de leurs valeurs soient toujours de même sens (corrélation positive) ou de sens opposé (corrélation négative).

Pour estimer le coefficient de corrélation, on utilise la technique de la boîte :

  1. Représenter les données dans un nuage de points.
  2. Tracer « la meilleure droite possible » à travers le nuage de points, c'est-à-dire la droite la plus représentative de l'ensemble des données.
  3. Construire une boîte rectangulaire autour des données en plaçant les côtés parallèles et perpendiculaires à la droite tracée en 2.
  4. Déterminer si la corrélation est positive ou négative (pente montante ou descendante).
  5. Estimer le coefficient de corrélation (rr) à l'aide de la formule suivante :

r=±(1mesure du petit coˆteˊmesure du grand coˆteˊ)r = \pm \left(1 - \frac{\text{mesure du petit côté}}{\text{mesure du grand côté}}\right)

Cette formule produira un nombre entre 0 et 1. Il sera possible d'analyser cette valeur en fonction des normes suivantes :

Coefficient de corrélationSignification
Près de 0Indique une corrélation linéaire nulle
Près de 0,5Indique une corrélation linéaire faible
Près de 0,75Indique une corrélation linéaire moyenne
Près de 0,87Indique une corrélation linéaire forte
Égal à 1Indique une corrélation linéaire parfaite

Reprenons l'exemple précédent pour voir comment estimer le coefficient de corrélation. Reprenons les données précédentes :

1. Représenter les données dans un nuage de points

Nous pouvons reprendre le graphique réalisé plus haut.

Nuage de points de la taille et de la longueur des jambes des collègues d'Elliot, repris de l'exemple précédent

2. Tracer « la meilleure droite possible » à travers le nuage de points.

Même nuage de points avec une droite rouge tracée à travers les données, représentant la meilleure droite possible

3. Construire une boîte rectangulaire autour des données en plaçant les côtés parallèles et perpendiculaires à la droite tracée en 2.

Boîte rectangulaire verte tracée autour du nuage de points, parallèle et perpendiculaire à la droite rouge

4. Estimer le coefficient de corrélation (rr)

Boîte rectangulaire avec la longueur de la boîte (15 cm) et la largeur de la boîte (2,4 cm) identifiées en orange

On applique la formule :

r=±(1mesure du petit coˆteˊmesure du grand coˆteˊ)r = \pm \left(1 - \frac{\text{mesure du petit côté}}{\text{mesure du grand côté}}\right)

r=1(2,415)r = 1 - \left(\frac{2{,}4}{15}\right)

r=10,16r = 1 - 0{,}16

r=0,84r = 0{,}84

On peut donc dire que la corrélation entre les données est linéaire, positive et forte!

Les exercices liés à cette section se trouvent dans le manuel Vision Vol. 1 : p. 16, # 1, 2, 3, 4a, 6, 11 et 14; p. 30, # 1c, 3, 5, 9, 10 et 12.