Section 3.1 – Étude statistique à deux variables et corrélation
Deux autres sujets que vous maîtrisez déjà sont les études statistiques à deux variables et le concept de corrélation des données. En effet, depuis l'an passé, nous avons souvent parlé de modélisation de fonction à partir de nuages de points, les études statistiques à deux variables sont exactement cela. Quant à elle, la corrélation fait référence à l'influence de la variable indépendante sur la variable dépendante. Nous apprendrons à qualifier et quantifier ces paramètres dans cette section.
3.1.1 – Études statistiques à deux variables
Lorsqu'on parle d'études statistiques à deux variables, il s'agit d'une étude statistique qui évalue en même temps deux types de données. Il existe des couples de données assez logiques, par exemple la taille et le poids d'une personne. Il existe aussi des couples moins logiques à placer ensemble, comme l'âge d'une personne et la longueur de ses cheveux. Cette « logique » aura un impact sur la corrélation entre les données.
Pour réaliser une étude statistique à deux variables, il suffit d'associer un caractère à l'axe des et l'autre à l'axe des . Ces couples de données constitueront des coordonnées dans un plan cartésien et il sera alors possible d'observer le lien entre ces données.
Voici un exemple prenant en compte la taille d'une personne et la longueur de ses jambes :
Elliot demande à ses collègues de lui fournir leur taille (en cm) et la longueur de leurs jambes (en cm), voici les résultats qu'il a obtenus.
1. Il faut maintenant placer ces données dans un plan cartésien.
Nous devons d'abord déterminer quelle donnée est associée à quelle variable ( ou ) :
- : Taille
- : Jambes
Nous pouvons aussi déterminer la graduation des deux axes en identifiant la plus grande donnée de chaque axe.
- Taille : 197 cm, alors la graduation ira jusqu'à 200
- Jambe : 102 cm, alors la graduation ira jusqu'à 105
2. Nous pouvons maintenant tracer le graphique et y placer les données.

Le tableau de distribution et le graphique sont les deux manières les plus utilisées pour présenter des études statistiques à deux variables. La première est plus précise mais la deuxième permet de mieux visualiser les tendances qui peuvent se dégager d'un ensemble de données.
3.1.2 – Interprétation qualitative (approximation) de la corrélation
En 3e secondaire, nous avons appris à modéliser des nuages de points pour qu'ils se conforment à des fonctions linéaires (le plus souvent) ou d'autres types de fonctions (exponentielle, quadratique, inverse). Pour interpréter la corrélation d'un ensemble de données, il faudra modéliser ces données et estimer la corrélation de celles-ci. Nous apprendrons à calculer précisément le coefficient de corrélation au prochain cours.
Corrélation : Liaison entre deux caractères telle que les variations de leurs valeurs soient toujours de même sens (corrélation positive) ou de sens opposé (corrélation négative).
Pour estimer le coefficient de corrélation, on utilise la technique de la boîte :
- Représenter les données dans un nuage de points.
- Tracer « la meilleure droite possible » à travers le nuage de points, c'est-à-dire la droite la plus représentative de l'ensemble des données.
- Construire une boîte rectangulaire autour des données en plaçant les côtés parallèles et perpendiculaires à la droite tracée en 2.
- Déterminer si la corrélation est positive ou négative (pente montante ou descendante).
- Estimer le coefficient de corrélation () à l'aide de la formule suivante :
Cette formule produira un nombre entre 0 et 1. Il sera possible d'analyser cette valeur en fonction des normes suivantes :
| Coefficient de corrélation | Signification |
|---|---|
| Près de 0 | Indique une corrélation linéaire nulle |
| Près de 0,5 | Indique une corrélation linéaire faible |
| Près de 0,75 | Indique une corrélation linéaire moyenne |
| Près de 0,87 | Indique une corrélation linéaire forte |
| Égal à 1 | Indique une corrélation linéaire parfaite |
Reprenons l'exemple précédent pour voir comment estimer le coefficient de corrélation. Reprenons les données précédentes :
1. Représenter les données dans un nuage de points
Nous pouvons reprendre le graphique réalisé plus haut.

2. Tracer « la meilleure droite possible » à travers le nuage de points.

3. Construire une boîte rectangulaire autour des données en plaçant les côtés parallèles et perpendiculaires à la droite tracée en 2.

4. Estimer le coefficient de corrélation ()

On applique la formule :
On peut donc dire que la corrélation entre les données est linéaire, positive et forte!
Les exercices liés à cette section se trouvent dans le manuel Vision Vol. 1 : p. 16, # 1, 2, 3, 4a, 6, 11 et 14; p. 30, # 1c, 3, 5, 9, 10 et 12.