BTSA 2025 : corrigé de traitement de données

Aller à un exercice ou une partie

Proposition de corrigé — non officielle. Session normale 2025, Métropole, Réunion et Mayotte : régression, khi-deux et estimation de proportions.

Télécharger ce corrigé en PDF · Ouvrir le sujet officiel · Télécharger une copie du sujet · Retrouver les annales

Exercice 1 : ajustement du taux d’IgG

1. Pourquoi l’ajustement affine est-il insuffisant ?

La baisse est rapide au début, puis ralentit. Les résidus de la droite affine suivent une courbure : ils sont positifs aux extrémités et négatifs au milieu. Même avec R² = 0,9242, cette structure indique qu’une droite laisse une évolution systématique inexpliquée.

2a et 2b. Ajustement logarithmique

On pose zᵢ = ln(xᵢ). Avec les sept couples du sujet, la méthode des moindres carrés donne :

ŷ = −19,488723z + 126,672055, soit, à 10⁻³ près, ŷ = −19,489 ln(x) + 126,672.

La pente s’obtient par Σ(zᵢ − z_moy)(yᵢ − y_moy)/Σ(zᵢ − z_moy)² et l’ordonnée à l’origine par y_moy − az_moy. Le coefficient de détermination est R² ≈ 0,992. On garde les coefficients non arrondis pour les calculs suivants.

2c. Résidus

Chaque résidu est eᵢ = yᵢ − ŷᵢ, en g/L.

Délai, hRésidu, g/L
2−0,164
4−0,655
62,247
8−1,146
100,202
12−1,244
140,760

2d. Pertinence

Les résidus sont nettement plus petits et ne reproduisent plus la courbure marquée de la régression affine. Le coefficient de détermination augmente. Ces éléments rendent l’ajustement logarithmique plus pertinent pour ces observations ; sept points ne suffisent toutefois pas à garantir sa validité à toute échéance.

2e. Après 15 heures

En acceptant l’extrapolation demandée, ŷ(15) = −19,488723 ln(15) + 126,672055 ≈ 73,896 g/L. Il s’agit d’une estimation du modèle, non d’une mesure.

Exercice 2A : qualité et race

Hypothèses et effectifs

On utilise un test du khi-deux d’indépendance :

  • H₀ : race et qualité du colostrum sont indépendantes ;
  • H₁ : elles ne sont pas indépendantes.

Les totaux des lignes sont 892, 95 et 323 ; les totaux des colonnes sont 470, 240, 340 et 260. L’effectif total est 1 310.

Sous H₀, l’effectif attendu dans une case vaut : total de sa ligne × total de sa colonne / 1 310.

RaceMauvaiseMoyenneBonneExcellente
Prim Holstein320,031163,420231,511177,038
Normande34,08417,40524,65618,855
Montbéliarde115,88559,17683,83264,107

Tous les effectifs attendus dépassent 5 ; avec les hypothèses d’échantillonnage du sujet, l’approximation du test est applicable.

Statistique et décision

χ² = Σ(observé − attendu)²/attendu ≈ 33,723. Les degrés de liberté sont (3 − 1)(4 − 1) = 6. À 5 %, la table donne le seuil 12,59.

33,723 > 12,59 : on rejette H₀ au seuil de 5 %. Ces données mettent en évidence une association entre race et qualité. Le test ne prouve pas que la race soit la seule cause des différences : d’autres conditions d’élevage peuvent intervenir.

Exercice 2B : proportion chez les Normandes

1. Estimation ponctuelle

Sur 95 vaches, 51 ont un colostrum de mauvaise qualité : f = 51/95 ≈ 0,537, soit environ 53,7 %.

2. Approximation de la fréquence

Sous le modèle d’échantillonnage avec remise, le nombre de cas suit B(95 ; p). La fréquence F est ce nombre divisé par 95. On approche sa loi par une loi normale de moyenne p et de variance p(1 − p)/95.

On estime ces paramètres avec f. Les effectifs observés 51 et 44 sont assez grands pour l’approximation usuelle.

3. Intervalle de confiance à 95 %

L’intervalle approché est f ± 1,96√[f(1 − f)/95]. L’erreur-type vaut environ 0,051159 ; la demi-largeur vaut 0,100273.

On obtient [0,437 ; 0,637], avec les arrondis demandés. Il estime la proportion de la population à partir de cet échantillon ; il ne décrit pas la proportion de chaque autre échantillon.

Exercice 3 : vrai ou faux

Affirmation 1 : fausse

La probabilité de contamination annoncée est 51 %, donc p = 0,51, et non 0,255. X suit B(50 ; 0,51).

Affirmation 2 : vraie

E(X) = np = 50 × 0,51 = 25,5 prélèvements. Une espérance peut être non entière.

Affirmation 3 : vraie

np = 25,5 et n(1 − p) = 24,5 sont suffisants pour une approximation normale. On approche X par une normale de moyenne 25,5 et de variance 12,495, donc d’écart-type environ 3,535.

Affirmation 4 : vraie dans le modèle

Plus du quart de 50 signifie X ≥ 13. Avec correction de continuité, P(X ≥ 13) ≈ P(Y > 12,5), avec Y normale de paramètres précédents. Le score centré réduit vaut environ −3,678 : la probabilité est très proche de 1.

Le calcul binomial exact donne environ 0,999911. L’expression « très probable » est donc justifiée. On parle ici de la part des prélèvements contaminés dans un échantillon ; l’énoncé emploie « échantillons » de manière moins précise.