Région de confiance
En statistique, une région de confiance est une généralisation multivariée d'un intervalle de confiance. Pour le cas particulier d'une loi normale bivariée, la région prend la forme d'une ellipse, également connue sous le nom d'ellipse d'erreur. Plus généralement, il s'agit d'un ensemble de points dans un espace à n dimensions, souvent représenté par un hyperellipsoïde autour d'une estimation ponctuelle qui est une solution à un problème, bien que d'autres formes puissent apparaître selon la loi de probabilités.
Interprétation
modifierLa région de confiance est calculée de telle sorte que si un ensemble de mesures était répété plusieurs fois et qu'une région de confiance était calculée de la même manière sur chaque ensemble de mesures, alors dans un certain pourcentage de cas (par exemple 95 %), la région de confiance contiendrait le point représentant les « vraies » valeurs de l'ensemble des variables estimées. Toutefois, à moins que certaines hypothèses concernant les probabilités a priori ne soient formulées, le calcul d'une région de confiance ne signifie pas qu'il existe une probabilité de 95 % que les valeurs « réelles » se situent à l'intérieur de cette région, car on ne fait aucune hypothèse sur la loi de probabilité particulière des valeurs « réelles » et on peut ou non disposer d'autres informations sur leur position probable.
Cas des erreurs indépendantes et identiquement distribuées selon une loi normale
modifierOn suppose qu'on a obtenu une solution au problème surdéterminé suivant :
où Y est un vecteur colonne de dimension n contenant les valeurs observées de la variable dépendante, X est une matrice n × p des valeurs observées des variables indépendantes (qui peuvent représenter par exemple un modèle physique) que l'on suppose connues avec exactitude, est un vecteur colonne contenant les p paramètres à estimer, et est un vecteur colonne de dimension n d'erreurs supposées indépendantes et distribuées selon une loi normale centrée de même variance inconnue σ2.
Une région de confiance à 100(1 − α) % pour les éléments de est représenté par l'ensemble des valeurs du vecteur b qui vérifient l'inégalité suivante[1]:
où la variable b représente tout point dans la région de confiance, p est le nombre de paramètres, i.e. le nombre d'éléments du vecteur est le vecteur des paramètres estimés, et s2 un estimateur sans biais de la variance σ2, par un chi-2 réduit, égal à
Plus précisément, F est la fonction quantile de la loi de Fisher, avec p et degrés de liberté, est le niveau de signification statistique, et la notation désigne la transposée de .
L'expression peut être réécrite comme suit :
où est la matrice de covariance normalisée par la méthode des moindres carrés de .
L'inégalité ci-dessus définit une région ellipsoïdale dans l'espace des paramètres cartésiens de Rp. L'ellipsoïde est centrée sur l'estimation . Selon Press et al., il est plus facile de tracer l'ellipsoïde après avoir effectué une décomposition en valeurs singulières. Les longueurs des axes de l'ellipsoïde sont proportionnelles aux inverses des valeurs sur les diagonales de la matrice diagonale, et les directions de ces axes sont données par les lignes de la 3e matrice de la décomposition[2].
Moindres carrés pondérés et généralisés
modifierOn considère maintenant le cas plus général où certains éléments distincts de ont une covariance non nulle connue (en d'autres termes, les erreurs dans les observations ne sont pas distribuées indépendamment), et/ou les écarts-types des erreurs ne sont pas tous égaux. On considère donc que la matrice de covariance de est de la forme , où V est une matrice non singulière n × n qui était égale à I dans le cas plus spécifique traité dans la section précédente, (avec I est la matrice identité ), mais ici il est autorisé d'avoir des éléments non-diagonaux non nuls représentant la covariance des paires d'observations individuelles, ainsi que de ne pas nécessairement avoir tous les éléments diagonaux égaux.
Il est possible de trouver[3] une matrice symétrique non singulière P telle que
En effet, P est une racine carrée de la matrice de covariance V.
Le problème des moindres carrés
peut alors être transformée en multipliant à gauche chaque terme par l'inverse de P, formant ainsi la nouvelle formulation du problème
où
- et
Une région de confiance conjointe pour les paramètres, c'est-à-dire pour les éléments de , est alors délimitée par l'ellipsoïde définie par[4]:
Ici, F représente le quantile de la loi de Fisher où les quantités p et n – p sont les degrés de liberté qui sont les paramètres de cette loi.
Exemples
modifierProblèmes non linéaires
modifierDes régions de confiance peuvent être définies pour toute loi de probabilité. L'expérimentateur peut choisir le niveau de signification et la forme de la région, alors la taille de la région est déterminée par la loi de probabilité. Un choix naturel consiste à utiliser comme frontière un ensemble de points à constant.
Une approche consiste à utiliser une approximation linéaire du modèle non linéaire, qui peut constituer une bonne approximation au voisinage de la solution, puis à appliquer l'analyse d'un problème linéaire pour trouver une région de confiance approximative. Cette méthode peut s'avérer raisonnable si la région de confiance n'est pas très étendue et si les dérivées secondes du modèle ne sont pas non plus très importantes.
Des approches de bootstrap peuvent également être utilisées.
Notes
modifierRéférences
modifier- (en) N.R. Draper et H. Smith, Applied Regression Analysis, USA, John Wiley and Sons Ltd, (1re éd. 1966) (ISBN 0-471-02995-5, lire en ligne
) - (en) W.H. Press, S.A. Teukolsky, W.T. Vetterling et B.P. Flannery, Numerical Recipes in C: The Art of Scientific Computing, Cambridge UK, Cambridge University Press, (1re éd. 1988) (ISBN 978-0-521-43720-2, lire en ligne
)