View a markdown version of this page

LpNorme (LP) - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

LpNorme (LP)

Note

Amazon SageMaker Clarify n'est plus ouvert aux nouveaux clients. Les clients existants peuvent continuer à utiliser le service normalement. AWS continue d'investir dans l'amélioration de la sécurité et de la disponibilité de Clarify, mais nous ne prévoyons pas d'introduire de nouvelles fonctionnalités. Pour de plus amples informations, veuillez consulter Clarifier le changement de disponibilité.

La norme Lp (LP) mesure la distance de la norme p entre les distributions de facettes des étiquettes observées dans un jeu de données d'entraînement. Cette métrique n'est pas négative et ne peut donc pas détecter le biais inverse.

La formule pour la norme Lp est la suivante :

        L p (Pa, Pd) = (y| |P a - P d || p) 1/p

Lorsque la distance de la norme p entre les points x et y est définie comme suit :

        L p (x, y) = (|x 1 -y 1 | p + |x -y | p +... n +|x 2 -y 2 | p) n 1/p

La norme 2 est la norme euclidienne. Supposons que vous avez une distribution de résultats avec trois catégories, par exemple, yi = {y0, y1, y2} = {accepté, sur liste d'attente, rejeté} dans un scénario multicatégoriel d'admission à l'université. Vous prenez la somme des carrés des différences entre les nombres de résultats pour les facettes a et d. La distance euclidienne obtenue est calculée de la manière suivante :

        L 2 (Pa, Pd) = [(n a (0) - n d (0)) 2 + (n a (1) - n d (1)) 2 + (n a (2) - n d (2)) 2] 1/2

Où :

  • na(i) est le nombre des résultats de la énième catégorie dans la facette a : par exemple na(0) est le nombre d'acceptations de la facette a.

  • nd(i) est le nombre des résultats de la énième catégorie dans la facette d : par exemple nd(2) est le nombre de rejets de la facette d.

    La plage de valeurs JS pour les résultats binaires, multicatégoriels et continus est de [0, √2), où :

    • Les valeurs proches de zéro signifient que les distributions d'étiquettes sont similaires.

    • Les valeurs positives indiquent une divergence dans les distributions d'étiquettes, d'autant plus importante que le nombre de valeurs positives est élevé.