Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données




2
Mesures pour les matrices de covariance: inconvénients et forces
Quelles sont les «meilleures» mesures pour les matrices de covariance, et pourquoi? Il est clair pour moi que Frobenius & c n'est pas approprié, et les paramétrisations d'angle ont aussi leurs problèmes. Intuitivement, on pourrait vouloir un compromis entre ces deux, mais j'aimerais aussi savoir s'il y a d'autres aspects …


3
Intervalle de confiance pour le produit de deux paramètres
Supposons que nous avons deux paramètres, et . Nous avons également deux estimateurs du maximum de vraisemblance et et deux intervalles de confiance pour ces paramètres. Existe-t-il un moyen de créer un intervalle de confiance pour ?p 2 ^ p 1 ^ p 2 p 1 p 2p1p1p_1p2p2p_2p1^p1^\hat{p_1}p2^p2^\hat{p_2}p1p2p1p2p_1p_2

1
Calcul des variables de contraste polynomiales
Veuillez me donner une idée de la façon de recoder efficacement une variable catégorielle (facteur) dans l'ensemble de variables de contraste polynomiales orthogonales. Pour de nombreux types de variables de contraste (par exemple, déviation, simple, Helmert, etc.), la réussite est la suivante: Composez la matrice des coefficients de contraste correspondant …

2
Quelles sont les distances entre les variables constituant une matrice de covariance?
J'ai une matrice de covariance et je souhaite partitionner les variables en clusters en utilisant un clustering hiérarchique (par exemple, pour trier une matrice de covariance).n×nn×nn \times nkkk Existe-t-il une fonction de distance typique entre les variables (c'est-à-dire entre les colonnes / lignes de la matrice de covariance carrée)? Ou …

2
Limites de queue sur la norme euclidienne pour une distribution uniforme sur
Quelles sont les limites supérieures connues de la fréquence à laquelle la norme euclidienne d'un élément uniformément choisi de sera supérieur à un seuil donné?{−n, −(n−1), ..., n−1, n}d{−n, −(n−1), ..., n−1, n}d\:\{-n,~-(n-1),~...,~n-1,~n\}^d\: Je m'intéresse principalement aux bornes qui convergent exponentiellement vers zéro lorsque est bien inférieur à .nnnddd

1
Distribution d'échantillonnage des coefficients de régression
J'ai précédemment appris sur les distributions d'échantillonnage qui ont donné des résultats qui étaient pour l'estimateur, en termes de paramètre inconnu. Par exemple, pour les distributions d'échantillonnage de et dans le modèle de régression linéaire β 1Yi=βo+β1Xi+εiβ^0β^0\hat\beta_0β^1β^1\hat\beta_1Yi=βo+β1Xi+εiYi=βo+β1Xi+εiY_i = \beta_o + \beta_1 X_i + \varepsilon_i β^0∼N(β0, σ2(1n+x¯2Sxx))β^0∼N(β0, σ2(1n+x¯2Sxx)) \hat{\beta}_0 \sim \mathcal …





3
Modélisation mathématique des réseaux de neurones en tant que modèles graphiques
J'ai du mal à faire le lien mathématique entre un réseau de neurones et un modèle graphique. Dans les modèles graphiques, l'idée est simple: la distribution de probabilité factorise en fonction des cliques du graphique, les potentiels étant généralement de la famille exponentielle. Existe-t-il un raisonnement équivalent pour un réseau …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.