Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


3
Méthodes d'initialisation du clustering K-means
Je m'intéresse à l'état actuel de la technique pour sélectionner les semences initiales (centres de grappe) pour K-means. La recherche sur Google mène à deux choix populaires: sélection aléatoire des graines initiales, et, en utilisant la technique de sélection KMeans ++: Arthur & Vassilvitskii 2006 k-means ++: Les avantages d'un …



1
Le théorème du contraste relatif de Beyer et al. papier: «Sur le comportement surprenant des métriques de distance dans l'espace de grande dimension» trompeur?
Ceci est cité très souvent en mentionnant la malédiction de la dimensionnalité et va (formule de droite appelée contraste relatif) limré→ ∞var ( | | Xré| |kE[ | | Xré| |k]) =0,alors: Dmaxkré- Dminkréréminkré→ 0limré→∞var(||Xré||kE[||Xré||k])=0,alors:rémaxrék-réminrékréminrék→0 \lim_{d\rightarrow \infty} \text{var} \left(\frac{||X_d||_k}{E[||X_d||_k]} \right) = 0, \text{then}: \frac{D_{\max^{k}_{d}} - D_{\min^{k}_{d}}}{D_{\min^{k}_{d}}} \rightarrow 0 Le résultat …



2
Preuve facile de ?
Soit des variables aléatoires normales standard indépendantes. Il existe de nombreuses (longues) preuves, montrant queZ1,⋯,ZnZ1,⋯,ZnZ_1,\cdots,Z_n ∑i=1n(Zi−1n∑j=1nZj)2∼χ2n−1∑i=1n(Zi−1n∑j=1nZj)2∼χn−12 \sum_{i=1}^n \left(Z_i - \frac{1}{n}\sum_{j=1}^n Z_j \right)^2 \sim \chi^2_{n-1} De nombreuses preuves sont assez longues et certaines utilisent l'induction (par exemple l'inférence statistique de Casella). Je me demande s'il existe une preuve facile de ce …



1
Obtenir une distribution conjointe à partir d'une distribution marginale par paire
Supposons que nous ayons 3 variables aléatoires , et nous connaissons la distribution marginale par paire , mais nous ne savons rien d'autre (comme comme indépendance conditionnelle). Pouvons-nous obtenir la distribution conjointe ?X1, X2, X3X1,X2,X3X_1,X_2,X_3P(X1,X2) , P(X2,X3) , P(X3,X1)P(X1,X2),P(X2,X3),P(X3,X1)P(X_1,X_2), P(X_2,X_3), P(X_3,X_1)P( X1, X2, X3)P(X1,X2,X3)P(X_1,X_2,X_3)

2
Le Paradoxe de Simpson couvre-t-il toutes les instances de retournement d'une variable cachée?
Ce qui suit est une question sur les nombreuses visualisations offertes comme «preuve par l'image» de l'existence du paradoxe de Simpson, et peut-être une question sur la terminologie. Le Paradoxe de Simpson est un phénomène assez simple à décrire et à donner des exemples numériques (la raison pour laquelle cela …




En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.