Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données





1
Qu'est-ce qu'un 'bagplot' ou un 'boxplot bivarié'?
J'ai trouvé un article qui présente la version multidimensionnelle (bivariée ici) du boxplot - un bagplot. Qu'est-ce que cette parcelle exactement? Je peux voir la série de polygones imbriqués basés sur des sommets, l'un de ces polygones étant déclaré comme un bagplot. Quelle est l'idée de la construction de polygones …


2
Fiabilité Omega vs Alpha
Je me demande si quelqu'un peut expliquer quelle est la principale différence entre les fiabilités oméga et alpha? Je comprends qu'une fiabilité oméga est basée sur un modèle de facteur hiérarchique comme indiqué dans l'image suivante, et alpha utilise des corrélations inter-éléments moyennes. Ce que je ne comprends pas, c'est …

1
Obtention de résultats différents lors du traçage d'ellipses à 95% CI avec ggplot ou le package ellipse
Je souhaite visualiser les résultats d'un clustering (produit avec protoclust{protoclust}) en créant des graphiques de scater pour chaque paire de variables utilisées pour classer mes données, en coloriant par classes et en chevauchant les ellipses pour l'intervalle de confiance à 95% pour chacune des classes (pour vérifier qui elipses-classes se …


3
Utiliser des simulations informatiques pour mieux comprendre les concepts statistiques au niveau universitaire
Salut, je prends un cours d'études supérieures en statistique et nous avons couvert les statistiques de test et d'autres concepts. Cependant, je suis souvent en mesure d'appliquer les formules et de développer une sorte d'intuition sur le fonctionnement des choses, mais j'ai souvent le sentiment que si je soutenais mon …



2
Quel est l'avantage de réduire la dimensionnalité des prédicteurs à des fins de régression?
Quels sont les applications ou les avantages des techniques de régression par réduction de dimension (DRR) ou de réduction de dimensionnalité supervisée (SDR) par rapport aux techniques de régression traditionnelles (sans réduction de dimensionnalité)? Ces classes de techniques trouvent une représentation de faible dimension de l'ensemble des caractéristiques du problème …

5
De bons livres sur l'exploration de texte?
Salut, je voulais savoir s'il y avait de bons livres sur l'exploration de texte et la classification avec quelques études de cas?. Sinon, certains articles / revues accessibles au public feraient l'affaire. S'ils illustrent encore mieux leurs exemples avec R. Je ne cherche pas un manuel étape par étape mais …

4
Vous essayez de calculer l'index Gini sur la distribution de réputation StackOverflow?
J'essaie de calculer l'index Gini sur la distribution de réputation SO à l'aide de SO Data Explorer. L'équation que j'essaie de mettre en œuvre est la suivante: Où:n= nombre d'utilisateurs sur le site; i= identifiant de série de l'utilisateur (1 - 1 225 000); yi= réputation de l'utilisateuri.G(S)=1n−1(n+1−2(∑ni=1(n+1−i)yi∑ni=1yi))G(S)=1n−1(n+1−2(∑i=1n(n+1−i)yi∑i=1nyi)) G(S)=\frac{1}{n-1}\left(n+1-2\left(\frac{\sum^n_{i=1}(n+1-i)y_i}{\sum^n_{i=1}y_i}\right)\right) nnniiiyiyiy_iiii …
11 gini 

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.