Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


4
Amélioration de la classification SVM du diabète
432607 × 136432607×136432607 \times 136Y11 %11%11\%N89 %89%89\% J'utilise uniquement 15des 136variables indépendantes de l'ensemble de données. L'une des raisons de la réduction de l'ensemble de données était d'avoir plus d'échantillons d'apprentissage lorsque les lignes contenant NAs sont omises. Ces 15variables ont été sélectionnées après l'exécution de méthodes statistiques telles que …




3
Seuil du coefficient de corrélation pour indiquer la signification statistique d'une corrélation dans une matrice de corrélation
J'ai calculé une matrice de corrélation d'un ensemble de données qui contient 455 points de données, chaque point de données contenant 14 caractéristiques. La dimension de la matrice de corrélation est donc de 14 x 14. Je me demandais s'il existe un seuil pour la valeur du coefficient de corrélation …

6
Comparez le R au carré de deux modèles différents de forêt aléatoire
J'utilise le package randomForest dans R pour développer un modèle de forêt aléatoire pour essayer d'expliquer un résultat continu dans un ensemble de données "large" avec plus de prédicteurs que d'échantillons. Plus précisément, j'adapte un modèle RF permettant à la procédure de sélectionner parmi un ensemble de ~ 75 variables …

3
Probabilité d'un événement non mesurable
Nous savons par la théorie de la mesure qu'il existe des événements qui ne peuvent pas être mesurés, c'est-à-dire qu'ils ne sont pas mesurables par Lebesgue. Comment appelons-nous un événement avec une probabilité que la mesure de probabilité ne soit pas définie? Quels types de déclarations ferions-nous à propos d'un …

3
Combiner deux séries chronologiques en faisant la moyenne des points de données
Je voudrais combiner les prévisions et les rétrodiffusions (c'est-à-dire les valeurs passées prévues) d'un ensemble de données de séries chronologiques en une seule série temporelle en minimisant l'erreur quadratique moyenne de prédiction. Disons que j'ai des séries chronologiques de 2001-2010 avec un écart pour l'année 2007. J'ai pu prévoir 2007 …

2
Existe-t-il une statistique d'ajustement de modèle (comme AIC ou BIC) qui peut être utilisée pour des comparaisons absolues plutôt que simplement relatives?
Je ne connais pas très bien cette littérature, alors pardonnez-moi s'il s'agit d'une question évidente. Étant donné que l'AIC et le BIC dépendent de la maximisation de la probabilité, il semble qu'ils ne peuvent être utilisés que pour effectuer des comparaisons relatives entre un ensemble de modèles tentant de s'adapter …


5
Visualisation des combinaisons de 2 lettres
Les réponses à cette question sur SO ont renvoyé un ensemble d'environ 125 noms d'une à deux lettres: /programming/6979630/what-1-2-letter-object-names-conflict-with-existing -r-objets [1] "Ad" "am" "ar" "as" "bc" "bd" "bp" "br" "BR" "bs" "by" "c" "C" [14] "cc" "cd" "ch" "ci" "CJ" "ck" "Cl" "cm" "cn" "cq" "cs" "Cs" "cv" [27] "d" …

4
Détection des valeurs aberrantes en ligne
Je souhaite traiter des images de microscopie à segmentation automatique pour détecter des images défectueuses et / ou des segmentations défectueuses, dans le cadre d'un pipeline d'imagerie à haut débit. Il existe une multitude de paramètres qui peuvent être calculés pour chaque image brute et segmentation, et qui deviennent «extrêmes» …
10 outliers  online 



En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.