Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Un prétraitement est-il nécessaire avant la prédiction à l'aide de FinalModel de RandomForest avec package caret?
J'utilise le package caret pour entraîner un objet randomForest avec 10x10CV. library(caret) tc <- trainControl("repeatedcv", number=10, repeats=10, classProbs=TRUE, savePred=T) RFFit <- train(Defect ~., data=trainingSet, method="rf", trControl=tc, preProc=c("center", "scale")) Après cela, je teste randomForest sur un testSet (nouvelles données) RF.testSet$Prediction <- predict(RFFit, newdata=testSet) La matrice de confusion me montre que le …


2
Intuition derrière les corrélations «partielles» et «marginales»
Quelqu'un a-t-il une idée de la raison pour laquelle la corrélation conditionnelle entre 2 variables est appelée corrélation "partielle" et la corrélation simple entre elles (donc, lorsqu'elle n'est conditionnée à aucune autre variable) est appelée corrélation "marginale"? Quelle est l'intuition derrière les mots "partiel" et "marginal"? Que font-ils des "pièces" …


4
Régression logistique et point d'inflexion
Nous avons des données avec un résultat binaire et quelques covariables. J'ai utilisé la régression logistique pour modéliser les données. Juste une simple analyse, rien d'extraordinaire. La sortie finale est supposée être une courbe dose-réponse où nous montrons comment la probabilité change pour une covariable spécifique. Quelque chose comme ça: …

4
Comparaison de l'estimation du maximum de vraisemblance (MLE) et du théorème de Bayes
Dans le théorème bayésien, , et dans le livre que je lis, est appelé le vraisemblance , mais je suppose que c'est juste la probabilité conditionnelle de étant donné , non?p(y|x)=p(x|y)p(y)p(x)p(y|x)=p(x|y)p(y)p(x)p(y|x) = \frac{p(x|y)p(y)}{p(x)}p(x|y)p(x|y)p(x|y)xxxyyy L' estimation du maximum de vraisemblance tente de maximiser , non? Si oui, je suis très confus, …

2
Lors de l'ajustement d'une courbe, comment puis-je calculer l'intervalle de confiance à 95% pour mes paramètres ajustés?
J'ajuste des courbes à mes données pour extraire un paramètre. Cependant, je ne sais pas quelle est la certitude de ce paramètre et comment je calculerais / exprimerais son intervalle de confiance à %.959595 Disons que pour un ensemble de données contenant des données qui décroissent exponentiellement, j'adapte une courbe …



2
Un MCMC remplissant un équilibre détaillé donne-t-il une distribution stationnaire?
Je suppose que je comprends l'équation de la condition d'équilibre détaillé, qui stipule que pour la probabilité de transition et la distribution stationnaire , une chaîne de Markov satisfait à l'équilibre détaillé siqqqππ\piq(x|y)π(y)=q(y|x)π(x),q(x|y)π(y)=q(y|x)π(x),q(x|y)\pi(y)=q(y|x)\pi(x), cela a plus de sens pour moi si je le reformule comme: q(x|y)q(y|x)=π(x)π(y).q(x|y)q(y|x)=π(x)π(y).\frac{q(x|y)}{q(y|x)}= \frac{\pi(x)}{\pi(y)}. Fondamentalement, la probabilité …

4
Test d'hypothèse avec Big Data
Comment effectuez-vous des tests d'hypothèses avec des mégadonnées? J'ai écrit le script MATLAB suivant pour souligner ma confusion. Il ne fait que générer deux séries aléatoires et exécuter une régression linéaire simple d'une variable sur l'autre. Il effectue cette régression plusieurs fois en utilisant différentes valeurs aléatoires et rapporte des …


1
Corrélations réalisables pour les variables aléatoires exponentielles
Quelle est la plage de corrélations réalisables pour la paire de variables aléatoires à distribution exponentielle et X_2 \ sim {\ rm Exp} (\ lambda_2) , où \ lambda_1, \ lambda_2> 0 sont les paramètres de débit?X1∼Exp(λ1)X1∼Exp(λ1)X_1 \sim {\rm Exp}(\lambda_1)X2∼Exp(λ2)X2∼Exp(λ2)X_2 \sim {\rm Exp}(\lambda_2)λ1,λ2>0λ1,λ2>0\lambda_1, \lambda_2 > 0

3
Qu'est-ce qu'un processus stationnaire de second ordre?
Je me demandais comment son "processus stationnaire de second ordre" est défini dans l' introduction de Brockwell et Davis aux séries chronologiques et aux prévisions : La classe des modèles de séries chronologiques linéaires, qui comprend la classe des modèles autorégressifs à moyenne mobile (ARMA), fournit un cadre général pour …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.