Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Quand enregistrer / développer vos variables lors de l'utilisation de modèles de forêt aléatoires?
Je fais une régression en utilisant des forêts aléatoires pour prédire les prix en fonction de plusieurs attributs. Le code est écrit en Python à l'aide de Scikit-learn. Comment décidez-vous si vous devez transformer vos variables en utilisant exp/ logavant de l'utiliser pour l'adapter au modèle de régression? Est-il nécessaire …

1
Grand échantillon asymptotique / théorie - Pourquoi s'en soucier?
J'espère que cette question ne sera pas marquée comme «trop générale» et j'espère qu'une discussion commencera qui bénéficiera à tous. En statistiques, nous passons beaucoup de temps à apprendre de grandes théories d'échantillonnage. Nous souhaitons vivement évaluer les propriétés asymptotiques de nos estimateurs, notamment s’ils sont asymptotiquement impartiaux, asymptotiquement efficaces, …

1
Prédiction sur les modèles à effets mixtes: que faire des effets aléatoires?
Prenons cet ensemble de données hypothétique: set.seed(12345) num.subjects <- 10 dose <- rep(c(1,10,50,100), num.subjects) subject <- rep(1:num.subjects, each=4) group <- rep(1:2, each=num.subjects/2*4) response <- dose*dose/10 * group + rnorm(length(dose), 50, 30) df <- data.frame(dose=dose, response=response, subject=subject, group=group) nous pouvons utiliser lmepour modéliser la réponse avec un modèle à effet aléatoire: …


3
Comment calculer les composants principaux à rotation varimax dans R?
J'ai exécuté PCA sur 25 variables et sélectionné les 7 meilleurs PC utilisant prcomp. prc <- prcomp(pollutions, center=T, scale=T, retx=T) J'ai ensuite fait une rotation varimax sur ces composants. varimax7 <- varimax(prc$rotation[,1:7]) Et maintenant, je souhaite faire pivoter varimax les données pivotées par PCA (car elles ne font pas partie …
13 r  pca  factor-rotation 

1
Les erreurs standard d'amorçage et les intervalles de confiance sont-ils appropriés dans les régressions où l'hypothèse d'homoscédasticité est violée?
Si, dans les régressions OLS standard, deux hypothèses sont violées (distribution normale des erreurs, homoscédasticité), l'amorçage des erreurs standard et des intervalles de confiance est-il une alternative appropriée pour obtenir des résultats significatifs en ce qui concerne la signification des coefficients du régresseur? Les tests de signification avec des erreurs …





1
R au carré dans le modèle linéaire vers la déviance dans le modèle linéaire généralisé?
Voici mon contexte pour cette question: D'après ce que je peux dire, nous ne pouvons pas exécuter une régression ordinaire des moindres carrés dans R lors de l'utilisation de données pondérées et du surveypackage. Ici, nous devons utiliser svyglm(), qui exécute à la place un modèle linéaire généralisé (qui peut …




3
Statistique F, valeur F critique et valeur P
Je suis très nouveau dans ce domaine et j'ai du mal à comprendre le concept de rejet de l'hypothèse nulle sur la base des résultats de la table ANOVA. Comment le F calculé et la valeur critique sont-ils liés à la valeur de p? Et si le F calculé est …
13 anova 

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.