Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données



3
Problèmes de pièges variables factices
J'exécute une grande régression OLS où toutes les variables indépendantes (environ 400) sont des variables fictives. Si tous sont inclus, il y a une parfaite multicolinéarité (le piège variable factice), donc je dois omettre l'une des variables avant d'exécuter la régression. Ma première question est, quelle variable doit être omise? …

4
Comment obtenir les valeurs utilisées dans plot.gam en mgcv?
Je voudrais connaître les valeurs (x, y)utilisées dans le traçage plot(b, seWithMean=TRUE)dans le package mgcv . Est-ce que quelqu'un sait comment extraire ou calculer ces valeurs? Voici un exemple: library(mgcv) set.seed(0) dat <- gamSim(1, n=400, dist="normal", scale=2) b <- gam(y~s(x0), data=dat) plot(b, seWithMean=TRUE)

2
Comment créer un ensemble d'échantillons représentatif à partir d'un grand ensemble de données global?
Quelles sont les techniques statistiques pour créer un ensemble d'échantillons représentatif de l'ensemble de la population (avec un niveau de confiance connu)? Aussi, Comment valider, si l'échantillon correspond à l'ensemble de données global? Est-ce possible, sans analyser l'ensemble de données entier (qui pourrait être des milliards d'enregistrements)?


1
Comment traiter une question d'enquête à réponses multiples?
J'ai un ensemble de données demandant aux gens s'ils sont allés à certains endroits (par exemple A, B, C, D), et ils peuvent faire plus d'un choix, puis un échantillon est prélevé de leur nez pour voir s'ils sont infectés par certains maladie. J'ai besoin de découvrir le risque relatif …
10 logistic 

4
Étant donné une chaîne 10MC MCMC, comment puis-je déterminer son ou ses modes postérieurs dans R?
Question: Avec une chaîne MCMC à 10 dimensions, disons que je suis prêt à vous remettre une matrice des tirages: 100 000 itérations (lignes) par 10 paramètres (colonnes), comment identifier au mieux les modes postérieurs? Je suis particulièrement préoccupé par plusieurs modes. Contexte:Je me considère comme un statisticien averti en …

5
Omega au carré pour la mesure de l'effet dans R?
Le livre de statistiques que je lis recommande l'oméga carré pour mesurer les effets de mes expériences. J'ai déjà prouvé en utilisant un plan de parcelle divisé (mélange de plans intra-sujets et inter-sujets) que mes facteurs intra-sujets sont statistiquement significatifs avec p <0,001 et F = 17. Maintenant, je cherche …

1
Sortie du modèle logistique en R
J'essaie d'interpréter le type de modèle logistique suivant: mdl <- glm(c(suc,fail) ~ fac1 + fac2, data=df, family=binomial) Est la sortie des predict(mdl)chances de réussite attendues pour chaque point de données? Existe-t-il un moyen simple de tabuler les cotes pour chaque niveau de facteur du modèle, plutôt que pour tous les …



1
Trouvez UMVUE sur
Laissez X1,X2,...,XnX1,X2,...,XnX_1, X_2, . . . , X_n be iid variables aléatoires ayant pdf fX(x∣θ)=θ(1+x)−(1+θ)I(0,∞)(x)fX(x∣θ)=θ(1+x)−(1+θ)I(0,∞)(x)f_X(x\mid\theta) =\theta(1 +x)^{−(1+\theta)}I_{(0,\infty)}(x) où θ>0θ>0\theta >0 . Donnez l'UMVUE de 1θ1θ\frac{1}{\theta} et calculer sa variance J'ai appris deux de ces méthodes pour obtenir des UMVUE: Limite inférieure de Cramer-Rao (CRLB) Lehmann-Scheffe Thereom Je vais tenter cela …

1
Standardisation des variables et colinéarité
La colinéarité peut poser certains problèmes dans différents types de problèmes de régression. En particulier, cela peut rendre les estimations des paramètres très variées et instables. Diverses méthodes ont été proposées pour y remédier, notamment la régression des crêtes, la régression des moindres carrés partiels, la régression des composantes principales, …

2
Pourquoi ne pas utiliser le théorème de Bayes sous la forme ?
Il y a beaucoup de questions (comme celle-ci ) sur une ambiguïté avec la formule bayésienne en cas continu. p(θ|x)=p(x|θ)⋅p(θ)p(x)p(θ|x)=p(x|θ)⋅p(θ)p(x)p(\theta | x) = \frac{p(x | \theta) \cdot p(\theta)}{p(x)} Souvent, la confusion vient du fait que la définition de la distribution conditionnelle est expliquée comme étant fonction de la donnée fixe …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.