Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


2
Problème de couleur de l'ampoule
Veuillez d'abord examiner le petit problème suivant: Il y a deux ampoules indiscernables A et B. A clignote en rouge avec prob .8 et bleu avec prob .2; B rouge avec .2 et bleu .8. Maintenant, avec 0,5 prob, vous êtes présenté avec A ou B. Vous êtes censé observer …




1
Ajuster une droite de régression robuste à l'aide d'un estimateur MM dans R
Le contexte. Je voudrais ajuster une droite de régression pour étudier la relation entre une variable de réponse et une covariable continue . En raison de la présence de mauvais points de levier, j'ai opté pour un estimateur MM au lieu de l'estimateur LS habituel.yyyXxx Méthodologie. Fondamentalement, l'estimation MM est …
8 r  robust 

4
Problèmes d'interprétation des tests d'hypothèses
Deux choses m'ont toujours dérangé à propos des tests d'hypothèses: La chance que la moyenne de la population soit exactement un nombre donné (à condition que la variable aléatoire en question soit continue) est toujours nulle, n'est-ce pas? Par conséquent, nous devons toujours rejeter l'hypothèse nulle ... Si le résultat …

1
Erreur standard de l'écart type d'échantillon des proportions
J'ai récemment commencé à lire Gelman et Hill's, "Data Analysis Using Regression and Multilevel / Hierarchical Models" et la question est basée sur cela: L'échantillon contient 6 observations sur les proportions: p1,p2,…,p6p1,p2,…,p6p_{1}, p_{2}, \dots, p_{6} Chaque pipip_{i} a signifie πiπi\pi_{i} et variance πi(1−πi)niπi(1−πi)ni\frac{\pi_{i}(1-\pi_{i})}{n_i}, où ninin_{i} est le nombre d'observations utilisées …





2
Existe-t-il une référence qui légitime l'utilisation du test z non groupé pour comparer deux proportions?
Le test z pour comparer deux proportions est . Il est généralement défini quez=p^1−p^2Var(p^1−p^2)√z=p^1−p^2Var(p^1−p^2)\newcommand{\p}{\hat{p}}\newcommand{\v}{\mathrm{Var}} z=\frac{\p_1-\p_2}{\sqrt{\v(\p_1-\p_2)}} Var(p^1−p^2)=p^(1−p^)(1/n1+1/n2),Var(p^1−p^2)=p^(1−p^)(1/n1+1/n2),\v(\p_1-\p_2)=\p(1-\hat{p})(1/n_1+1/n_2), où p^=n1p^1+n2p^2n1+n2.p^=n1p^1+n2p^2n1+n2.\p=\frac{n_1 \p_1+n_2 \p_2}{n_1+n_2}. Y a-t-il une référence écrite qui me légitime à la place d'utiliser la variance non regroupée, c'est-à-dire V a r (p^1-p^2) =p^1( 1 -p^1)n1+p^2( 1 -p^2)n2?Vuner(p^1-p^2)=p^1(1-p^1)n1+p^2(1-p^2)n2?\v(\p_1-\p_2)=\frac{\p_1(1-\p_1)}{n_1}+\frac{\p_2(1-\p_2)}{n_2}?

4
Existe-t-il des exemples de packages R qui changent considérablement entre les versions, de sorte que les résultats d'une fonction statistique sont considérablement différents?
J'essaie de comprendre comment les gens utilisent les packages R et je me demandais s'il existe des cas documentés où les packages R ont produit des réponses différentes. Clarification: La motivation derrière cette question vient d'un effort dans lequel je suis impliqué où le but de comprendre l'importance de la …
8 r 


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.