Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
UMVUE de lors de l'échantillonnage à partir de la population
Soit un échantillon aléatoire de la densité(X1,X2,…,Xn)(X1,X2,…,Xn)(X_1,X_2,\ldots,X_n)fθ(x)=θxθ−110<x<1,θ>0fθ(x)=θxθ−110<x<1,θ>0f_{\theta}(x)=\theta x^{\theta-1}\mathbf1_{00 J'essaie de trouver l'UMVUE de .θ1+θθ1+θ\frac{\theta}{1+\theta} La densité conjointe de est(X1,…,Xn)(X1,…,Xn)(X_1,\ldots,X_n) fθ(x1,⋯,xn)=θn(∏i=1nxi)θ−110<x1,…,xn<1=exp[(θ−1)∑i=1nlnxi+nlnθ+ln(10<x1,…,xn<1)],θ>0fθ(x1,⋯,xn)=θn(∏i=1nxi)θ−110<x1,…,xn<1=exp⁡[(θ−1)∑i=1nln⁡xi+nln⁡θ+ln⁡(10<x1,…,xn<1)],θ>0\begin{align} f_{\theta}(x_1,\cdots,x_n)&=\theta^n\left(\prod_{i=1}^n x_i\right)^{\theta-1}\mathbf1_{00 \end{align} Comme la population pdf appartient à la famille exponentielle à un paramètre, cela montre qu'une statistique complète suffisante pour estfθfθf_{\theta}θθ\thetaT(X1,…,Xn)=∑i=1nlnXiT(X1,…,Xn)=∑i=1nln⁡XiT(X_1,\ldots,X_n)=\sum_{i=1}^n\ln X_i Comme , à première vue, me …

1
Probabilités négatives: explications profanes
J'ai été très intrigué par la réponse ici. J'aimerais avoir une explication plus profane de ce que les probabilités négatives pourraient signifier et de leurs applications, éventuellement avec des exemples. Par exemple, qu'est-ce que cela signifierait pour un événement d'avoir une probabilité de -10%, selon ces mesures étendues de probabilité?


3
Procès «pragmatiques»: quels sont-ils?
Sur Twitter, un journaliste Stuart Nicholls a critiqué une étude récemment publiée en disant: À la suite de l'article très intéressant de Dal-Re, ils signalent plusieurs exemples qui remettent en question l'utilisation du terme pragmatique. Un essai de phase 3, multisite, en double aveugle, contrôlé par placebo, à bras parallèles, …

2
Distribution et variance du nombre de triangles dans le graphique aléatoire
Considérons un graphe aléatoire Erdos-Renyi . L'ensemble des sommets est étiqueté par . L'ensemble des arêtes est construit par un processus aléatoire.G=(V(n),E(p))G=(V(n),E(p))G=(V(n),E(p))nnnVVVV={1,2,…,n}V={1,2,…,n}V = \{1,2,\ldots,n\}EEE Soit une probabilité , puis chaque paire non ordonnée de sommets ( ) se présente comme une arête dans de probabilité , indépendamment des autres paires.ppp0&lt;p&lt;10&lt;p&lt;10<p<1{i,j}{i,j}\{i,j\}i≠ji≠ji …

2
Justifications d'un modèle à effets fixes vs à effets aléatoires en méta-analyse
J'ai lu plusieurs publications tentant de justifier l'utilisation d'un modèle à effets fixes avec des affirmations du type "le modèle à effets fixes a été choisi parce que l'hétérogénéité était faible". Cependant, je crains qu'il ne s'agisse toujours d'une approche inappropriée de l'analyse des données. Y a-t-il des raisons ou …


2
Échantillonnage exact à partir de mélanges incorrects
Supposons que je veuille échantillonner à partir d'une distribution continue p(x)p(x)p(x) . Si j'ai une expression de ppp sous la forme p(x)=∑i=1∞aifi(x)p(x)=∑i=1∞aifi(x)p(x) = \sum_{i=1}^\infty a_i f_i(x) ai⩾0,∑iai=1ai⩾0,∑iai=1a_i \geqslant 0, \sum_i a_i= 1 pfifif_ippp Échantillonnage d'une étiquette avec une probabilitéa iiiiaiaia_i ÉchantillonnageX∼fiX∼fiX \sim f_i Est-il possible de généraliser cette procédure si …

4
Pourquoi les tests d'hypothèses sur les jeux de données rééchantillonnés rejettent-ils trop souvent le null?
tl; dr: En commençant par un ensemble de données généré sous la valeur nulle, j'ai rééchantillonné les cas avec remplacement et effectué un test d'hypothèse sur chaque ensemble de données rééchantillonné. Ces tests d'hypothèse rejettent le nul plus de 5% du temps. Dans la simulation ci-dessous, très simple, je génère …

1
Relation LASSO entre et
Ma compréhension de la régression LASSO est que les coefficients de régression sont sélectionnés pour résoudre le problème de minimisation: minβ∥y−Xβ∥22 s.t.∥β∥1≤tminβ‖y−Xβ‖22 s.t.‖β‖1≤t\min_\beta \|y - X \beta\|_2^2 \ \\s.t. \|\beta\|_1 \leq t En pratique, cela se fait en utilisant un multiplicateur de Lagrange, ce qui rend le problème à résoudre …

3
L'hypothèse de linéarité dans la régression linéaire n'est-elle qu'une définition de
Je révise la régression linéaire. Le manuel de Greene déclare: Maintenant, bien sûr, il y aura d'autres hypothèses sur le modèle de régression linéaire, telles que E(ϵ|X)=0E(ϵ|X)=0E(\epsilon|X)=0 . Cette hypothèse combinée à l'hypothèse de linéarité (qui définit en fait ϵϵ\epsilon ), structure le modèle. Cependant, l'hypothèse de linéarité en soi …

6
Exemples simples du monde réel pour l'enseignement des statistiques bayésiennes?
Je voudrais trouver des "exemples du monde réel" pour l'enseignement des statistiques bayésiennes. Les statistiques bayésiennes permettent d'incorporer formellement les connaissances antérieures dans une analyse. Je voudrais donner aux étudiants quelques exemples simples du monde réel de chercheurs incorporant des connaissances antérieures dans leur analyse afin que les étudiants puissent …

1
Quand ne pas utiliser la validation croisée?
En lisant le site, la plupart des réponses suggèrent que la validation croisée devrait être effectuée dans les algorithmes d'apprentissage automatique. Cependant, alors que je lisais le livre "Understanding Machine Learning", j'ai vu qu'il y avait un exercice selon lequel il vaut parfois mieux ne pas utiliser la validation croisée. …



En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.