Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Comment justifier rigoureusement les taux d'erreur faux positifs / faux négatifs choisis et le ratio de coûts sous-jacent?
Le contexte Un groupe de sociologues et de statisticiens ( Benjamin et al., 2017 ) ont récemment suggéré que le taux de faux positifs typique ( = .05) utilisé comme seuil pour déterminer la «signification statistique» devait être ajusté à un seuil plus conservateur. ( = .005). Un groupe concurrent …

1
Forme matricielle de rétropropagation avec normalisation par lots
La normalisation des lots a été attribuée à des améliorations substantielles des performances dans les réseaux neuronaux profonds. De nombreux documents sur Internet montrent comment l'implémenter sur une base d'activation par activation. J'ai déjà implémenté backprop en utilisant l'algèbre matricielle, et étant donné que je travaille dans des langages de …

5
lorsque et indépendamment
XXX et sont des variables aléatoires distribuées indépendamment où et . Quelle est la distribution de ?YYYX∼χ2(n−1)X∼χ(n−1)2X\sim\chi^2_{(n-1)}Y∼Beta(n2−1,n2−1)Y∼Beta(n2−1,n2−1)Y\sim\text{Beta}\left(\frac{n}{2}-1,\frac{n}{2}-1\right)Z=(2Y−1)X−−√Z=(2Y−1)XZ=(2Y-1)\sqrt X La densité conjointe de est donnée par(X,Y)(X,Y)(X,Y) fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x>0,0<y<1}fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x>0,0<y<1}f_{X,Y}(x,y)=f_X(x)f_Y(y)=\frac{e^{-\frac{x}{2}}x^{\frac{n-1}{2}-1}}{2^{\frac{n-1}{2}}\Gamma\left(\frac{n-1}{2}\right)}\cdot\frac{y^{\frac{n}{2}-2}(1-y)^{\frac{n}{2}-2}}{B\left(\frac{n}{2}-1,\frac{n}{2}-1\right)}\mathbf1_{\{x>0\,,\,00\,,\,|z|


3
Le chercheur 1 exécute 1000 régressions, le chercheur 2 exécute seulement 1, les deux obtiennent les mêmes résultats - devraient-ils faire des inférences différentes?
Imaginez qu'un chercheur explore un ensemble de données et exécute 1000 régressions différentes et qu'il trouve entre elles une relation intéressante. Imaginez maintenant qu'un autre chercheur avec les mêmes données exécute une seule régression, et il s'avère que c'est le même que l'autre chercheur a pris 1000 régressions pour trouver. …

1
Les root sont-elles recommandées?
Mon collègue veut analyser certaines données après avoir transformé la variable de réponse en la portant à la puissance de (c'est-à-dire ).1818\frac18y0.125y0.125y^{0.125} Je suis mal à l'aise avec cela, mais j'ai du mal à expliquer pourquoi. Je ne peux penser à aucune justification mécanique de cette transformation. Je ne l'ai …

1
Modèles additifs généralisés (GAM), interactions et covariables
J'ai exploré un certain nombre d'outils de prévision et j'ai trouvé que les modèles additifs généralisés (GAM) avaient le plus de potentiel à cette fin. Les GAM sont super! Ils permettent de spécifier très succinctement des modèles complexes. Cependant, cette même concision me cause une certaine confusion, en particulier en …
12 r  modeling  gam  mgcv 


1
Résumé d'un ajustement GAM
Si nous adaptons un GAM comme: gam.fit = gam::gam(Outstate ~ Private + s(Room.Board, df = 2) + s(PhD, df = 2) + s(perc.alumni, df = 2) + s(Expend, df = 5) + s(Grad.Rate, df = 2), data = College) Où, nous utilisons l'ensemble de données College, qui peut être trouvé …
12 anova  gam 


2
Exemple de construction montrant
Comment construire un exemple de distribution de probabilité pour laquelle est valable, en supposant que ?E(1X)=1E(X)E(1X)=1E(X)\mathbb{E}\left(\frac{1}{X}\right)=\frac{1}{\mathbb{E}(X)}P(X≠0)=1P(X≠0)=1\mathbb{P}(X\ne0)=1 L'inégalité qui découle de l'inégalité de Jensen pour un RV valeur positive est comme (l'inégalité inverse si ). En effet, le mappage est convexe pour et concave pour . En suivant la condition d'égalité …

1
Comment traiter les données manquantes lors de l'utilisation de splines ou de polynômes fractionnaires?
Je lis Multivariable Model Building: A Pragmatic Approach to Regression Analysis Based on Fractional Polynomials for Modeling Continuous Variables par Patrick Royston et Willie Sauerbrei. Jusqu'à présent, je suis impressionné et c'est une approche intéressante que je n'avais pas envisagée auparavant. Mais les auteurs ne traitent pas des données manquantes. …

3
Existe-t-il quelqu'un plus vite qu'Usain Bolt aujourd'hui?
EDIT: Je suis plus intéressé par les problèmes techniques et la méthodologie de détermination de la probabilité d'un "vrai" maximum dans une population donnée, à partir d'un échantillon statistique. Il y a des problèmes d'estimation de la probabilité de coureurs plus rapides que M. Bolt à partir de temps de …

3
L'optimisation PCA est-elle convexe?
La fonction objective de l'analyse en composantes principales (ACP) minimise l'erreur de reconstruction dans la norme L2 (voir la section 2.12 ici . Une autre vue essaie de maximiser la variance sur la projection. Nous avons également un excellent article ici: Quelle est la fonction objective de l'ACP ? ). …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.