Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

4
GEE: choisir la bonne structure de corrélation de travail
Je suis un épidémiologiste qui essaie de comprendre les GEE afin d'analyser correctement une étude de cohorte (en utilisant la régression de Poisson avec un lien log, pour estimer le risque relatif). J'ai quelques questions sur la "corrélation de travail" que j'aimerais que quelqu'un de mieux informé clarifie: (1) Si …
19 gee 



2
ACP et analyse factorielle exploratoire sur le même ensemble de données: différences et similitudes; modèle factoriel vs PCA
Je voudrais savoir s'il est logique d'effectuer une analyse en composantes principales (ACP) et une analyse factorielle exploratoire (ALE) sur le même ensemble de données. J'ai entendu des professionnels recommander expressément: Comprendre le but de l'analyse et choisir PCA ou EFA pour l'analyse des données; Après avoir fait une analyse, …


3
Comment évaluer l'asymétrie à partir d'un boxplot?
Comment décider de l'asymétrie en regardant un boxplot construit à partir de ces données: 340, 300, 520, 340, 320, 290, 260, 330 Un livre dit: "Si le quartile inférieur est plus éloigné de la médiane que le quartile supérieur, alors la distribution est faussée." Plusieurs autres sources ont dit à …

2
Bootstrapping - dois-je d'abord supprimer les valeurs aberrantes?
Nous avons effectué un test fractionné d'une nouvelle fonctionnalité de produit et voulons mesurer si l'augmentation des revenus est significative. Nos observations ne sont certainement pas distribuées normalement (la plupart de nos utilisateurs ne dépensent pas, et parmi ceux qui le font, ils sont fortement biaisés vers de nombreux petits …

1
Lorsqu'un jacobien analytique est disponible, vaut-il mieux approximer le hessien par , ou par différences finies du jacobien?
Disons que je calcule certains paramètres du modèle en minimisant la somme des résidus au carré, et je suppose que mes erreurs sont gaussiennes. Mon modèle produit des dérivées analytiques, donc l'optimiseur n'a pas besoin d'utiliser des différences finies. Une fois l'ajustement terminé, je veux calculer les erreurs standard des …

1
Caret et coefficients (glmnet)
Je suis intéressé à utiliser le curseur pour faire des inférences sur un ensemble de données particulier. Est-il possible de faire ce qui suit: produire des coefficients d'un modèle glmnet que j'ai formé au caret. Je voudrais utiliser glmnet en raison de la sélection de fonctionnalités inhérentes car je ne …
19 caret  glmnet 



2
La forêt aléatoire est sur-adaptée?
J'expérimente avec des forêts aléatoires avec scikit-learn et j'obtiens d'excellents résultats de mon ensemble d'entraînement, mais des résultats relativement médiocres sur mon ensemble de test ... Voici le problème (inspiré du poker) que j'essaie de résoudre: étant donné les cartes fermées du joueur A, les cartes fermées du joueur B …



4
Problème avec la preuve de l'attente conditionnelle comme meilleur prédicteur
J'ai un problème avec la preuve de E(Y|X)∈argming(X)E[(Y−g(X))2]E(Y|X)∈arg⁡ming(X)E[(Y−g(X))2]E(Y|X) \in \arg \min_{g(X)} E\Big[\big(Y - g(X)\big)^2\Big] qui révèlent très probablement une incompréhension plus profonde des attentes et des attentes conditionnelles. La preuve que je connais va comme suit (une autre version de cette preuve peut être trouvée ici ) ===argming(X)E[(Y−g(x))2]argming(X)E[(Y−E(Y|X)+E(Y|X)−g(X))2]argming(x)E[(Y−E(Y|X))2+2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]argming(x)E[2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]arg⁡ming(X)E[(Y−g(x))2]=arg⁡ming(X)E[(Y−E(Y|X)+E(Y|X)−g(X))2]=arg⁡ming(x)E[(Y−E(Y|X))2+2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]=arg⁡ming(x)E[2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]\begin{align*} &\arg \min_{g(X)} …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.