Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Supposons que nous ayons des variables aléatoires IIDX1,…,XnX1,…,XnX_1,\dots,X_n avec la distribution Ber(θ)Ber(θ)\mathrm{Ber}(\theta) . Nous allons observer un échantillon du XiXiX_i 's de la manière suivante: Soit Y1,…,YnY1,…,YnY_1,\dots,Y_n être indépendant Ber(1/2)Ber(1/2)\mathrm{Ber}(1/2) variables aléatoires, supposons que tous les XiXiX_i ' s et YiYiY_i sont indépendants et définissent la taille de l'échantillon N=∑ni=1YiN=∑i=1nYiN=\sum_{i=1}^n …
Ici, la mauvaise interprétation de l'hypothèse de normalité dans la régression linéaire est discutée (que la `` normalité '' fait référence au X et / ou au Y plutôt qu'aux résidus), et l'affiche demande s'il est possible d'avoir X et Y non distribués normalement et ont encore des résidus normalement …
Nous avons deux cohortes de 1000 échantillons chacune. Nous mesurons 2 quantités sur chaque cohorte. Le premier est une variable binaire. Le second est un nombre réel qui suit une distribution de queue lourde. Nous voulons évaluer la cohorte la plus performante pour chaque métrique. Il existe de nombreux tests …
Je sais comment effectuer l'ACP (analyse en composantes principales), mais j'aimerais connaître les étapes qui devraient être utilisées pour l'analyse factorielle. Pour effectuer l'ACP, considérons une matrice , par exemple:AAA 3 1 -1 2 4 0 4 -2 -5 11 22 20 J'ai calculé sa matrice de corrélation B = …
J'essaie de trouver la distribution caractéristique la plus appropriée des données de mesures répétées d'un certain type. Essentiellement, dans ma branche de la géologie, nous utilisons souvent la datation radiométrique des minéraux à partir d'échantillons (morceaux de roche) afin de savoir depuis combien de temps un événement s'est produit (la …
Je me demandais comment les CI d'amorçage (et BCa en barticulaire) fonctionnent sur les données normalement distribuées. Il semble y avoir beaucoup de travail examinant leurs performances sur différents types de distributions, mais n'a rien trouvé sur les données normalement distribuées. Comme il semble évident d'étudier d'abord, je suppose que …
J'ai un très grand ensemble de données et il manque environ 5% de valeurs aléatoires. Ces variables sont corrélées entre elles. L'exemple de jeu de données R suivant n'est qu'un exemple de jouet avec des données corrélées factices. set.seed(123) # matrix of X variable xmat <- matrix(sample(-1:1, 2000000, replace = …
Mes données sont décrites ici. Qu'est-ce qui peut provoquer une "erreur () est une erreur singulière" dans aov lors de l'ajustement d'un ANOVA à mesures répétées? J'essaie de voir l'effet d'une interaction en utilisant lmerdonc mon cas de base est: my_null.model <- lmer(value ~ Condition+Scenario+ (1|Player)+(1|Trial), data = my, REML=FALSE) …
J'ai lu les nombreuses excellentes discussions sur le site concernant l'interprétation des intervalles de confiance et des intervalles de prédiction, mais un concept est encore un peu déroutant: Considérons le framework OLS et nous avons obtenu le modèle ajusté . On nous donne un et on nous a demandé de …
Nous étudions les tests statistiques bayésiens et rencontrons un phénomène étrange (du moins pour moi). Prenons le cas suivant: nous souhaitons mesurer quelle population, A ou B, a un taux de conversion plus élevé. Pour un contrôle d' , nous définissons , c'est-à-dire que la probabilité de conversion est égale …
Quelle est la valeur de p critique utilisée par la step()fonction dans R pour la régression pas à pas? Je suppose que c'est 0,15, mais mon hypothèse est-elle correcte? Comment puis-je changer la valeur de p critique?
Les modèles linéaires à effets mixtes ne sont pas couramment utilisés dans mon domaine de la biologie, et je dois signaler le test statistique que j'ai utilisé dans un article que j'essaie d'écrire. Je sais que la prise de conscience de la modélisation multiniveau commence à apparaître dans certains domaines …
Supposons que nous avons un modèle linéaire Model1et vcov(Model1)donne la matrice suivante: (Intercept) latitude sea.distance altitude (Intercept) 28.898100 -23.6439000 -34.1523000 0.50790600 latitude -23.643900 19.7032500 28.4602500 -0.42471450 sea.distance -34.152300 28.4602500 42.4714500 -0.62612550 altitude 0.507906 -0.4247145 -0.6261255 0.00928242 Pour cet exemple, qu'est-ce que cette matrice affiche réellement? Quelles hypothèses pouvons-nous faire en …
Il existe un podcast NPR appelé Intelligence Squared. Chaque épisode est la diffusion d'un débat en direct sur une déclaration litigieuse telle que "Le 2e amendement n'est plus pertinent" ou "L'action positive sur les campus universitaires fait plus de mal que de bien". Quatre représentants débattent - deux pour la …
J'ai deux échantillons fortement asymétriques et j'essaie d'utiliser le bootstrap pour comparer leurs moyennes en utilisant la statistique t. Quelle est la bonne procédure pour le faire? Le processus que j'utilise Je m'inquiète de l'opportunité d'utiliser l'erreur type des données originales / observées à l'étape finale lorsque je sais que …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.