Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Le test de Shapiro Wilk est-il insensible aux queues de distribution des échantillons? J'ai lu une telle déclaration sur un papier mais je ne peux pas comprendre pourquoi à partir de sa statistique de test W. Quelqu'un pourrait-il m'aider à comprendre cela?
J'ai un peu de mal à comprendre le concept et la dérivation de la probabilité de données tronquées. Par exemple, si je veux trouver la fonction de vraisemblance basée sur un échantillon d'une distribution, mais en prenant un échantillon de la distribution, j'observe les valeurs tronquées (où il y a …
J'essaie de concevoir une technique de factorisation matricielle pour un élément utilisateur simple, un système de recommandation de notes. J'ai 2 questions à ce sujet. Tout d'abord dans une implémentation simple que j'ai vue de la technique de factorisation matricielle pour la recommandation de film, l'auteur vient d'initialiser les dimensions …
J'utilise un CFA et j'obtiens de bons indices d'ajustement (CFI = .99, RMSEA = .01) pour une échelle unidimensionnelle. Cependant, lorsque je teste la cohérence interne, j'obtiens les s de Cronbach pauvres ( ). J'ai tout essayé, de la suppression des valeurs aberrantes à la suppression d'éléments, et je me …
Dans une implémentation MCMC de modèles hiérarchiques, avec des effets aléatoires normaux et un Wishart antérieur pour leur matrice de covariance, l'échantillonnage de Gibbs est généralement utilisé. Cependant, si nous changeons la distribution des effets aléatoires (par exemple, vers Student's-t ou un autre), la conjugaison est perdue. Dans ce cas, …
J'aimerais trouver les limites min / max d'une fenêtre coulissante de taille minimale qui contient une certaine fraction du nombre total d'éléments dans un tableau ou une collection de nombres. Exemple: prendre des entiers pour faciliter l'explication, disons que la proportion d'éléments que nous recherchons est de 50% sur ce …
J'ai construit un modèle de régression logistique en R et bien que le résultat semble satisfaisant dans une certaine mesure, il y a une question que je ne suis pas en mesure de répondre. Je ne sais pas si mon approche est correcte. Je sais que l'objectif global du modèle …
La formule de dans un test d'hypothèse est donnée par: tttt=X¯−μσ^/n−−√.t=X¯−μσ^/n. t=\frac{\bar{X}-\mu}{\hat \sigma/\sqrt{n}}. Lorsque augmente, la valeur augmente selon la formule ci-dessus. Mais pourquoi la valeur critique diminue- mesure que (qui est une fonction de ) augmente?nnntttttttttdfdf\text{df}nnn
Je comprends comment la meilleure répartition est choisie pour la forêt aléatoire pour les prédicteurs numériques (caractéristiques). Les prédicteurs numériques sont triés puis pour chaque valeur, l'impureté ou l'entropie de Gini est calculée et un seuil est choisi qui donne la meilleure répartition. Mais quelle est la meilleure répartition choisie …
Bien que le titre de la question semble trivial, je voudrais expliquer qu'il n'est pas si trivial dans le sens où il est différent de la question d'appliquer le même test statistique dans des ensembles de données similaires pour tester une hypothèse nulle totale (méta-analyse, par exemple en utilisant la …
J'étudie deux populations géographiquement isolées de la même espèce. En examinant les distributions, je vois que les deux sont bimodales (il y a une certaine saisonnalité dans leur occurrence), mais les pics dans une population sont beaucoup plus élevés et beaucoup plus étroits (c'est-à-dire que la variance des pics locaux …
En faisant quelques simulations, j'ai réalisé que le quantile d'échantillon est un estimateur biaisé du vrai quantile. Et, selon mes simulations, potentiellement très biaisée. J'ai été surpris de ce résultat car le CDF empirique n'est pas biaisé, mais après quelques recherches sur Internet, j'ai découvert que c'était vrai . J'ai …
J'essaie de faire du SVM à une classe dans R. J'ai essayé d'utiliser le package kernlab e1071 / ksvm. Mais je ne sais pas si je le fais correctement. Existe-t-il un exemple de travail pour SVM à une classe dans R? Aussi, Je donne une grande matrice de prédicteurs sous …
Pour les données longitudinales avec un résultat numérique, je peux utiliser des tracés de spaghetti pour visualiser les données. Par exemple quelque chose comme ça (tiré du site UCLA Stats): tolerance<-read.table("http://www.ats.ucla.edu/stat/r/faq/tolpp.csv",sep=",", header=T) head(tolerance, n=10) interaction.plot(tolerance$time, tolerance$id, tolerance$tolerance, xlab="time", ylab="Tolerance", legend=F) Mais que se passe-t-il si mon résultat est binaire 0 …
Il y a quelque temps, j'ai posé une question sur la corrélation des temps entre les horodatages et j'ai reçu une réponse de Peter Ellis qui m'a dit que je pouvais calculer les distances moyennes entre les codes ... Cela vous donnera déjà une idée des comportements qui sont regroupés, …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.