Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Supposons que j'ai un ensemble de données à dimensions où les N dimensions sont à peu près orthogonales (ont une corrélation nulle).NNNNNN Existe-t-il une utilité en termes de: Visualisation Représentation (pour l'efficacité du classificateur) Ou d'autres critères effectuer une réduction de dimensionnalité sur les données?
En fait, j'hésite à poser cette question, car je crains d'être renvoyé à d'autres questions ou à Wikipédia sur l'échantillonnage de Gibbs, mais je n'ai pas l'impression qu'ils décrivent ce qui est à portée de main. Étant donné une probabilité conditionnelle : p(x|y)p(x|y)p(x|y)p(x|y)x=x0x=x1y=y01434y=y12646p(x|y)y=y0y=y1x=x01426x=x13446 \begin{array}{c|c|c} p(x|y) & y = y_0 & …
Je regardais un sondage WashingtonTimes / ABC, et la ventilation des résultats, en particulier par âge, m'a paru surprenante. Je suis donc allé chercher des biais. Il a déclaré: "un sondage a été réalisé par téléphone du 11 au 14 décembre 2014 auprès d'un échantillon aléatoire de 1 000 adultes. …
En lisant le livre All of Statistics de Wassermann, je remarque une subtilité fine dans la définition des valeurs de p, que je ne peux pas comprendre. De manière informelle, le Wassermann définit la valeur de p comme [..] la probabilité (sous ) d'observer une valeur de la statistique de …
J'ai deux jeux de données: Mon premier ensemble de données est la valeur d'un investissement (en milliards de dollars) par rapport au temps, chaque unité de temps étant un quart depuis le premier trimestre de 1947. Le délai s'étend jusqu'au troisième trimestre de 2002. Mon deuxième ensemble de données est …
J'ai créé un histogramme pour l'âge du répondant et j'ai réussi à obtenir une très belle courbe en forme de cloche, à partir de laquelle j'ai conclu que la distribution était normale. J'ai ensuite exécuté le test de normalité dans SPSS, avec n = 169. La valeur de p (Sig.) …
J'imagine que le contrôle d'une variable dans votre plan d'étude est plus efficace pour réduire l'erreur que le contrôle post-hoc dans votre modèle de régression. Quelqu'un voudrait-il expliquer officiellement en quoi ces deux exemples de «contrôle» diffèrent? Dans quelle mesure sont-ils relativement efficaces pour réduire les erreurs et produire des …
Les études d'événement sont très répandues en économie et en finance pour déterminer l'effet d'un événement sur le cours d'une action, mais elles sont presque toujours basées sur un raisonnement fréquentiste. Une régression OLS - sur une période de référence distincte de la fenêtre d'événement - est généralement utilisée pour …
J'essaie de résoudre l'exercice suivant, mais je n'ai en fait aucune idée de la façon de commencer à le faire. J'ai trouvé un code dans mon livre qui lui ressemble mais c'est un exercice complètement différent et je ne sais pas comment les relier les uns aux autres. Comment puis-je …
Je suis en train de développer une application de prévision dont le but est de permettre à un importateur de prévoir la demande de ses produits à partir de son réseau client de distributeurs. Les chiffres des ventes sont un assez bon indicateur de la demande, tant qu'il existe un …
J'essaie d'automatiser la détection des valeurs aberrantes dans les séries chronologiques et j'ai utilisé une modification de la solution proposée par Rob Hyndman ici . Disons que je mesure les visites quotidiennes d'un site Web de divers pays. Pour certains pays où les visites quotidiennes sont de quelques centaines ou …
Pourquoi les générateurs de nombres aléatoires comme runif()dans R ne génèrent-ils pas le même résultat à chaque fois? Par exemple: X <- runif(100) X génère des sorties différentes à chaque fois. Quelle est la raison de générer des sorties différentes à chaque fois? De quelles fonctionnalités dispose-t-il en arrière-plan pour …
Problème suivant: Je veux prédire une variable de réponse catégorielle avec une (ou plusieurs) variables catégorielles en utilisant glmnet (). Cependant, je ne peux pas comprendre la sortie que me donne glmnet. Ok, commençons par générer deux variables catégorielles liées: Générer des données p <- 2 #number variables mu <- …
J'essaie d'effectuer une régression au lasso, qui a la forme suivante: Minimiser www dans (Y−Xw)′(Y−Xw)+λ|w|1(Y−Xw)′(Y−Xw)+λ|w|1(Y - Xw)'(Y - Xw) + \lambda \;|w|_1 Étant donné unλλ\lambda , on m'a conseillé de trouver le optimal wwwà l'aide de la programmation quadratique, qui prend la forme suivante: Minimiser xxx en , sous réserve …
Chaque énoncé que je trouve de l'estimateur de James-Stein suppose que les variables aléatoires estimées ont la même variance (et l'unité). Mais tous ces exemples mentionnent également que l'estimateur JS peut être utilisé pour estimer des quantités n'ayant rien à voir les unes avec les autres. L' exemple de wikipedia …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.