Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Dans Random Forest, chaque arbre est cultivé en parallèle sur un échantillon boostrap unique des données. Étant donné que chaque échantillon boostrap devrait contenir environ 63% d'observations uniques, cela laisse environ 37% d'observations, qui peuvent être utilisées pour tester l'arbre. Maintenant, il semble que dans le boosting de gradient stochastique, …
J'ai un ensemble de données avec une variable continue et une variable cible binaire (0 et 1). Je dois discrétiser les variables continues (pour la régression logistique) par rapport à la variable cible et avec la contrainte que la fréquence d'observation dans chaque intervalle soit équilibrée. J'ai essayé des algorithmes …
Compte tenu de cas de cancer du poumon et de témoins appariés (sans cancer du poumon) (appariement basé sur l'âge, le sexe, etc.). Pour essayer de trouver des preuves entre l'effet du tabagisme sur le cancer du poumon, j'ai utilisé le test exact de Fisher sur le tableau de contingence. …
Cet article affirme que dans CART, car une division binaire est effectuée sur une seule covariable à chaque étape, toutes les divisions sont orthogonales et donc les interactions entre les covariables ne sont pas prises en compte. Cependant, de nombreuses références très sérieuses affirment, au contraire, que la structure hiérarchique …
Il est bien connu qu'une combinaison linéaire de 2 variables normales aléatoires est également une variable normale aléatoire. Y a-t-il des familles de distribution non normales communes (par exemple, Weibull) qui partagent également cette propriété? Il semble y avoir de nombreux contre-exemples. Par exemple, une combinaison linéaire d'uniformes n'est généralement …
12 enseignants enseignent à 600 élèves. Les 12 cohortes enseignées par ces enseignants varient en taille de 40 à 90 étudiants, et nous nous attendons à des différences systématiques entre les cohortes, car les étudiants diplômés ont été répartis de manière disproportionnée dans des cohortes particulières, et l'expérience antérieure a …
Je pensais, puisque sont de et ils sont indépendants, alorsX,YX,YX, YN(0,1)N(0,1)N(0,1) X−2YX−2YX - 2Y a une distribution de . Alors a une probabilité de .N(0,5)N(0,5)N(0, 5)X−2Y>0X−2Y>0X-2Y > 01/21/21/2 Ce qui précède me semble correct, bien qu'il semble que aurait alors une probabilité de . Cela semble un peu faux. Ai-je …
Aujourd'hui, j'ai parcouru le livre "Théorie de l'information: une introduction au didacticiel" de James Stone et réfléchi un instant ou deux à l' étendue de l'utilisation de la théorie de l'information en science des données appliquée (si vous n'êtes pas à l'aise avec ce terme encore quelque peu flou, pensez …
Juste pour le plaisir, je veux représenter ma consommation mensuelle d'électricité d'une année à l'autre. Cependant, je souhaite inclure une référence à la température mensuelle afin de pouvoir déterminer si ma maison ou mon comportement s'améliore, s'aggrave ou se maintient en ce qui concerne l'utilisation du kWh. Les données avec …
Donc, pour le plaisir, je prends certaines données d'appels du centre d'appels où je travaille et j'essaie de faire des tests d'hypothèse sur eux, en particulier le nombre d'appels reçus en une semaine, et j'utilise une distribution de Poisson pour l'adapter. En raison de l'objet de mon travail, il existe …
Un dé à 6 faces est lancé de manière itérative. Quel est le nombre attendu de rouleaux requis pour faire une somme supérieure ou égale à K? Avant de modifier P(Sum>=1 in exactly 1 roll)=1 P(Sum>=2 in exactly 1 roll)=5/6 P(Sum>=2 in exactly 2 rolls)=1/6 P(Sum>=3 in exactly 1 roll)=5/6 …
Parfois, nous supposons que les régresseurs sont fixes, c'est-à-dire qu'ils ne sont pas stochastiques. Je pense que cela signifie que tous nos prédicteurs, estimations de paramètres, etc. sont inconditionnels alors, non? Puis-je même aller si loin que ce ne sont plus des variables aléatoires? Si, d'un autre côté, nous acceptons …
J'effectue une analyse dont l'objectif principal est de comprendre les données. L'ensemble de données est suffisamment grand pour la validation croisée (10k), et les prédicteurs incluent des variables continues et factices, et le résultat est continu. L'objectif principal était de voir s'il était judicieux de supprimer certains prédicteurs, afin de …
J'ai probablement une question stupide à propos de laquelle, je dois l'avouer, je suis confus. Imaginez la génération répétée d' une matrice orthogonale (orthonormale) aléatoire uniformément distribuée d'une certaine taille . Parfois, la matrice générée a le déterminant et parfois elle a le déterminant . (Il n'y a que deux …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.