Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Estimation d'erreur hors du sac pour augmenter?
Dans Random Forest, chaque arbre est cultivé en parallèle sur un échantillon boostrap unique des données. Étant donné que chaque échantillon boostrap devrait contenir environ 63% d'observations uniques, cela laisse environ 37% d'observations, qui peuvent être utilisées pour tester l'arbre. Maintenant, il semble que dans le boosting de gradient stochastique, …

1
Comment trouver et évaluer la discrétisation optimale pour une variable continue avec le critère
J'ai un ensemble de données avec une variable continue et une variable cible binaire (0 et 1). Je dois discrétiser les variables continues (pour la régression logistique) par rapport à la variable cible et avec la contrainte que la fréquence d'observation dans chaque intervalle soit équilibrée. J'ai essayé des algorithmes …



2
Combinaison linéaire de deux non normaux aléatoires qui est toujours membre de la même famille
Il est bien connu qu'une combinaison linéaire de 2 variables normales aléatoires est également une variable normale aléatoire. Y a-t-il des familles de distribution non normales communes (par exemple, Weibull) qui partagent également cette propriété? Il semble y avoir de nombreux contre-exemples. Par exemple, une combinaison linéaire d'uniformes n'est généralement …

2
Comment puis-je utiliser ces données pour calibrer des marqueurs avec différents niveaux de générosité dans la notation des articles des étudiants?
12 enseignants enseignent à 600 élèves. Les 12 cohortes enseignées par ces enseignants varient en taille de 40 à 90 étudiants, et nous nous attendons à des différences systématiques entre les cohortes, car les étudiants diplômés ont été répartis de manière disproportionnée dans des cohortes particulières, et l'expérience antérieure a …






1
Quelle est la différence entre le conditionnement sur les régresseurs et leur traitement comme fixe?
Parfois, nous supposons que les régresseurs sont fixes, c'est-à-dire qu'ils ne sont pas stochastiques. Je pense que cela signifie que tous nos prédicteurs, estimations de paramètres, etc. sont inconditionnels alors, non? Puis-je même aller si loin que ce ne sont plus des variables aléatoires? Si, d'un autre côté, nous acceptons …


1
LASSO pour les modèles explicatifs: paramètres réduits ou non?
J'effectue une analyse dont l'objectif principal est de comprendre les données. L'ensemble de données est suffisamment grand pour la validation croisée (10k), et les prédicteurs incluent des variables continues et factices, et le résultat est continu. L'objectif principal était de voir s'il était judicieux de supprimer certains prédicteurs, afin de …

1
Comment générer des matrices orthogonales uniformément aléatoires de déterminant positif?
J'ai probablement une question stupide à propos de laquelle, je dois l'avouer, je suis confus. Imaginez la génération répétée d' une matrice orthogonale (orthonormale) aléatoire uniformément distribuée d'une certaine taille . Parfois, la matrice générée a le déterminant et parfois elle a le déterminant . (Il n'y a que deux …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.