Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

3
Pondération des données plus récentes dans le modèle de forêt aléatoire
J'entraîne un modèle de classification avec Random Forest pour faire la distinction entre 6 catégories. Mes données transactionnelles ont environ 60k + observations et 35 variables. Voici un exemple de son apparence approximative. _________________________________________________ |user_id|acquisition_date|x_var_1|x_var_2| y_vay | |-------|----------------|-------|-------|--------| |111 | 2013-04-01 | 12 | US | group1 | |222 | …




4
La méthodologie de la forêt aléatoire peut-elle être appliquée aux régressions linéaires?
Les forêts aléatoires fonctionnent en créant un ensemble d'arbres de décision où chaque arbre est créé en utilisant un échantillon bootstrap des données de formation d'origine (échantillon à la fois de variables d'entrée et d'observations). Un processus similaire peut-il être appliqué pour la régression linéaire? Créer k modèles de régression …







1
Quand faut-il inclure le décalage de la variable dépendante dans un modèle de régression et quel décalage?
Les données que nous voulons utiliser comme variable dépendante ressemblent à ceci (ce sont des données de comptage). Nous craignons qu'étant donné sa composante cyclique et sa structure tendancielle, la régression se révèle en quelque sorte biaisée. Nous utiliserons une régression binomiale négative au cas où cela aiderait. Les données …

1
Raccord de distribution bêta dans Scipy
Selon Wikipedia, la distribution de probabilité bêta a deux paramètres de forme: et β .αα\alphaββ\beta Lorsque j'appelle scipy.stats.beta.fit(x)en Python, où se xtrouve un groupe de nombres dans la plage , 4 valeurs sont renvoyées. Cela me semble étrange.[ 0 , 1 ][0,1][0,1] Après avoir recherché sur Google, j'ai trouvé que …


2
Relation entre la plage et l'écart type
Dans un article, j'ai trouvé la formule de l'écart-type d'une taille d'échantillon NNN σ=R¯¯¯¯2.534σ=R¯2.534\sigma=\frac{\overline{R}}{2.534} où est la plage moyenne de sous-échantillons (taille ) de l'échantillon principal. Comment le nombre est-il calculé? C'est le bon numéro? 62,534R¯¯¯¯R¯\overline{R}6662.5342.5342.534

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.