Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données



1
Pourquoi est-il important d'inclure un terme de correction de biais pour l'optimiseur Adam pour l'apprentissage en profondeur?
Je lisais sur l' optimiseur Adam pour le Deep Learning et suis tombé sur la phrase suivante dans le nouveau livre Deep Learning de Begnio, Goodfellow et Courtville: Adam inclut des corrections de biais dans les estimations des moments du premier ordre (le terme de momentum) et des moments du …

2
Différence entre la sélection d'entités basée sur la «régression F» et basée sur les valeurs ?
La comparaison d'entités utilise-t-elle F-regressionla même chose que la corrélation individuelle d'entités avec l'étiquette et l'observation de la valeur ?R2R2R^2 J'ai souvent vu mes collègues utiliser une F regressionsélection de fonctionnalités dans leur pipeline d'apprentissage automatique à partir de sklearn: sklearn.feature_selection.SelectKBest(score_func=sklearn.feature_selection.f_regression...)` Certains me disent s'il vous plaît - pourquoi cela …

1
La malédiction dimensionnelle affecte-t-elle certains modèles plus que d'autres?
Les endroits que j'ai lus sur la malédiction de la dimensionnalité l'expliquent conjointement avec kNN principalement et les modèles linéaires en général. Je vois régulièrement les meilleurs classeurs de Kaggle utiliser des milliers d'entités sur un ensemble de données qui ne contient pratiquement pas 100 000 points de données. Ils …


2
Pourquoi lrtest () ne correspond pas à anova (test = “LRT”)
Je cherchais des moyens de faire un test de rapport de vraisemblance en R pour comparer les ajustements du modèle. Je l'ai d'abord codé moi-même, puis j'ai trouvé la anova()fonction par défaut et également lrtest()dans le lmtestpackage. Cependant, lorsque j'ai vérifié, anova()produit toujours une valeur de p légèrement différente des …

1
La régression logistique glmnet peut-elle gérer directement les variables factorielles (catégorielles) sans avoir besoin de variables fictives? [fermé]
Fermé. Cette question est hors sujet . Il n'accepte pas actuellement les réponses. Voulez-vous améliorer cette question? Mettez à jour la question afin qu'elle soit sur le sujet pour la validation croisée. Fermé il y a 3 ans . Je construis une régression logistique en R en utilisant la méthode …

1
Relation entre la distribution gamma et khi carré
Si où , c'est-à-dire que tous les sont iid des variables aléatoires normales de zéro moyenne avec les mêmes variances, puisY=∑i=1NX2iY=∑i=1NXi2Y=\sum_{i=1}^{N}X_i^2Xi∼N(0,σ2)Xi∼N(0,σ2)X_i \sim \mathcal{N}(0,\sigma^2)XiXiX_iY∼Γ(N2,2σ2).Y∼Γ(N2,2σ2).Y \sim \Gamma\left(\frac{N}{2},2\sigma^2\right). Je sais que la distribution du chi-carré est un cas particulier de la distribution gamma, mais n'a pas pu obtenir la distribution chi-carré pour la …




1
logloss vs gini / auc
J'ai formé deux modèles (classificateurs binaires utilisant h2o AutoML) et je veux en sélectionner un à utiliser. J'ai les résultats suivants: model_id auc logloss logloss_train logloss_valid gini_train gini_valid DL_grid_1 0.542694 0.287469 0.092717 0.211956 0.872932 0.312975 DL_grid_2 0.543685 0.251431 0.082616 0.186196 0.900955 0.312662 les colonnes aucet loglosssont les métriques de validation …



En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.