Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


2
Prédiction des besoins en mémoire CPU et GPU de la formation DNN
Disons que j'ai une architecture de modèle d'apprentissage en profondeur, ainsi qu'une taille de mini-lot choisie. Comment puis-je dériver de ces exigences de mémoire attendues pour la formation de ce modèle? Par exemple, considérons un modèle (non récurrent) avec une entrée de dimension 1000, 4 couches cachées entièrement connectées de …

1
Comment un estimateur qui minimise une somme pondérée de biais et de variance au carré s’inscrit-il dans la théorie de la décision?
D'accord - mon message d'origine n'a pas réussi à obtenir une réponse; alors, permettez-moi de poser la question différemment. Je commencerai par expliquer ma compréhension de l'estimation d'un point de vue théorique de la décision. Je n'ai aucune formation formelle et cela ne m'étonnerait pas si ma pensée était défectueuse …





1
Explication intuitive de la perte de journal
Dans plusieurs compétitions de kaggle, la notation était basée sur la "perte de log". Cela concerne l'erreur de classification. Voici une réponse technique mais je recherche une réponse intuitive. J'ai vraiment aimé les réponses à cette question sur la distance de Mahalanobis, mais PCA n'est pas logloss. Je peux utiliser …






2
Explication lucide de la «stabilité numérique de l'inversion matricielle» dans la régression des crêtes et son rôle dans la réduction de la surajustement
Je comprends que nous pouvons utiliser la régularisation dans un problème de régression des moindres carrés comme w∗=argminw[(y−Xw)T(y−Xw)+λ∥w∥2]w∗=argminw⁡[(y−Xw)T(y−Xw)+λ‖w‖2]\boldsymbol{w}^* = \operatorname*{argmin}_w \left[ (\mathbf y-\mathbf{Xw})^T(\boldsymbol{y}-\mathbf{Xw}) + \lambda\|\boldsymbol{w}\|^2 \right] et que ce problème a une solution de forme fermée comme: w^=(XTX+λI)−1XTy.w^=(XTX+λI)−1XTy.\hat{\boldsymbol{w}} = (\boldsymbol{X}^T\boldsymbol{X}+\lambda\boldsymbol{I})^{-1}\boldsymbol{X}^T\boldsymbol{y}. Nous voyons que dans la 2e équation, la régularisation consiste …

1
Y a-t-il des applications où SVM est encore supérieur?
L'algorithme SVM est assez ancien - il a été développé dans les années 1960, mais était extrêmement populaire dans les années 1990 et 2000. C'est une partie classique (et assez belle) des cours d'apprentissage automatique. Aujourd'hui, il semble que dans le traitement des médias (images, son, etc.) les réseaux de …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.