Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


2
Taille des échantillons bootstrap
J'apprends le bootstrap comme moyen d'estimer la variance d'un échantillon statistique. J'ai un doute fondamental. Citant de http://web.stanford.edu/class/psych252/tutorials/doBootstrapPrimer.pdf : • Combien d'observations devons-nous rééchantillonner? Une bonne suggestion est la taille de l'échantillon d'origine. Comment rééchantillonner autant d'observations que dans l'échantillon d'origine? Si j'ai un échantillon de 100 et que j'essaie …

1
Nomenclature gauche et droite dans les modèles de régression
y=β0+β1x1+ε0y=β0+β1x1+ε0y = \beta_{0} + \beta_{1}x_{1} + \varepsilon_{0} Le langage utilisé pour décrire les modèles de régression, comme la régression linéaire très simple spécifiée ci-dessus, varie souvent et ces variations entraînent souvent de subtils changements de sens. Par exemple, la partie du modèle sur le côté gauche de l'équation peut être …

1
Doutes sur la dérivation des équations de régression du processus gaussien dans un article
Je lis ce papier préimprimé et j'ai des difficultés à suivre leur dérivation des équations pour la régression du processus gaussien. Ils utilisent le réglage et la notation de Rasmussen & Williams . Ainsi, on suppose un additif, de moyenne nulle, stationnaire et normalement distribué avec la variance :σ2noiseσnoise2\sigma^2_{noise} y=f(x)+ϵ,ϵ∼N(0,σ2noise)y=f(x)+ϵ,ϵ∼N(0,σnoise2)y=f(\mathbf{x})+\epsilon, …



1
Exemple de la façon dont les statistiques bayésiennes peuvent estimer des paramètres très difficiles à estimer par des méthodes fréquentistes
Les statisticiens bayésiens soutiennent que "les statistiques bayésiennes peuvent estimer des paramètres très difficiles à estimer par des méthodes fréquentistes". La citation suivante tirée de cette documentation SAS dit-elle la même chose? Il fournit des inférences conditionnelles aux données et exactes, sans recours à une approximation asymptotique. L'inférence de petits …

2
Application de l'inférence variationnelle stochastique au mélange bayésien de gaussien
J'essaie d'implémenter le modèle de mélange gaussien avec l'inférence variationnelle stochastique, à la suite de cet article . C'est le pgm du mélange gaussien. Selon l'article, l'algorithme complet d'inférence variationnelle stochastique est: Et je suis encore très confus de la méthode pour l'adapter à GMM. Tout d'abord, je pensais que …

2
Images non carrées pour la classification des images
J'ai un ensemble de données d'images larges: 1760x128. J'ai lu des tutoriels et des livres, et la plupart d'entre eux indiquent que les images d'entrée doivent être carrées et sinon, elles sont transformées en carré afin d'être entraînées dans des CNN déjà formés (sur des images carrées). Existe-t-il un moyen …

3
Quelles sont les conséquences d'une variance non constante des termes d'erreur dans la régression linéaire?
L'une des hypothèses de régression linéaire est qu'il devrait y avoir une variance constante dans les termes d'erreur et que les intervalles de confiance et les tests d'hypothèse associés au modèle reposent sur cette hypothèse. Que se passe-t-il exactement lorsque les termes d'erreur n'ont pas de variance constante?

1
Pourquoi mes modèles VAR fonctionnent-ils mieux avec des données non stationnaires qu'avec des données stationnaires?
J'utilise la bibliothèque VAR de modèles de statistiques de python pour modéliser les données de séries temporelles financières et certains résultats m'ont laissé perplexe. Je sais que les modèles VAR supposent que les données des séries chronologiques sont stationnaires. J'ai ajusté par inadvertance une série non stationnaire de prix de …

2
Est-il réellement correct d'effectuer une sélection de fonctionnalités non supervisée avant la validation croisée?
Dans The Elements of Statistical Learning , j'ai trouvé l'énoncé suivant: Il y a une qualification: les étapes initiales de dépistage non supervisé peuvent être effectuées avant de laisser des échantillons. Par exemple, nous pourrions sélectionner les 1000 prédicteurs présentant la variance la plus élevée parmi les 50 échantillons, avant …

2
Les hypothèses des moindres carrés
Supposons la relation linéaire suivante: , où est la variable dépendante, une seule variable indépendante et le terme d'erreur.Y i X i u iOuije= β0+ β1Xje+ ujeYi=β0+β1Xi+uiY_i = \beta_0 + \beta_1 X_i + u_iOuijeYiY_iXjeXiX_iujeuiu_i Selon Stock & Watson (Introduction à l'économétrie; chapitre 4 ), la troisième hypothèse des moindres carrés …

2
Faut-il toujours faire du CV?
Ma question: dois-je faire du CV même pour un ensemble de données relativement volumineux? J'ai un ensemble de données relativement volumineux et j'appliquerai un algorithme d'apprentissage automatique à l'ensemble de données. Comme mon PC n'est pas rapide, le CV (et la recherche dans la grille) prend parfois trop de temps. …

1
Différence entre les types de SVM
Je suis nouveau pour supporter les machines vectorielles. Brève explication La svmfonction du e1071package dans R offre différentes options: Classification C nu-classification une classification (pour la détection de nouveautés) régression eps nu-regression Quelles sont les différences intuitives entre les cinq types? Lequel devrait être appliqué dans quelle situation?

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.