Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données



1
Quel est le lien entre les moindres carrés partiels, la régression à rang réduit et la régression à composantes principales?
La régression à rang réduit et la régression à composantes principales ne sont-elles que des cas particuliers de moindres carrés partiels? Ce tutoriel (Page 6, "Comparaison des objectifs") indique que lorsque nous faisons des moindres carrés partiels sans projeter X ou Y (c'est-à-dire "non partiel"), cela devient une régression de …




2
La linéarité de la variance
Je pense que les deux formules suivantes sont vraies: Var(aX)=a2Var(X)Var(aX)=a2Var(X) \mathrm{Var}(aX)=a^2 \mathrm{Var}(X) tandis que a est un nombre constant si , Y sont indépendantsVar(X+Y)=Var(X)+Var(Y)Var(X+Y)=Var(X)+Var(Y) \mathrm{Var}(X + Y)=\mathrm{Var}(X)+\mathrm{Var}(Y) XXXYYY Cependant, je ne suis pas sûr de ce qui ne va pas avec ce qui suit: Var(2X)=Var(X+X)=Var(X)+Var(X)Var(2X)=Var(X+X)=Var(X)+Var(X)\mathrm{Var}(2X) = \mathrm{Var}(X+X) = \mathrm{Var}(X) + …


1
Dans la théorie de l'apprentissage statistique, n'y a-t-il pas un problème de surapprentissage sur un ensemble de test?
Examinons le problème de la classification de l'ensemble de données MNIST. Selon la page Web MNIST de Yann LeCun , «Ciresan et al.» a obtenu un taux d'erreur de 0,23% sur l'ensemble de test MNIST en utilisant le réseau neuronal convolutionnel. Notons l'ensemble de formation MNIST comme DtrainDtrainD_{train} , l'ensemble …

1
Forfait R pour la forêt aléatoire pondérée? option classwt?
J'essaie d'utiliser Random Forest pour prédire le résultat d'un ensemble de données extrêmement déséquilibré (le taux de classe minoritaire n'est que d'environ 1% ou même moins). Étant donné que l'algorithme traditionnel de la forêt aléatoire minimise le taux d'erreur global, plutôt que d'accorder une attention particulière aux classes minoritaires, il …
16 r  random-forest 

3
Qu'est-ce qu'une distribution exactement?
Je connais très peu de probabilités et de statistiques, et je souhaite apprendre. Je vois le mot «distribution» utilisé partout dans différents contextes. Par exemple, une variable aléatoire discrète a une «distribution de probabilité». Je sais ce que c'est. Une variable aléatoire continue a une fonction de densité de probabilité, …


3
Pourquoi une statistique suffisante contient toutes les informations nécessaires pour calculer une estimation du paramètre?
Je viens de commencer à étudier les statistiques et je n'arrive pas à comprendre intuitivement la suffisance. Pour être plus précis, je ne comprends pas comment montrer que les deux paragraphes suivants sont équivalents: En gros, étant donné un ensemble X de données indépendantes distribuées de manière identique conditionnées sur …



En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.