Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

3
Idée et intuition derrière l'estimation du maximum de vraisemblance (QMLE)
Des questions): Quelle est l'idée et l'intuition derrière l'estimation du maximum de vraisemblance (QMLE; également connue sous le nom d'estimation du pseudo maximum de vraisemblance, PMLE)? Qu'est-ce qui fait que l'estimateur fonctionne lorsque la distribution d'erreur réelle ne correspond pas à la distribution d'erreur supposée? Le site Wikipedia pour QMLE …

5
Distribution du rapport entre deux variables aléatoires uniformes indépendantes
Supposons que XXX et YYY sont standard uniformément distribués dans [0,1][0,1][0, 1] , et ils sont indépendants, quel est le PDF de Z=Y/XZ=Y/XZ = Y / X ? La réponse d'un manuel de théorie des probabilités est fZ(z)=⎧⎩⎨1/2,1/(2z2),0,if 0≤z≤1if z>1otherwise.fZ(z)={1/2,if 0≤z≤11/(2z2),if z>10,otherwise. f_Z(z) = \begin{cases} 1/2, & \text{if } 0 …


1
Dans une forêt aléatoire, un% IncMSE plus important est-il meilleur ou pire?
Une fois que j'ai construit un modèle de forêt aléatoire (de régression) dans R, l'appel rf$importanceme fournit deux mesures pour chaque variable prédictive, %IncMSEet IncNodePurity. L'interprétation selon laquelle les variables prédictives avec des %IncMSEvaleurs plus petites sont plus importantes que les variables prédictives avec des %IncMSEvaleurs plus grandes ? Et …


2
Pourquoi utilise-t-on exactement les informations de Fisher observées?
Dans le cadre du maximum de vraisemblance standard (iid échantillon d'une certaine distribution de densité f y ( y | θ 0 )) et dans le cas d'un modèle correctement spécifié, les informations de Fisher sont données parY1,…,YnY1,…,YnY_{1}, \ldots, Y_{n}fy(y|θ0fy(y|θ0f_{y}(y|\theta_{0} I(θ)=−Eθ0[∂2θ2lnfy(θ)]I(θ)=−Eθ0[∂2θ2ln⁡fy(θ)]I(\theta) = -\mathbb{E}_{\theta_{0}}\left[\frac{\partial^{2}}{\theta^{2}}\ln f_{y}(\theta) \right] où l'attente est prise par …



1
Déclaration de la variance de la validation croisée multipliée par k
J'ai utilisé la validation croisée de k-fold répétée et j'ai signalé la moyenne (de la métrique d'évaluation, par exemple, la sensibilité, la spécificité) calculée comme la moyenne générale à travers les plis des différentes séries de validation croisée. Cependant, je ne sais pas comment je dois signaler l'écart. J'ai trouvé …

2
Comment interpréter le coefficient de corrélation de Matthews (MCC)?
La réponse à la question Relation entre les coefficients de corrélation phi, Matthews et Pearson? montre que les trois méthodes des coefficients sont toutes équivalentes. Je ne suis pas des statistiques, donc ça devrait être une question facile. L'article de Matthews (www.sciencedirect.com/science/article/pii/0005279575901099) décrit ce qui suit: "A correlation of: C …

1
Quelle est la mesure d'association appropriée d'une variable avec une composante PCA (sur un tracé biplot / chargement)?
J'utilise FactoMineRpour réduire mon ensemble de données de mesures aux variables latentes. La carte des variables ci-dessus est claire pour moi à interpréter, mais je suis confus en ce qui concerne les associations entre les variables et le composant 1. En regardant la carte des variables, ddpet covtrès proche du …




2
Contrastes polynomiaux pour la régression
Je ne peux pas comprendre l'utilisation des contrastes polynomiaux dans l'ajustement de régression. En particulier, je me réfère à un codage utilisé par Rafin d'exprimer une variable d'intervalle (variable ordinale avec des niveaux également espacés), décrit sur cette page . Dans l'exemple de cette page , si j'ai bien compris, …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.