Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Analyse de corrélation canonique avec corrélation de rang
L'analyse de corrélation canonique (ACC) vise à maximiser la corrélation produit-moment de Pearson habituelle (c.-à-d. Le coefficient de corrélation linéaire) des combinaisons linéaires des deux ensembles de données. Maintenant, considérons le fait que ce coefficient de corrélation ne mesure que les associations linéaires - c'est la raison même pour laquelle …

3
Modèle de Cox vs régression logistique
Disons que le problème suivant nous est posé: Prévoyez quels clients sont les plus susceptibles d'arrêter d'acheter dans notre boutique au cours des 3 prochains mois. Pour chaque client, nous connaissons le mois où l'on a commencé à acheter dans notre boutique et, en outre, nous avons de nombreuses fonctionnalités …


1
Puis-je convertir une matrice de covariance en incertitudes pour les variables?
J'ai une unité GPS qui émet une mesure de bruit via une matrice de covariance :ΣΣ\Sigma Σ=⎡⎣⎢σxxσyxσxzσxyσyyσyzσxzσyzσzz⎤⎦⎥Σ=[σxxσxyσxzσyxσyyσyzσxzσyzσzz]\Sigma = \left[\begin{matrix} \sigma_{xx} & \sigma_{xy} & \sigma_{xz} \\ \sigma_{yx} & \sigma_{yy} & \sigma_{yz} \\ \sigma_{xz} & \sigma_{yz} & \sigma_{zz} \end{matrix}\right] (il n'y a pas non plus de mais ignorons cela une seconde.)ttt Supposons …


2
Estimation de la distribution postérieure de la covariance d'un gaussien multivarié
J'ai besoin "d'apprendre" la distribution d'un gaussien bivarié avec peu d'échantillons, mais une bonne hypothèse sur la distribution précédente, donc je voudrais utiliser l'approche bayésienne. J'ai défini mon avant: P(μ)∼N(μ0,Σ0)P(μ)∼N(μ0,Σ0) \mathbf{P}(\mathbf{\mu}) \sim \mathcal{N}(\mathbf{\mu_0},\mathbf{\Sigma_0}) μ0=[00] Σ0=[160027]μ0=[00] Σ0=[160027] \mathbf{\mu_0} = \begin{bmatrix} 0 \\ 0 \end{bmatrix} \ \ \ \mathbf{\Sigma_0} = \begin{bmatrix} 16 …

1
Comment estimer le processus de Poisson en utilisant R? (Ou: comment utiliser le package NHPoisson?)
J'ai une base de données d'événements (c'est-à-dire une variable de dates) et des covariables associées. Les événements sont générés par le processus de Poisson non stationnaire, le paramètre étant une fonction inconnue (mais peut-être linéaire) de certaines covariables. Je pense que le package NHPoisson existe uniquement à cette fin; mais …

2
Estimation des paramètres d'une distribution normale: médiane au lieu de moyenne?
L'approche courante pour estimer les paramètres d'une distribution normale consiste à utiliser la moyenne et l'écart-type / variance de l'échantillon. Cependant, s'il y a des valeurs aberrantes, la médiane et l'écart médian par rapport à la médiane devraient être beaucoup plus robustes, non? Sur certains ensembles de données que j'ai …



1
Signification des termes de sortie dans le package gbm?
J'utilise le paquet gbm pour la classification. Comme prévu, les résultats sont bons. Mais j'essaie de comprendre la sortie du classificateur. Il y a cinq termes en sortie. `Iter TrainDeviance ValidDeviance StepSize Improve` Quelqu'un pourrait-il expliquer la signification de chaque terme, en particulier la signification de Améliorer .

1
Pourquoi stabilisons-nous la variance?
Je suis tombé sur une transformation stabilisant la variance en lisant la méthode Kaggle Essay Eval . Ils utilisent une transformation de stabilisation de variance pour transformer les valeurs kappa avant de prendre leur moyenne, puis de les retransformer. Même après avoir lu le wiki sur les transformations de stabilisation …

3
Pourquoi utiliser une certaine mesure d'erreur de prévision (par exemple MAD) par opposition à une autre (par exemple MSE)?
MAD = écart absolu moyen MSE = erreur quadratique moyenne J'ai vu des suggestions de divers endroits selon lesquelles MSE est utilisé malgré certaines qualités indésirables (par exemple http://www.stat.nus.edu.sg/~staxyc/T12.pdf , qui déclare en p8 "On pense généralement que MAD est un meilleur critère que MSE. Cependant, mathématiquement, MSE est plus …
15 forecasting  error  mse  mae 

7
La forêt aléatoire est trop adaptée
J'essaie d'utiliser la régression aléatoire des forêts dans scikits-learn. Le problème est que j'obtiens une erreur de test très élevée: train MSE, 4.64, test MSE: 252.25. Voici à quoi ressemblent mes données: (bleu: données réelles, vert: prévu): J'utilise 90% pour la formation et 10% pour le test. Voici le code …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.