Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
L'analyse de corrélation canonique (ACC) vise à maximiser la corrélation produit-moment de Pearson habituelle (c.-à-d. Le coefficient de corrélation linéaire) des combinaisons linéaires des deux ensembles de données. Maintenant, considérons le fait que ce coefficient de corrélation ne mesure que les associations linéaires - c'est la raison même pour laquelle …
Disons que le problème suivant nous est posé: Prévoyez quels clients sont les plus susceptibles d'arrêter d'acheter dans notre boutique au cours des 3 prochains mois. Pour chaque client, nous connaissons le mois où l'on a commencé à acheter dans notre boutique et, en outre, nous avons de nombreuses fonctionnalités …
Dans l'état actuel des choses, cette question ne convient pas à notre format de questions / réponses. Nous nous attendons à ce que les réponses soient étayées par des faits, des références ou une expertise, mais cette question suscitera probablement un débat, des arguments, des sondages ou une discussion approfondie. …
J'ai une unité GPS qui émet une mesure de bruit via une matrice de covariance :ΣΣ\Sigma Σ=⎡⎣⎢σxxσyxσxzσxyσyyσyzσxzσyzσzz⎤⎦⎥Σ=[σxxσxyσxzσyxσyyσyzσxzσyzσzz]\Sigma = \left[\begin{matrix} \sigma_{xx} & \sigma_{xy} & \sigma_{xz} \\ \sigma_{yx} & \sigma_{yy} & \sigma_{yz} \\ \sigma_{xz} & \sigma_{yz} & \sigma_{zz} \end{matrix}\right] (il n'y a pas non plus de mais ignorons cela une seconde.)ttt Supposons …
Le package de traçage R ggplot2 a une fonction impressionnante appelée stat_smooth pour tracer une ligne (ou courbe) de régression avec la bande de confiance associée. Cependant, j'ai du mal à comprendre exactement comment cette bande de confiance est générée, à chaque fois que la ligne de régression (ou "méthode"). …
J'ai besoin "d'apprendre" la distribution d'un gaussien bivarié avec peu d'échantillons, mais une bonne hypothèse sur la distribution précédente, donc je voudrais utiliser l'approche bayésienne. J'ai défini mon avant: P(μ)∼N(μ0,Σ0)P(μ)∼N(μ0,Σ0) \mathbf{P}(\mathbf{\mu}) \sim \mathcal{N}(\mathbf{\mu_0},\mathbf{\Sigma_0}) μ0=[00] Σ0=[160027]μ0=[00] Σ0=[160027] \mathbf{\mu_0} = \begin{bmatrix} 0 \\ 0 \end{bmatrix} \ \ \ \mathbf{\Sigma_0} = \begin{bmatrix} 16 …
J'ai une base de données d'événements (c'est-à-dire une variable de dates) et des covariables associées. Les événements sont générés par le processus de Poisson non stationnaire, le paramètre étant une fonction inconnue (mais peut-être linéaire) de certaines covariables. Je pense que le package NHPoisson existe uniquement à cette fin; mais …
L'approche courante pour estimer les paramètres d'une distribution normale consiste à utiliser la moyenne et l'écart-type / variance de l'échantillon. Cependant, s'il y a des valeurs aberrantes, la médiane et l'écart médian par rapport à la médiane devraient être beaucoup plus robustes, non? Sur certains ensembles de données que j'ai …
J'ai pensé à ce problème. La fonction logistique habituelle pour la modélisation des données binaires est: Cependant, la fonction logit, qui est une courbe en forme de S , toujours le meilleur pour modéliser les données? Vous avez peut-être des raisons de croire que vos données ne suivent pas la …
Quels sont les avantages de spécifier une structure de covariance dans un GLM (plutôt que de traiter toutes les entrées hors diagonale de la matrice de covariance comme nulles)? En plus de refléter ce que l'on sait des données, est-ce améliorer la qualité de l'ajustement? améliorer la précision prédictive des …
J'utilise le paquet gbm pour la classification. Comme prévu, les résultats sont bons. Mais j'essaie de comprendre la sortie du classificateur. Il y a cinq termes en sortie. `Iter TrainDeviance ValidDeviance StepSize Improve` Quelqu'un pourrait-il expliquer la signification de chaque terme, en particulier la signification de Améliorer .
Je suis tombé sur une transformation stabilisant la variance en lisant la méthode Kaggle Essay Eval . Ils utilisent une transformation de stabilisation de variance pour transformer les valeurs kappa avant de prendre leur moyenne, puis de les retransformer. Même après avoir lu le wiki sur les transformations de stabilisation …
MAD = écart absolu moyen MSE = erreur quadratique moyenne J'ai vu des suggestions de divers endroits selon lesquelles MSE est utilisé malgré certaines qualités indésirables (par exemple http://www.stat.nus.edu.sg/~staxyc/T12.pdf , qui déclare en p8 "On pense généralement que MAD est un meilleur critère que MSE. Cependant, mathématiquement, MSE est plus …
J'essaie d'utiliser la régression aléatoire des forêts dans scikits-learn. Le problème est que j'obtiens une erreur de test très élevée: train MSE, 4.64, test MSE: 252.25. Voici à quoi ressemblent mes données: (bleu: données réelles, vert: prévu): J'utilise 90% pour la formation et 10% pour le test. Voici le code …
L'un des problèmes que j'ai toujours eu avec les modèles mixtes est de trouver des visualisations de données - du type qui pourraient se retrouver sur un papier ou une affiche - une fois que l'on a les résultats. En ce moment, je travaille sur un modèle d'effets mixtes de …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.