Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Pourquoi l'équerrage donne une variance expliquée?
C'est peut-être une question fondamentale, mais je me demandais pourquoi une valeur dans un modèle de régression peut simplement être mise au carré pour donner un chiffre de variance expliquée?RRR Je comprends que le coefficient peut donner la force d'une relation, mais je ne comprends pas comment la simple mise …




3
Choix d'alternatives à la régression de Poisson pour les données de comptage sur-dispersées
J'analyse actuellement les données d'une série d'expériences comportementales qui utilisent toutes la mesure suivante. Les participants à cette expérience sont invités à sélectionner des indices que d'autres personnes (fictives) pourraient utiliser pour résoudre une série de 10 anagrammes. Les participants sont amenés à croire que ces autres personnes gagneront ou …

3
Comment communiquer au mieux l'incertitude?
Un problème majeur dans la communication des résultats des calculs statistiques aux médias et au public est la façon dont nous communiquons l'incertitude. Certes, la plupart des médias de masse semblent aimer un nombre dur et rapide, même si, sauf dans un nombre relativement restreint de cas, les chiffres ont …

2
Corrélation de la série temporelle des volumes
Considérez le graphique suivant: La ligne rouge (axe de gauche) décrit le volume d'échange d'une certaine action. La ligne bleue (axe droit) décrit le volume de messages Twitter pour ce stock. Par exemple, le 9 mai (05-09), environ 1.100 millions de transactions et 4.000 tweets ont été effectués. Je voudrais …

2
Valeur attendue de la corrélation parasite
Nous tirons échantillons, chacun de taille , indépendamment d'une distribution normale .n ( μ , σ 2 )NNNnnn(μ,σ2)(μ,σ2)(\mu,\sigma^2) À partir des échantillons, nous choisissons ensuite les 2 échantillons qui ont la corrélation de Pearson la plus élevée (absolue).NNN Quelle est la valeur attendue de cette corrélation? Merci [PS Ce n'est …

1
Estimation de la distribution à partir des données
J'ai un échantillon de données générées Rpar rnorm(50,0,1), donc les données prennent évidemment une distribution normale. Cependant, Rne "connaît" pas ces informations de distribution sur les données. Existe-t-il une méthode Rpermettant d'estimer le type de distribution dont provient mon échantillon? Sinon, je vais utiliser la shapiro.testfonction et procéder de cette …
12 r  distributions 

3
Quelles sont les distributions sur le quadrant positif de dimension k avec une matrice de covariance paramétrable?
Suite à la question de zzk sur son problème avec les simulations négatives, je me demande quelles sont les familles de distributions paramétrées sur le quadrant positif k, R k + pour lesquelles la matrice de covariance Σ peut être établie.Rk+R+k\mathbb{R}_+^kΣΣ\Sigma Comme discuté avec ZZK , à partir d'une distribution …

2
Quand utiliser le bootstrap vs la technique bayésienne?
J'ai un problème d'analyse décisionnelle assez compliqué impliquant des tests de fiabilité et l'approche logique (pour moi) semble impliquer l'utilisation de MCMC pour soutenir une analyse bayésienne. Cependant, il a été suggéré qu'il serait plus approprié d'utiliser une approche d'amorçage. Quelqu'un pourrait-il suggérer une référence (ou trois) qui pourrait soutenir …


2
Modèle bayésien hiérarchique (?)
Veuillez m'excuser d'avoir massacré le jargon statistique :) J'ai trouvé ici quelques questions concernant la publicité et les taux de clics. Mais aucun d'eux ne m'a beaucoup aidé dans ma compréhension de ma situation hiérarchique. Il y a une question connexe. Ces représentations équivalentes du même modèle bayésien hiérarchique? , …

2
Analyse des coefficients de régression logistique
Voici une liste de coefficients de régression logistique (le premier est une interception) -1059.61966694592 -1.23890500515482 -8.57185269220438 -7.50413155570413 0 1.03152408392552 1.19874787949191 -4.88083274930613 -5.77172565873336 -1.00610998453393 Je trouve bizarre à quel point l'ordonnée à l'origine est si faible et j'ai un coefficient qui est en fait égal à 0. Je ne sais pas …

1
Paquets Python pour travailler avec des modèles de mélange gaussiens (GMM)
Il semble y avoir plusieurs options disponibles pour travailler avec des modèles de mélange gaussiens (GMM) en Python. À première vue, il existe au moins: PyMix - http://www.pymix.org/pymix/index.php Outils pour la modélisation des mélanges PyEM - http://www.ar.media.kyoto-u.ac.jp/members/david/softwares/em/ qui fait partie de la boîte à outils Scipy et semble se concentrer …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.