Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


4
Quel ratio de distributions indépendantes donne une distribution normale?
Le rapport de deux distributions normales indépendantes donne une distribution de Cauchy. La distribution t est une distribution normale divisée par une distribution chi carré indépendante. Le rapport de deux distributions khi-deux indépendantes donne une distribution F. Je recherche un rapport de distributions continues indépendantes qui donne une variable aléatoire …

1
Comment trouver un intervalle de prédiction GBM
Je travaille avec des modèles GBM en utilisant le package caret et cherche à trouver une méthode pour résoudre les intervalles de prédiction pour mes données prédites. J'ai beaucoup cherché, mais je n'ai trouvé que quelques idées pour trouver des intervalles de prédiction pour Random Forest. Tout code d'aide / …

3
Comprendre les paramètres de la fonction de la base gaussienne à utiliser dans la régression linéaire
Je voudrais appliquer la fonction de base gaussienne dans une implémentation de régression linéaire. Malheureusement, j'ai du mal à comprendre quelques paramètres dans la fonction de base. Plus précisément et .σμμ\muσσ\sigma Mon ensemble de données est une matrice de 10 000 x 31. 10 000 échantillons et 31 fonctionnalités. J'ai …



1
t.test renvoie une erreur «les données sont essentiellement constantes»
R version 3.1.1 (2014-07-10) -- "Sock it to Me" > bl <- c(140, 138, 150, 148, 135) > fu <- c(138, 136, 148, 146, 133) > t.test(fu, bl, alternative = "two.sided", paired = TRUE) Error in t.test.default(fu, bl, alternative = "two.sided", paired = TRUE) : data are essentially constant Ensuite, …
12 r  t-test 

2
Pourquoi SAS PROC GLIMMIX me donne-t-il des pentes aléatoires TRÈS différentes de glmer (lme4) pour un glmm binomial
Je connais mieux R et j'essaie d'estimer les pentes aléatoires (coefficients de sélection) pour environ 35 individus sur 5 ans pour quatre variables d'habitat. La variable de réponse est de savoir si un emplacement a été «utilisé» (1) ou «disponible» (0) de l'habitat («utilisation» ci-dessous). J'utilise un ordinateur Windows 64 …

4
Bonne forme pour éliminer les valeurs aberrantes?
Je travaille sur les statistiques des builds de logiciels. J'ai des données pour chaque build sur réussite / échec et le temps écoulé et nous générons ~ 200 de ces / semaine. Le taux de réussite est facile à agréger, je peux dire que 45% ont réussi une semaine donnée. …

3
tester les coefficients de régression logistique en utilisant et les degrés de liberté de déviance résiduelle
Résumé: Existe - t-il une théorie statistique pour soutenir l'utilisation de la distribution (avec des degrés de liberté basés sur la déviance résiduelle) pour les tests des coefficients de régression logistique, plutôt que la distribution normale standard?ttt Il y a quelque temps, j'ai découvert qu'en ajustant un modèle de régression …


1
Comprendre les résultats de l'analyse de médiation dans R
J'essaie de comprendre le package de médiation dans R, en utilisant la vignette du package. J'ai du mal à comprendre la sortie de la mediate()fonction. require("mediation") require("sandwich") data("framing") med.fit <- lm(emo ~ treat + age + educ + gender + income, data = framing) out.fit <- glm(cong_mesg ~ emo + …
12 r  mediation 

3
L'idée de rendre les données ont une moyenne nulle
Je vois souvent des gens qui font d'une dimension / caractéristique d'un ensemble de données une moyenne nulle en supprimant la moyenne de tous les éléments. Mais je n'ai jamais compris pourquoi le faire? Quel effet cela fait-il en tant qu'étape de prétraitement? Améliore-t-il les performances de classification? Cela aide-t-il …



En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.