Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Intuition derrière la fonction de densité des distributions t
J'étudie la distribution t de Student et j'ai commencé à me demander comment dériverait la fonction de densité des distributions t (de wikipedia, http://en.wikipedia.org/wiki/Student%27s_t-distribution ): F( t ) = Γ ( v + 12)v π--√Γ ( v2)( 1 + t2v)- v + 12f(t)=Γ(v+12)vπΓ(v2)(1+t2v)−v+12f(t) = \frac{\Gamma(\frac{v+1}{2})}{\sqrt{v\pi}\:\Gamma(\frac{v}{2})}\left(1+\frac{t^2}{v} \right)^{-\frac{v+1}{2}} où est le degré …


2
Comment puis-je regrouper les valeurs p amorcées dans plusieurs ensembles de données imputées?
Je suis préoccupé par le problème que j'aimerais amorcer la valeur de p pour une estimation de partir de données multipliées imputées (MI), mais qu'il n'est pas clair pour moi comment combiner les valeurs de p entre les ensembles d'IM.θθ\theta Pour les ensembles de données MI, l'approche standard pour arriver …

2
Pourquoi certaines personnes testent des hypothèses de modèle de régression sur leurs données brutes et d'autres les testent sur le résidu?
Je suis doctorant en psychologie expérimentale et je m'efforce d'améliorer mes compétences et mes connaissances sur la façon d'analyser mes données. Jusqu'à ma 5e année en psychologie, je pensais que les modèles de régression (par exemple, ANOVA) supposaient les choses suivantes: normalité des données homogénéité de la variance des données, …



4
Dans R, comment calculer la valeur de p pour l'aire sous ROC
J'ai du mal à trouver un moyen de calculer la valeur de p pour la zone sous une caractéristique d'opérateur de récepteur (ROC). J'ai une variable continue et un résultat de test de diagnostic. Je veux voir si AUROC est statistiquement significatif. J'ai trouvé de nombreux packages traitant des courbes …
12 r  p-value  roc 

4
Qualité d'ajustement pour les très grands échantillons
Je collecte chaque jour de très grands échantillons (> 1 000 000) de données catégoriques et je souhaite que les données soient "significativement" différentes d'un jour à l'autre pour détecter les erreurs de collecte de données. Je pensais que l'utilisation d'un test de bon ajustement (en particulier, un test G) …

4
Valeur qui augmente l'écart type
Je suis perplexe devant la déclaration suivante: "Afin d'augmenter l'écart-type d'un ensemble de nombres, vous devez ajouter une valeur qui est plus d'un écart-type de la moyenne" Quelle est la preuve de cela? Je sais bien sûr comment nous définissons l'écart type, mais cette partie me semble d'une certaine manière …

1
Y a-t-il un meilleur nom que «moyenne de l'intégrale»?
Je teste les capteurs de position du papillon (TPS) que mon entreprise vend et j'imprime le tracé de la réponse en tension à la rotation de l'arbre du papillon. Un TPS est un capteur rotatif avec une plage d' 90 ° et la sortie est comme un potentiomètre avec une …

1
Existe-t-il un problème avec la multicolinéarité et la régression des splines?
Lors de l'utilisation de splines cubiques naturelles (c'est-à-dire restreintes), les fonctions de base créées sont hautement colinéaires et, lorsqu'elles sont utilisées dans une régression, semblent produire des statistiques VIF (facteur d'inflation de variance) très élevées, signalant la multicolinéarité. Lorsque l'on considère le cas d'un modèle à des fins de prédiction, …


2
Quelles statistiques sont conservées sous agrégation?
Si nous avons une longue série temporelle à haute résolution, avec beaucoup de bruit, il est souvent judicieux d'agréger les données à une résolution inférieure (par exemple, des valeurs quotidiennes à mensuelles) pour mieux comprendre ce qui se passe, en supprimant efficacement le bruit. J'ai vu au moins un article …

1
Exemple d'inégalité stricte de Neumann
Soit le risque bayésien d'un estimateur par rapport à un antérieur , soit le jeu de tous les a priori sur l'espace des paramètres , et soit le jeu de toutes les règles de décision (éventuellement randomisées).r(π,δ)r(π,δ)r(\pi, \delta)δδ\deltaππ\piΠΠ\PiΘΘ\ThetaΔΔ\Delta L'interprétation statistique de l'inégalité minimax de John von Neumann indique que supπ∈Πinfδ∈Δr(π,δ)≤infδ∈Δsupπ∈Πr(π,δ),supπ∈Πinfδ∈Δr(π,δ)≤infδ∈Δsupπ∈Πr(π,δ), …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.