Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Pourquoi l'IC à 95% de la médiane est-il censé être ?
Dans diverses sources (voir par exemple ici ), la formule suivante est donnée pour l'intervalle de confiance pour la médiane (en particulier dans le but de tracer des encoches sur des parcelles en boîte et moustaches): 95% CImedian=Median±1.57×IQRN−−√95% CImedian=Median±1.57×IQRN 95\%\ CI_{\rm median} = {\rm Median} \pm \frac{1.57\times IQR}{\sqrt{N}} La constante …

2
Que signifie exactement la notation ?
Que signifie la notation (point sur tilde), dans le contexte comme ?∼˙∼˙\dot\simx∼˙N(0,1)x∼˙N(0,1)x \mathrel{\dot\sim} \mathcal N(0,1) Il s'avère qu'il est plus facile de trouver comment le composer correctement: tex.SE explique que l'on devrait taper \mathrel{\dot\sim}au lieu de simplement \dot\simrésoudre le problème d'espacement - que de trouver ce que cela signifie réellement. …

1
Prouver / réfuter
Prouver / réfuter E[1A|Ft]=0 or 1 a.s. ⇒E[1A|Fs]=E[1A|Ft] a.s.E[1A|Ft]=0 or 1 a.s. ⇒E[1A|Fs]=E[1A|Ft] a.s.E[1_A | \mathscr{F_t}] = 0 \ \text{or} \ 1 \ \text{a.s.} \ \Rightarrow E[1_A | \mathscr{F_{s}}] = E[1_A | \mathscr{F_t}] \ \text{a.s.} Etant donné un espace de probabilité filtré , et encore A ∈ F .(Ω,F,{Fn}n∈N,P)(Ω,F,{Fn}n∈N,P)(\Omega, \mathscr{F}, …

3
Quelles sont les méthodes statistiques que je peux utiliser pour trouver des combinaisons populaires ou courantes de variables catégorielles?
Je fais une étude sur la polytoxicomanie. J'ai un ensemble de données de 400 toxicomanes, qui ont chacun déclaré les drogues qu'ils abusent. Il existe plus de 10 médicaments et donc de grandes combinaisons possibles. J'ai recodé la plupart des drogues qu'ils consomment en variables binaires (c'est-à-dire que l'héroïne est …

3
Comment lire p, d et q de auto.arima ()?
Comment puis-je obtenir des p,d and qvaleurs dans le ARIMA(p,d,q)modèle estimées par auto.arima(mytimeseries)? arima_model <- auto.arima (mytimeseries, ic = 'bic') Si nous regardons la sortie de arima_model $ arma on a, [1] 1 0 0 0 1 2 0 Quelle est la signification des nombres apparaissant dans la séquence ci-dessus?
10 r  arima 

1
Régression logistique vs chi carré dans des tableaux de contingence 2x2 et Ix2 (facteur unique - réponse binaire)?
J'essaie de comprendre l'utilisation de la régression logistique dans les tables de contingence 2x2 et Ix2. Par exemple, en utilisant cela comme exemple Quelle est la différence entre l'utilisation du test du chi carré et l'utilisation de la régression logistique? Qu'en est-il d'une table avec plusieurs facteurs nominaux (table Ix2) …


1
Comment amorcer un perceptron simple?
Les problèmes de classification avec des limites non linéaires ne peuvent pas être résolus par un simple perceptron . Le code R suivant est à des fins d'illustration et est basé sur cet exemple en Python): nonlin <- function(x, deriv = F) { if (deriv) x*(1-x) else 1/(1+exp(-x)) } X …



4
Sur-ajustement avec des classificateurs linéaires
Aujourd'hui, notre professeur a déclaré en classe qu '"il n'est pas possible de sur-équiper les classificateurs linéaires". Je pense que c'est faux, car même les classificateurs linéaires peuvent être sensibles aux valeurs aberrantes dans l'ensemble de formation - prenez par exemple une machine à vecteur de support à marge dure: …

2
RMSE (Root Mean Squared Error) pour les modèles logistiques
J'ai une question concernant la validité de l'utilisation de RMSE (Root Mean Squared Error) pour comparer différents modèles logistiques. La réponse est soit 0ou 1et les prédictions sont des probabilités entre 0- 1? La manière appliquée ci-dessous est-elle également valable avec les réponses binaires? # Using glmnet require(glmnet) load(url("https://github.com/cran/glmnet/raw/master /data/BinomialExample.RData")) …

1
Lors du re-paramétrage d'une fonction de vraisemblance, suffit-il de simplement brancher la variable transformée au lieu d'un changement de formule de variables?
Supposons que j'essaye de re-paramétrer une fonction de vraisemblance qui est distribuée de façon exponentielle. Si ma fonction de vraisemblance d'origine est: p ( y∣ θ ) = θ e- θ yp(y∣θ)=θe-θy p(y \mid \theta) = \theta e^{-\theta y} et je voudrais le re-paramétrer en utilisant , puisqueθn'est pas une …

2
Différence entre la moyenne des données puis l'ajustement et l'ajustement des données puis la moyenne
Le cas échéant, entre l'ajustement d'une ligne à plusieurs "expériences" distinctes, puis la moyenne des ajustements, ou la moyenne des données des expériences distinctes, puis l'ajustement des données moyennes. Permettez-moi d'expliquer: J'effectue des simulations informatiques qui génèrent une courbe, illustrée ci-dessous. Nous extrayons une quantité, appelons-la "A" en ajustant la …
10 error  fitting  average 


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.