Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données




1
Comment utiliser la méthode Delta alors que la dérivée de premier ordre est nulle?
http://en.wikipedia.org/wiki/Delta_method Dans l'article Wikipedia, on a supposé que g′( θ )g′(θ)g'(\theta) devait exister et que g′( θ )g′(θ)g'(\theta) une valeur non nulle. Est-il possible de trouver la distribution asymptotique de n--√( g( Xn) - g( θ ) )n(g(Xn)-g(θ))\sqrt{n}(g(X_n)-g(\theta)) étant donné queg′( θ )g′(θ)g'(\theta)pourrait être nul etn--√( Xn- θ ) →réN( …



5
Que sont exactement les données censurées?
J'ai lu différentes descriptions de données censurées: A) Comme expliqué dans ce fil, les données non quantifiées inférieures ou supérieures à un certain seuil sont censurées. Non quantifié signifie que les données sont supérieures ou inférieures à un certain seuil, mais nous ne connaissons pas la valeur exacte. Les données …

3
Bootstrap: la question du sur-ajustement
Supposons que l'on effectue le bootstrap dit non paramétrique en tirant échantillons de taille n chacun à partir des n observations originales avec remplacement. Je crois que cette procédure équivaut à estimer la fonction de distribution cumulative par le cdf empirique:BBBnnnnnn http://en.wikipedia.org/wiki/Empirical_distribution_function puis obtenir les échantillons de bootstrap en simulant …

1
Bandes de confiance pour la ligne QQ
Cette question ne concerne pas spécifiquement R, mais j'ai choisi de l'utiliser Rpour l'illustrer. Considérez le code pour produire des bandes de confiance autour d'une ligne qq (normale): library(car) library(MASS) b0<-lm(deaths~.,data=road) qqPlot(b0$resid,pch=16,line="robust") Je cherche une explication (ou un lien alternatif vers un document papier / en ligne expliquant) comment ces …

2
k-signifie vs k-médiane?
Je sais qu'il y a un algorithme de clustering k-means et une k-médiane. L'un qui utilise la moyenne comme centre de la grappe et l'autre utilise la médiane. Ma question est: quand / où utiliser quoi?


3
Les coefficients de régression logistique ont-ils un sens?
J'ai un problème de classification binaire à partir de plusieurs fonctionnalités. Les coefficients d'une régression logistique (régularisée) ont-ils une signification interprétable? Je pensais qu'ils pourraient indiquer la taille de l'influence, étant donné que les caractéristiques sont préalablement normalisées. Cependant, dans mon problème, les coefficients semblent dépendre sensiblement des caractéristiques que …

2
Subjectivité dans les statistiques Frequentist
J'entends souvent dire que les statistiques bayésiennes peuvent être très subjectives. L'argument principal étant que l'inférence dépend du choix d'un a priori (même si l'on peut utiliser le principe d'indifférence ou d'entropie maximale pour choisir un a priori). En comparaison, selon la revendication, les statistiques fréquentistes sont en général plus …

1
Diagnostic de convergence Gelman et Rubin, comment généraliser pour travailler avec des vecteurs?
Le diagnostic Gelman et Rubin est utilisé pour vérifier la convergence de plusieurs chaînes mcmc exécutées en parallèle. Il compare la variance intra-chaîne à la variance inter-chaîne, l'exposition est ci-dessous: Étapes (pour chaque paramètre): Exécutez m ≥ 2 chaînes de longueur 2n à partir de valeurs de départ surdispersées. Jeter …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.