Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Cette question est peut-être très naïve, mais la façon dont on m'écrit l'économétrie est très confuse s'il y a une différence entre les séries chronologiques et la méthode des données de panel. En ce qui concerne les séries chronologiques, j'ai couvert des sujets tels que la covariance stationnaire, AR, MA, …
Le test t de Welch pour les variances inégales (également connu sous le nom de Welch-Satterthwaite ou Welch-Aspin) a généralement un degré de liberté non entier . Comment citer ces degrés de liberté lors de la communication des résultats du test? "Il est classique d'arrondir à l'entier le plus proche …
SVM gère-t-il un ensemble de données déséquilibré? S'agit-il de paramètres (comme C, ou coût de classification erronée) gérant l'ensemble de données déséquilibré?
http://en.wikipedia.org/wiki/Delta_method Dans l'article Wikipedia, on a supposé que g′( θ )g′(θ)g'(\theta) devait exister et que g′( θ )g′(θ)g'(\theta) une valeur non nulle. Est-il possible de trouver la distribution asymptotique de n--√( g( Xn) - g( θ ) )n(g(Xn)-g(θ))\sqrt{n}(g(X_n)-g(\theta)) étant donné queg′( θ )g′(θ)g'(\theta)pourrait être nul etn--√( Xn- θ ) →réN( …
J'ai recherché sur le Web, mais je n'ai rien trouvé d'utile. Je cherche essentiellement un moyen de mesurer la répartition «égale» d'une valeur. Comme dans, une distribution distribuée «uniformément» comme X : et une distribution Y «inégalement répartie » d'environ la même moyenne et l'écart-type: Mais existe-t-il une mesure de …
Je me demandais quelles sont les différences fondamentales et significatives entre la théorie de la réponse à l'item et l'analyse factorielle confirmatoire. Je comprends qu'il y a des différences dans les calculs (en se concentrant davantage sur l'élément vs les covariances; log-linéaire vs linéaire). Cependant, je n'ai aucune idée de …
J'ai lu différentes descriptions de données censurées: A) Comme expliqué dans ce fil, les données non quantifiées inférieures ou supérieures à un certain seuil sont censurées. Non quantifié signifie que les données sont supérieures ou inférieures à un certain seuil, mais nous ne connaissons pas la valeur exacte. Les données …
Supposons que l'on effectue le bootstrap dit non paramétrique en tirant échantillons de taille n chacun à partir des n observations originales avec remplacement. Je crois que cette procédure équivaut à estimer la fonction de distribution cumulative par le cdf empirique:BBBnnnnnn http://en.wikipedia.org/wiki/Empirical_distribution_function puis obtenir les échantillons de bootstrap en simulant …
Cette question ne concerne pas spécifiquement R, mais j'ai choisi de l'utiliser Rpour l'illustrer. Considérez le code pour produire des bandes de confiance autour d'une ligne qq (normale): library(car) library(MASS) b0<-lm(deaths~.,data=road) qqPlot(b0$resid,pch=16,line="robust") Je cherche une explication (ou un lien alternatif vers un document papier / en ligne expliquant) comment ces …
Je sais qu'il y a un algorithme de clustering k-means et une k-médiane. L'un qui utilise la moyenne comme centre de la grappe et l'autre utilise la médiane. Ma question est: quand / où utiliser quoi?
Un ami représente un client en appel, après un procès pénal au cours duquel il semble que la sélection du jury ait été biaisée sur le plan racial. Le jury était composé de 30 personnes, réparties en 4 groupes raciaux. L'accusation a utilisé des défis impératifs pour éliminer 10 de …
J'ai un problème de classification binaire à partir de plusieurs fonctionnalités. Les coefficients d'une régression logistique (régularisée) ont-ils une signification interprétable? Je pensais qu'ils pourraient indiquer la taille de l'influence, étant donné que les caractéristiques sont préalablement normalisées. Cependant, dans mon problème, les coefficients semblent dépendre sensiblement des caractéristiques que …
J'entends souvent dire que les statistiques bayésiennes peuvent être très subjectives. L'argument principal étant que l'inférence dépend du choix d'un a priori (même si l'on peut utiliser le principe d'indifférence ou d'entropie maximale pour choisir un a priori). En comparaison, selon la revendication, les statistiques fréquentistes sont en général plus …
Le diagnostic Gelman et Rubin est utilisé pour vérifier la convergence de plusieurs chaînes mcmc exécutées en parallèle. Il compare la variance intra-chaîne à la variance inter-chaîne, l'exposition est ci-dessous: Étapes (pour chaque paramètre): Exécutez m ≥ 2 chaînes de longueur 2n à partir de valeurs de départ surdispersées. Jeter …
Comment Pearson a-t-il établi les statistiques du chi carré Pearson suivantes en 1900? K=∑(Oij−Eij)2EijK=∑(Oij−Eij)2Eij K = \sum \frac{(O_{ij} -E_{ij})^2}{E_{ij}} que K∼χ2K∼χ2 K \sim \chi^2 A-t-il pensé au chi carré et conçu la métrique (approche ascendante), ou a-t-il conçu la statistique et prouvé plus tard qu'elle suit la distribution du khi …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.