Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Classificateurs d'apprentissage automatique Big-O ou complexité
Pour évaluer les performances d'un nouvel algorithme de classificateur, j'essaie de comparer la précision et la complexité (big-O dans la formation et la classification). De Machine Learning: un examen, j'obtiens une liste complète des classificateurs supervisés, ainsi qu'un tableau de précision entre les algorithmes et 44 problèmes de test du …

3
Comment calculer le chevauchement entre les densités de probabilité empiriques?
Je cherche une méthode pour calculer la zone de chevauchement entre deux estimations de densité de noyau dans R, comme mesure de similitude entre deux échantillons. Pour clarifier, dans l'exemple suivant, il me faudrait quantifier l'aire de la région de chevauchement violacé: library(ggplot2) set.seed(1234) d <- data.frame(variable=c(rep("a", 50), rep("b", 30)), …

1
Quelle est la différence entre les coefficients de régression et les coefficients de régression partielle?
J'ai lu dans Abdi (2003) que Lorsque les variables indépendantes sont orthogonales par paire, l'effet de chacune d'elles dans la régression est évalué en calculant la pente de la régression entre cette variable indépendante et la variable dépendante. Dans ce cas (c'est-à-dire l'orthogonalité des IV), les coefficients de régression partielle …



2
Distribution de la convolution des variables normales au carré et chi carré?
le problème suivant est apparu récemment lors de l'analyse des données. Si la variable aléatoire X suit une distribution normale et Y suit une distribution χ2nχn2\chi^2_n (avec n ddl), comment Z=X2+Y2Z=X2+Y2Z = X^2 + Y^2 distribué? Jusqu'à présent, je suis venu avec le pdf de Y2Y2Y^2 : ψ2n(x)====∂F(x−−√)∂x(∫x√0tn/2−1⋅e−t/22n/2Γ(n/2)dt)′x12n/2Γ(n/2)⋅(x−−√)n/2−1⋅e−x√/2⋅(x−−√)′x12n/2−1Γ(n/2)⋅xn/4−1⋅e−x√/2ψn2(x)=∂F(x)∂x=(∫0xtn/2−1⋅e−t/22n/2Γ(n/2)dt)x′=12n/2Γ(n/2)⋅(x)n/2−1⋅e−x/2⋅(x)x′=12n/2−1Γ(n/2)⋅xn/4−1⋅e−x/2\begin{eqnarray} \psi^2_n(x) &=& …


1
Tester la différence entre 2 distributions empiriques discrètes
J'ai des données de test où j'ai plusieurs grands échantillons de distributions discrètes que j'utilise comme distributions empiriques. Je veux tester si les distributions sont réellement différentes et quelle est la différence de moyennes pour ces distributions qui sont réellement différentes. Puisqu'il s'agit de distributions discrètes, je crois comprendre que …



4
Du point de vue de la probabilité bayésienne, pourquoi un intervalle de confiance à 95% ne contient-il pas le vrai paramètre avec une probabilité de 95%?
À partir de la page Wikipedia sur les intervalles de confiance : ... si des intervalles de confiance sont construits sur de nombreuses analyses de données distinctes d'expériences répétées (et éventuellement différentes), la proportion de ces intervalles qui contiennent la vraie valeur du paramètre correspondra au niveau de confiance ... …



3
Puis-je reconstruire une distribution normale à partir de la taille de l'échantillon et des valeurs min et max? Je peux utiliser le point médian pour représenter la moyenne
Je sais que cela pourrait être un peu compliqué, statistiquement, mais c'est mon problème. J'ai beaucoup de données de plage, c'est-à-dire la taille minimum, maximum et échantillon d'une variable. Pour certaines de ces données, j'ai également une moyenne, mais pas beaucoup. Je veux comparer ces gammes entre elles pour quantifier …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.