Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Biais variable omis dans la régression logistique vs biais variable omis dans la régression des moindres carrés ordinaires
J'ai une question sur le biais variable omis dans la régression logistique et linéaire. Supposons que j'omet certaines variables d'un modèle de régression linéaire. Imaginez que ces variables omises ne sont pas corrélées avec les variables que j'ai incluses dans mon modèle. Ces variables omises ne biaisent pas les coefficients …

2
Analyse des composantes principales pondérées
Après quelques recherches, je trouve très peu sur l'incorporation de poids d'observation / erreurs de mesure dans l'analyse des composants principaux. Ce que je trouve a tendance à s'appuyer sur des approches itératives pour inclure des pondérations (par exemple, ici ). Ma question est pourquoi cette approche est-elle nécessaire? Pourquoi …

3
Générer des nombres aléatoires suite à une distribution dans un intervalle
J'ai besoin de générer des nombres aléatoires suivant la distribution normale dans l'intervalle (a,b)(a,b)(a,b) . (Je travaille dans R.) Je sais que la fonction rnorm(n,mean,sd)générera des nombres aléatoires suivant la distribution normale, mais comment définir les limites d'intervalle à l'intérieur de cela? Existe-t-il des fonctions R particulières disponibles pour cela?

3
Pourquoi ne pas utiliser la distribution T pour estimer la moyenne lorsque l'échantillon est grand?
Les cours de statistiques de base suggèrent souvent d'utiliser une distribution normale pour estimer la moyenne d'un paramètre de population lorsque la taille de l'échantillon n est grande (généralement supérieure à 30 ou 50). La distribution T de Student est utilisée pour des échantillons de plus petite taille afin de …

3
Exemples réels de corrélation confondus avec causalité
Je recherche des cas spécifiques et réels dans lesquels une relation de cause à effet a été indûment déduite de la preuve d'une corrélation. Plus précisément, je suis intéressé par des exemples qui répondent aux critères suivants: L'existence de la relation causale a été acceptée comme un fait suffisamment répandu …



1
Recherche de racine pour la fonction stochastique
Supposons que nous ayons une fonction que nous ne pouvons observer qu'à travers du bruit. Nous ne pouvons pas calculer directement, seulement où est un bruit aléatoire. (En pratique: je calcule utilisant une méthode de Monte Carlo.)f(x)f(x)f(x)f(x)f(x)f(x)f(x)+ηf(x)+ηf(x) + \etaηη\etaf(x)f(x)f(x) Quelles méthodes sont disponibles pour trouver les racines de , c'est-à-dire …



1
La valeur R au carré est-elle appropriée pour comparer des modèles?
J'essaie d'identifier le meilleur modèle pour prédire les prix des automobiles, en utilisant les prix et les fonctionnalités disponibles sur les sites de petites annonces automobiles. Pour cela, j'ai utilisé quelques modèles de la bibliothèque scikit-learn et des modèles de réseaux neuronaux de pybrain et de neurolab. L'approche que j'ai …

3
La «statistique de test» est-elle une valeur ou une variable aléatoire?
Je suis un étudiant qui suit maintenant mon premier cours de statistique. Je suis confus par le terme «statistique de test». Dans ce qui suit (je l'ai vu dans certains manuels), semble être une valeur spécifique calculée à partir d'un échantillon spécifique. tttt=x¯¯¯−μ0s/n−−√t=x¯−μ0s/n t=\frac{\overline{x} - \mu_0}{s / \sqrt{n}} Cependant, dans …


9
Calcul de l'indice Rand
J'essaie de comprendre comment calculer l'indice Rand d'un algorithme de cluster, mais je suis coincé au point de savoir comment calculer les vrais et les faux négatifs. Pour le moment, j'utilise l'exemple du livre An Introduction into Information Retrieval (Manning, Raghavan & Schütze, 2009). À la page 359, ils expliquent …
17 clustering 


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.