Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai une question sur le biais variable omis dans la régression logistique et linéaire. Supposons que j'omet certaines variables d'un modèle de régression linéaire. Imaginez que ces variables omises ne sont pas corrélées avec les variables que j'ai incluses dans mon modèle. Ces variables omises ne biaisent pas les coefficients …
Après quelques recherches, je trouve très peu sur l'incorporation de poids d'observation / erreurs de mesure dans l'analyse des composants principaux. Ce que je trouve a tendance à s'appuyer sur des approches itératives pour inclure des pondérations (par exemple, ici ). Ma question est pourquoi cette approche est-elle nécessaire? Pourquoi …
J'ai besoin de générer des nombres aléatoires suivant la distribution normale dans l'intervalle (a,b)(a,b)(a,b) . (Je travaille dans R.) Je sais que la fonction rnorm(n,mean,sd)générera des nombres aléatoires suivant la distribution normale, mais comment définir les limites d'intervalle à l'intérieur de cela? Existe-t-il des fonctions R particulières disponibles pour cela?
Les cours de statistiques de base suggèrent souvent d'utiliser une distribution normale pour estimer la moyenne d'un paramètre de population lorsque la taille de l'échantillon n est grande (généralement supérieure à 30 ou 50). La distribution T de Student est utilisée pour des échantillons de plus petite taille afin de …
Je recherche des cas spécifiques et réels dans lesquels une relation de cause à effet a été indûment déduite de la preuve d'une corrélation. Plus précisément, je suis intéressé par des exemples qui répondent aux critères suivants: L'existence de la relation causale a été acceptée comme un fait suffisamment répandu …
Le pdf et le pmf et le cdf contiennent-ils la même information? Pour moi, le pdf donne la probabilité totale à un certain point (essentiellement la zone sous la probabilité). Le pmf donne la probabilité d'un certain point. Le cdf donne la probabilité sous un certain point. Donc pour moi …
Si dans le noyau PCA, je choisis un noyau linéaire , le résultat sera-t-il différent du PCA linéaire ordinaire ? Les solutions sont-elles fondamentalement différentes ou existe-t-il une relation bien définie?K( x , y ) = x⊤yK(X,y)=X⊤yK(\mathbf{x},\mathbf{y}) = \mathbf x^\top \mathbf y
Supposons que nous ayons une fonction que nous ne pouvons observer qu'à travers du bruit. Nous ne pouvons pas calculer directement, seulement où est un bruit aléatoire. (En pratique: je calcule utilisant une méthode de Monte Carlo.)f(x)f(x)f(x)f(x)f(x)f(x)f(x)+ηf(x)+ηf(x) + \etaηη\etaf(x)f(x)f(x) Quelles méthodes sont disponibles pour trouver les racines de , c'est-à-dire …
Je ne parle pas d'une valeur proche de zéro (arrondie à zéro par certains logiciels statistiques) mais plutôt d'une valeur littéralement nulle. Dans l'affirmative, cela signifierait-il que la probabilité d'obtenir les données obtenues en supposant que l'hypothèse nulle est vraie est également nulle? Quels sont (quelques exemples) des tests statistiques …
J'ai exécuté cette régression logistique ordinale dans R: mtcars_ordinal <- polr(as.factor(carb) ~ mpg, mtcars) J'ai obtenu ce résumé du modèle: summary(mtcars_ordinal) Re-fitting to get Hessian Call: polr(formula = as.factor(carb) ~ mpg, data = mtcars) Coefficients: Value Std. Error t value mpg -0.2335 0.06855 -3.406 Intercepts: Value Std. Error t value …
J'essaie d'identifier le meilleur modèle pour prédire les prix des automobiles, en utilisant les prix et les fonctionnalités disponibles sur les sites de petites annonces automobiles. Pour cela, j'ai utilisé quelques modèles de la bibliothèque scikit-learn et des modèles de réseaux neuronaux de pybrain et de neurolab. L'approche que j'ai …
Je suis un étudiant qui suit maintenant mon premier cours de statistique. Je suis confus par le terme «statistique de test». Dans ce qui suit (je l'ai vu dans certains manuels), semble être une valeur spécifique calculée à partir d'un échantillon spécifique. tttt=x¯¯¯−μ0s/n−−√t=x¯−μ0s/n t=\frac{\overline{x} - \mu_0}{s / \sqrt{n}} Cependant, dans …
J'ai deux distributions où seul le résumé à 5 chiffres (minimum, 1er quartile, médiane, 3e quartile, maximum) et la taille de l'échantillon sont connus. Contrairement à la question ici , tous les points de données ne sont pas disponibles. Existe-t-il un test statistique non paramétrique qui me permette de vérifier …
J'essaie de comprendre comment calculer l'indice Rand d'un algorithme de cluster, mais je suis coincé au point de savoir comment calculer les vrais et les faux négatifs. Pour le moment, j'utilise l'exemple du livre An Introduction into Information Retrieval (Manning, Raghavan & Schütze, 2009). À la page 359, ils expliquent …
J'ai deux effets principaux, V1 et V2. Les effets de V1 et V2 sur les variables de réponse sont négatifs. Cependant, pour une raison quelconque, j'obtiens un coefficient positif pour le terme d'interaction V1 * V2. Comment puis-je interpréter cela? une telle situation est-elle possible?
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.