Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Interprétation des effets fixes à partir de la régression logistique à effets mixtes
Je suis confus par les déclarations sur une page Web de l'UCLA sur la régression logistique à effets mixtes. Ils montrent un tableau des coefficients d'effets fixes de l'ajustement d'un tel modèle et le premier paragraphe ci-dessous semble interpréter les coefficients exactement comme une régression logistique normale. Mais quand ils …

2
Une '' variable significative '' qui n'améliore pas les prévisions hors échantillon - comment interpréter?
J'ai une question qui, je pense, sera assez basique pour beaucoup d'utilisateurs. J'utilise des modèles de régression linéaire pour (i) étudier la relation entre plusieurs variables explicatives et ma variable de réponse et (ii) prédire ma variable de réponse en utilisant les variables explicatives. Une variable explicative particulière X semble …

2
Estimateur positif et impartial du carré de la moyenne
Supposons que nous ayons accès à des échantillons iid d'une distribution avec une moyenne et une variance vraies (inconnues) , et nous voulons estimer .μ 2μ , σ2μ,σ2\mu, \sigma^2μ2μ2\mu^2 Comment construire un estimateur non biaisé, toujours positif de cette quantité? La prise du carré de la moyenne de l'échantillon est …

2
Pourquoi utilisons-nous des résidus pour tester les hypothèses sur les erreurs de régression?
Supposons que nous ayons un modèle .Yi=β0+β1Xi1+β2Xi2+⋯+βkXik+ϵiYi=β0+β1Xi1+β2Xi2+⋯+βkXik+ϵiY_i = \beta_0 + \beta_1X_{i1} + \beta_2X_{i2} + \dots + \beta_kX_{ik} + \epsilon_i La régression a un certain nombre d'hypothèses, telles que les erreurs devraient être normalement distribuées avec un zéro moyen et une variance constante. On m'a appris à vérifier ces hypothèses en …

4
Comment prouver statistiquement si une colonne contient des données catégoriques ou non en utilisant Python
J'ai un bloc de données en python où j'ai besoin de trouver toutes les variables catégorielles. La vérification du type de la colonne ne fonctionne pas toujours car le inttype peut également être catégorique. Je cherche donc de l'aide pour trouver la bonne méthode de test d'hypothèse pour identifier si …

1
Quelle est la différence entre fonction_décision, fonction_prédire et fonction de prédiction pour un problème de régression logistique?
J'ai parcouru la documentation sklearn mais je ne suis pas en mesure de comprendre le but de ces fonctions dans le contexte de la régression logistique. Car decision_functionil dit que c'est la distance entre l'hyperplan et l'instance de test. comment cette information particulière est-elle utile? et comment cela ne se …



3
Distribution de lorsque sont des variables indépendantes
Comme exercice de routine, j'essaie de trouver la distribution de où et sont des variables aléatoires indépendantes.X2+Y2−−−−−−−√X2+Y2\sqrt{X^2+Y^2}XXXYYYU(0,1)U(0,1) U(0,1) La densité conjointe de est (X,Y)(X,Y)(X,Y)fX,Y(x,y)=10&lt;x,y&lt;1fX,Y(x,y)=10&lt;x,y&lt;1f_{X,Y}(x,y)=\mathbf 1_{0\cos^{-1}\left(\frac{1}{z}\right)cosθcos⁡θ\cos\thetaθ∈[0,π2]θ∈[0,π2]\theta\in\left[0,\frac{\pi}{2}\right]zsinθ&lt;1⟹θ&lt;sin−1(1z)zsin⁡θ&lt;1⟹θ&lt;sin−1⁡(1z)z\sin\theta<1\implies\theta<\sin^{-1}\left(\frac{1}{z}\right)sinθsin⁡θ\sin\thetaθ∈[0,π2]θ∈[0,π2]\theta\in\left[0,\frac{\pi}{2}\right] Donc, pour , nous avons .1&lt;z&lt;2–√1&lt;z&lt;21< z<\sqrt 2cos−1(1z)&lt;θ&lt;sin−1(1z)cos−1⁡(1z)&lt;θ&lt;sin−1⁡(1z)\cos^{-1}\left(\frac{1}{z}\right)<\theta<\sin^{-1}\left(\frac{1}{z}\right) La valeur absolue du jacobien de transformation est|J|=z|J|=z|J|=z Ainsi, la densité conjointe de est donnée par(Z,Θ)(Z,Θ)(Z,\Theta) fZ,Θ(z,θ)=z1{z∈(0,1),θ∈(0,π/2)}⋃{z∈(1,2√),θ∈(cos−1(1/z),sin−1(1/z))}fZ,Θ(z,θ)=z1{z∈(0,1),θ∈(0,π/2)}⋃{z∈(1,2),θ∈(cos−1⁡(1/z),sin−1⁡(1/z))}f_{Z,\Theta}(z,\theta)=z\mathbf …





3
Les hyperplans classent de manière optimale les données lorsque les entrées sont indépendantes conditionnellement - Pourquoi?
Dans l'article intitulé Deep Learning and the Information Bottleneck Principle, les auteurs déclarent dans la section II A) ce qui suit: Les neurones simples ne classent que les entrées séparables linéairement, car ils ne peuvent implémenter que des hyperplans dans leur espace d'entrée . Les hyperplans peuvent classer de manière …

1
Pourquoi les caractéristiques aléatoires de Fourier sont-elles non négatives?
Les fonctionnalités de Fourier aléatoires fournissent des approximations des fonctions du noyau. Ils sont utilisés pour diverses méthodes du noyau, comme les SVM et les processus gaussiens. Aujourd'hui, j'ai essayé d'utiliser l' implémentation TensorFlow et j'ai obtenu des valeurs négatives pour la moitié de mes fonctionnalités. Si je comprends bien, …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.