Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

4
La «projection aléatoire» n'est-elle pas à proprement parler une projection?
Les implémentations actuelles de l'algorithme de projection aléatoire réduisent la dimensionnalité des échantillons de données en les mappant de à utilisant une matrice de projection dont les entrées proviennent d'une distribution appropriée (par exemple de ):RdRd\mathbb R^dRkRk\mathbb R^kd×kd×kd\times kRRRN(0,1)N(0,1)\mathcal N(0,1) x′=1k√xRx′=1kxRx^\prime = \frac{1}{\sqrt k}xR Idéalement, il existe des preuves théoriques …

2
Qu'est-il arrivé à Fuzzy Logic?
La logique floue semblait être un domaine de recherche actif dans l'apprentissage automatique et l'exploration de données lorsque j'étais à l'école (début des années 2000). Les systèmes d'inférence floue, les moyens c flous, les versions floues des divers réseaux de neurones et les architectures de machines à vecteurs de support …


2
Pourquoi les coefficients de régression logistique exponentiels sont-ils considérés comme des «odds ratios»?
La régression logistique modélise les cotes logarithmiques d'un événement comme un ensemble de prédicteurs. Autrement dit, log (p / (1-p)) où p est la probabilité d'un certain résultat. Ainsi, l'interprétation des coefficients de régression logistique brute pour une variable (x) doit être sur l'échelle log odds. Autrement dit, si le …

3
Calcul des valeurs de p dans les moindres carrés contraints (non négatifs)
J'utilise Matlab pour effectuer des moindres carrés sans contrainte (moindres carrés ordinaires) et il génère automatiquement les coefficients, les statistiques de test et les valeurs de p. Ma question est, lors de l'exécution des moindres carrés contraints (coefficients strictement non négatifs), il ne produit que les coefficients, SANS statistiques de …



1
Le problème de la pêche
Supposons que vous vouliez aller pêcher au lac voisin de 8h à 20h. En raison de la surpêche, une loi a été adoptée qui stipule que vous ne pouvez attraper qu'un seul poisson par jour. Lorsque vous attrapez un poisson, vous pouvez choisir de le garder (et donc de rentrer …

1
Quelle est la différence entre la VAE et la rétropropagation stochastique pour les modèles génératifs profonds?
Quelle est la différence entre l' encodage bayésien variationnel automatique et la rétropropagation stochastique pour les modèles génératifs profonds ? L'inférence dans les deux méthodes conduit-elle aux mêmes résultats? Je ne suis au courant d'aucune comparaison explicite entre les deux méthodes, malgré le fait que les deux groupes d'auteurs se …


2
Génère un bruit uniforme à partir d'une boule de norme p ( )
J'essaie d'écrire une fonction qui génère un bruit uniformément distribué qui provient d'une boule de norme p de dimensions:nnn ||x||p≤r||x||p≤r\begin{equation} ||x||_p \leq r \end{equation} J'ai trouvé des solutions possibles pour les cercles ( ) ( http://mathworld.wolfram.com/DiskPointPicking.html ), mais j'ai du mal à étendre cela pour différentes valeurs de .p=2p=2p = …
10 simulation  noise 

2
Quelle est la probabilité que
Supposons que XXX et YYY soient normaux bivariés avec la moyenne μ=(μ1,μ2)μ=(μ1,μ2)\mu=(\mu_1,\mu_2) et la covariance Σ=[σ11σ12σ12σ22]Σ=[σ11σ12σ12σ22]\Sigma = \begin{bmatrix} \sigma_{11} & \sigma_{12} \\ \sigma_{12} & \sigma_{22} \\ \end{bmatrix} . Quelle est la probabilité Pr(X&lt;Y|min(X,Y))Pr(X&lt;Y|min(X,Y))\Pr\left(X<Y|\min\left(X,Y\right)\right) ?

2
Que veut dire "Laissez les données parler d'elles-mêmes"?
En lisant l' article suivant , je suis tombé sur l'énoncé suivant: Comme mentionné, il est souvent présenté sans référence aux modèles probabilistes, conformément à l'idée de Benzecri [1973] de «laisser les données parler d'elles-mêmes». (la citation est tirée de JP Benzécri. L'analyse des données. Tome II: L'analyse des correspondances. …
10 eda  quotation 

1
Sur l'existence de l'UMVUE et le choix de l'estimateur de dans la population
Soit soit un échantillon aléatoire tiré de population où .(X1,X2,⋯,Xn)(X1,X2,⋯,Xn)(X_1,X_2,\cdots,X_n)N(θ,θ2)N(θ,θ2)\mathcal N(\theta,\theta^2)θ∈Rθ∈R\theta\in\mathbb R Je recherche l'UMVUE de .θθ\theta La densité conjointe de est(X1,X2,⋯,Xn)(X1,X2,⋯,Xn)(X_1,X_2,\cdots,X_n) fθ(x1,x2,⋯,xn)=∏i=1n1θ2π−−√exp[−12θ2(xi−θ)2]=1(θ2π−−√)nexp[−12θ2∑i=1n(xi−θ)2]=1(θ2π−−√)nexp[1θ∑i=1nxi−12θ2∑i=1nx2i−n2]=g(θ,T(x))h(x)∀(x1,⋯,xn)∈Rn,∀θ∈Rfθ(x1,x2,⋯,xn)=∏i=1n1θ2πexp⁡[−12θ2(xi−θ)2]=1(θ2π)nexp⁡[−12θ2∑i=1n(xi−θ)2]=1(θ2π)nexp⁡[1θ∑i=1nxi−12θ2∑i=1nxi2−n2]=g(θ,T(x))h(x)∀(x1,⋯,xn)∈Rn,∀θ∈R\begin{align} f_{\theta}(x_1,x_2,\cdots,x_n)&=\prod_{i=1}^n\frac{1}{\theta\sqrt{2\pi}}\exp\left[-\frac{1}{2\theta^2}(x_i-\theta)^2\right] \\&=\frac{1}{(\theta\sqrt{2\pi})^n}\exp\left[-\frac{1}{2\theta^2}\sum_{i=1}^n(x_i-\theta)^2\right] \\&=\frac{1}{(\theta\sqrt{2\pi})^n}\exp\left[\frac{1}{\theta}\sum_{i=1}^n x_i-\frac{1}{2\theta^2}\sum_{i=1}^nx_i^2-\frac{n}{2}\right] \\&=g(\theta,T(\mathbf x))h(\mathbf x)\qquad\forall\,(x_1,\cdots,x_n)\in\mathbb R^n\,,\forall\,\theta\in\mathbb R \end{align} , où g( θ , T( x ) ) = 1( θ 2 π√)nexp[ 1θ∑ni = 1Xje- …

3
MAP est une solution à
J'ai rencontré ces diapositives (diapositives # 16 et # 17) dans l'un des cours en ligne. L'instructeur tentait d'expliquer comment l'estimation maximale postérieure (MAP) est en fait la solution L ( θ ) = I[ θ ≠ θ∗]L(θ)=I[θ≠θ∗]L(\theta) = \mathcal{I}[\theta \ne \theta^{*}] , où θ∗θ∗\theta^{*} est le véritable paramètre. Quelqu'un …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.