Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Analyse discriminante linéaire et données non distribuées normalement
Si je comprends bien, une analyse discriminante linéaire (LDA) suppose des données distribuées normales, des caractéristiques indépendantes et des covariances identiques pour chaque classe pour le critère d'optimalité. Puisque la moyenne et la variance sont estimées à partir des données d'entraînement, n'est-ce pas déjà une violation? J'ai trouvé une citation …

1
La population de Martiens aux yeux bleus diminue-t-elle?
Supposons que nous voulons tester l'hypothèse selon laquelle la proportion de martiens aux yeux bleus a diminué tout au long du 20e siècle. Malheureusement, la population martienne fluctue fortement, donc chaque décennie il y a une grande différence dans la population totale [mise à jour: considérez la population martienne comme …

1
Utilisation d'une règle de notation appropriée pour déterminer l'appartenance à une classe à partir de la régression logistique
J'utilise la régression logistique pour prédire la probabilité qu'un événement se produise. En fin de compte, ces probabilités sont placées dans un environnement de production, où nous nous concentrons autant que possible sur nos prévisions de «oui». Il est donc utile pour nous d'avoir une idée de ce que les …

1
où et est distribué lognormalement
de calculer l'espérance pour arbitraire (pour l'attente est infinie) si est lognormalement distribué, ie .E[ecX]E[ecX]E[e^{cX}]c&lt;0c&lt;0c<0c&gt;0c&gt;0c>0XXXlog(X)∼N(μ,σ)log⁡(X)∼N(μ,σ)\log(X) \sim N(\mu, \sigma) Mon idée était d'écrire l'attente comme intégrale, mais je n'ai pas vu comment procéder: E[ecX]=12σπ−−−√∫∞01xexp(cx−(logx−μ)22σ2)dxE[ecX]=12σπ∫0∞1xexp⁡(cx−(log⁡x−μ)22σ2)dxE[e^{cX}] = \frac{1}{\sqrt{2\sigma\pi}}\int_0^\infty \frac{1}{x}\exp\left(cx - \frac{(\log x - \mu)^2}{2\sigma^2}\right)dx J'ai également essayé la formule Itô (la tâche réelle …

2
sous un gaussien
Cette question découle de la question suivante. /math/360275/e1-1x2-under-a-normal-distribution Fondamentalement, quel est le E(11 +X2)E(11+x2)E\left(\frac{1}{1+x^2}\right) sous un gaussien général N( μ ,σ2)N(μ,σ2)\mathcal{N}(\mu,\sigma^2). J'ai essayé de réécrire11 +X211+x2\frac{1}{1+x^2} comme un mélange scalaire de gaussiens (∝ ∫N( x | 0 ,τ- 1) G a ( τ| Une / 2,une / 2)dτ∝∫N(x|0,τ−1)Ga(τ|1/2,1/2)dτ\propto \int\mathcal{N}(x|0,\tau^{-1})Ga(\tau|1/2,1/2)d\tau). Cela …

1
Comment s'effectue exactement la contrainte de centrage (ou moyenne) des splines (également par rapport à mgcv)?
Le processus de génération de données est: y=sin(x+I(d=0))+sin(x+4∗I(d=1))+I(d=0)z2+3I(d=1)z2+N(0,1)y=sin(x+I(d=0))+sin(x+4∗I(d=1))+I(d=0)z2+3I(d=1)z2+N(0,1)y = \text{sin}\Big(x+I(d=0)\Big) + \text{sin}\Big(x+4*I(d=1)\Big) + I(d=0)z^2 + 3I(d=1)z^2 + \mathbb{N}\left(0,1\right) Soit une suite de à de longueur et le facteur correspondant . Prenez toutes les combinaisons possibles de pour calculer : x,zx,zx,z−4−4-4444100100100dddd∈{0,1}d∈{0,1}d\in\{0,1\}x,z,dx,z,dx,z,dyyy L'utilisation de la base B-spline (non centrée) pour pour chaque …

1
Hyper-volume du contour d'un gaussien multivarié
Je cherche la valeur asymptotique ( ) de (le log du déterminant de) la covariance du % d'observations avec la plus petite distance euclédienne à l'origine dans un échantillon de taille tiré de, disons , un gaussien standard bivarié.n→∞n→∞n\rightarrow \inftyαα\alphannn - L'hyper-volume d'une ellipse est proportionnel au déterminant de sa …

1
R - puissance.prop.test, prop.test et tailles inégales des échantillons dans les tests A / B
Disons que je veux savoir de quelle taille d'échantillon j'ai besoin pour une expérience dans laquelle je cherche à déterminer si la différence entre deux proportions de succès est statistiquement significative. Voici mon processus actuel: Examinez les données historiques pour établir des prévisions de base. Supposons que par le passé, …



3
Calcul des tailles d'effet et des erreurs standard pour la différence entre deux différences moyennes normalisées
J'ai deux questions connexes, toutes deux liées à une méta-analyse que j'effectue là où les principaux résultats sont exprimés en termes de différence moyenne normalisée. Mes études ont plusieurs variables disponibles avec lesquelles calculer la différence moyenne standardisée. Je voudrais savoir dans quelle mesure les différences moyennes standardisées calculées sur …

1
Avantage de multiples simulations à Monte-Carlo à l'ancienne?
L'esprit de cette question vient de "l'Ordinaire de Monte-Carlo", aussi appelé "bon vieux Monte-Carlo" Supposons que j'ai une variable aléatoire XXX, avec μ:=E[X]σ2:=Var[X]μ:=E[X]σ2:=Var[X]\mu := E[X]\\ \sigma^2:=Var[X] Les deux sont des valeurs inconnues, car la fonction de distribution de probabilité de XXX est inconnu (ou les calculs sont intraitables). Quoi qu'il …



1
Combiner des données de différentes sources
Je souhaite combiner des données provenant de différentes sources. Disons que je veux estimer une propriété chimique (par exemple un coefficient de partage ): J'ai quelques données empiriques, variant en raison d'une erreur de mesure autour de la moyenne. Et, deuxièmement, j'ai un modèle prédisant une estimation à partir d'autres …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.