Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


4
Qu'est-ce qui rend le lasso instable pour la sélection des fonctionnalités?
Dans la détection compressée, il existe un théorème garantissant que a une solution clairsemée unique c (voir l'annexe pour plus de détails).argmin∥c∥1subject to y=Xcargmin‖c‖1subject to y=Xc\text{argmin} \Vert c \Vert_1\\ \text{subject to } y = Xc ccc Existe-t-il un théorème similaire pour le lasso? S'il existe un tel théorème, non seulement …


1
Comprendre la régression de crête négative
Je recherche de la documentation sur la régression de crête négative . En bref, il est une généralisation de la régression linéaire de la crête négative en utilisant λλ\lambda dans la formule β^=(X⊤X+λI)−1X⊤y.β^=(X⊤X+λI)−1X⊤y.\hat\beta = ( X^\top X + \lambda I)^{-1} X^\top y.Le cas positif a une belle théorie: en tant …


1
RMSProp et Adam vs SGD
J'exécute des expériences sur l'ensemble de validation EMNIST en utilisant des réseaux avec RMSProp, Adam et SGD. J'atteins une précision de 87% avec SGD (taux d'apprentissage de 0,1) et décrochage (0,1 décrochage prob) ainsi que la régularisation L2 (pénalité 1e-05). En testant la même configuration exacte avec RMSProp et Adam …

1
Effet causal par les ajustements de la porte arrière et de la porte d'entrée
Si nous voulions calculer l'effet causal de sur dans le graphique causal ci-dessous, nous pouvons utiliser à la fois les théorèmes d'ajustement de porte arrière et d'ajustement de porte d'entrée, c'est-à-dire XXXYYYP(y|do(X=x))=∑uP(y|x,u)P(u)P(y|do(X=x))=∑uP(y|x,u)P(u)P(y | \textit{do}(X = x)) = \sum_u P(y | x, u) P(u) et P(y|do(X=x))=∑zP(z|x)∑x′P(y|x′,z)P(x′).P(y|do(X=x))=∑zP(z|x)∑x′P(y|x′,z)P(x′).P(y | \textit{do}(X = x)) = …

4
Quelle est la relation entre l'ANOVA pour comparer les moyennes de plusieurs groupes et l'ANOVA pour comparer les modèles imbriqués?
Jusqu'à présent, j'ai vu l'ANOVA utilisée de deux manières: Premièrement , dans mon texte d'introduction aux statistiques, l'ANOVA a été présentée comme un moyen de comparer les moyennes de trois groupes ou plus, comme une amélioration par rapport à la comparaison par paires, afin de déterminer si l'un des moyennes …


5
Est-il possible que deux variables aléatoires d'une même famille de distribution aient la même attente et variance, mais des moments supérieurs différents?
Je pensais à la signification de la famille à l'échelle de l'emplacement. Je crois comprendre que pour chaque XXX membre d'un emplacement famille à grande échelle avec des paramètres emplacement et échelle, la distribution de ne dépend pas de tous les paramètres et il est le même pour tous appartenant …


1
Inférence variationnelle, la divergence KL nécessite un vrai
À ma compréhension (très modeste) de l'inférence variationnelle, on essaie d'approximer une distribution inconnue ppp en trouvant une distribution qqq qui optimise ce qui suit: KL(p||q)=∑xp(x)logp(x)q(x)KL(p||q)=∑xp(x)logp(x)q(x)KL (p||q) = \sum\limits_{x} p(x)log \frac {p(x)}{q(x)} Chaque fois que j'investis du temps dans la compréhension de l'inférence variationnelle, je continue à appuyer sur cette …


3
Motivation des unités de sortie sigmoïdes dans les réseaux de neurones commençant par des probabilités logarithmiques non normalisées linéaires en
Contexte: J'étudie le chapitre 6 du Deep Learning par Ian Goodfellow et Yoshua Bengio et Aaron Courville. Dans la section 6.2.2.2 (pages 182 de 183 qui peuvent être consultées ici ), l'utilisation de sigmoïde pour produire est motivée.P(y=1|x)P(y=1|x)P(y=1|x) Pour résumer une partie du matériel, ils laissent un neurone de sortie …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.