Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


5
Comparaison de la variance des observations appariées
J'ai NNN observations appariées ( , ) tirées d'une distribution inconnue commune, qui a des premier et deuxième moments finis, et est symétrique autour de la moyenne.XiXiX_iYiYiY_i Soit l'écart type de (inconditionnel à ), et même pour Y. Je voudrais tester l'hypothèse X Y σ YσXσX\sigma_XXXXYYYσYσY\sigma_Y H0H0H_0 :σX=σYσX=σY\sigma_X = \sigma_Y …

4
Aperçu complet des fonctions de perte?
J'essaie d'avoir une perspective globale sur certaines des idées essentielles de l'apprentissage automatique, et je me demandais s'il existe un traitement complet des différentes notions de perte (carré, logarithme, charnière, proxy, etc.). Je pensais à quelque chose dans le sens d'une présentation plus complète et formelle de l'excellent article de …


2
Pourquoi faisons-nous autant d'histoires sur l'utilisation de la notation Fisher lorsque nous adaptons un GLM?
Je suis curieux de savoir pourquoi nous traitons l'ajustement de GLMS comme s'il s'agissait d'un problème d'optimisation spécial. Sont-ils? Il me semble que ce ne sont que des probabilités maximales, et que nous écrivons la probabilité et ensuite ... nous la maximisons! Alors pourquoi utilisons-nous la notation de Fisher au …

1
EM, y a-t-il une explication intuitive?
La procédure EM apparaît, pour les non-initiés, comme une magie plus ou moins noire. Estimer les paramètres d'un HMM (par exemple) à l'aide de données supervisées. Décodez ensuite les données non marquées, en utilisant le sens avant-arrière pour «compter» les événements comme si les données étaient plus ou moins marquées. …


1
Stan
Je parcourais la documentation de Stan qui peut être téléchargée ici . J'étais particulièrement intéressé par leur implémentation du diagnostic Gelman-Rubin. Le document original Gelman & Rubin (1992) définit le facteur de réduction d'échelle potentiel (PSRF) comme suit: Soit Xi,1,…,Xi,NXi,1,…,Xi,NX_{i,1}, \dots , X_{i,N} la iii ème chaîne de Markov échantillonnée, …


3
Perceptron multicouche vs réseau de neurones profonds
C'est une question de terminologie. Parfois, je vois des gens se référer aux réseaux de neurones profonds comme des "perceptrons multicouches", pourquoi cela? Un perceptron, m'a-t-on appris, est un classificateur à couche unique (ou régresseur) avec une sortie de seuil binaire utilisant une manière spécifique d'entraîner les poids (et non …



3
Quelle est la relation entre la distribution bêta et le modèle de régression logistique?
Ma question est: quelle est la relation mathématique entre la distribution bêta et les coefficients du modèle de régression logistique ? Pour illustrer: la fonction logistique (sigmoïde) est donnée par f(x)=11+exp(−x)f(x)=11+exp⁡(−x)f(x) = \frac{1}{1+\exp(-x)} et il est utilisé pour modéliser les probabilités dans le modèle de régression logistique. Soit un résultat …

1
Dérivation du changement de variables d'une fonction de densité de probabilité?
Dans la reconnaissance des formes de livre et l'apprentissage automatique (formule 1.27), il donne py(y)=px(x)∣∣∣dxdy∣∣∣=px(g(y))|g′(y)|py(y)=px(x)|dxdy|=px(g(y))|g′(y)|p_y(y)=p_x(x) \left | \frac{d x}{d y} \right |=p_x(g(y)) | g'(y) | où , est le pdf qui correspond à par rapport au changement de la variable.px=g(y)x=g(y)x=g(y)p y ( y )px(x)px(x)p_x(x)py(y)py(y)p_y(y) Les livres disent que c'est parce …

2
Précision vs aire sous la courbe ROC
J'ai construit une courbe ROC pour un système de diagnostic. L'aire sous la courbe a ensuite été estimée de manière non paramétrique à AUC = 0,89. Lorsque j'ai essayé de calculer la précision au réglage de seuil optimal (le point le plus proche du point (0, 1)), j'ai obtenu la …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.