Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Clarification sur la mise en œuvre de la règle Perceptron vs descente de gradient vs mise en œuvre de descente de gradient stochastique
J'ai expérimenté un peu avec différentes implémentations de Perceptron et je veux m'assurer si je comprends bien les "itérations". La règle originale de Perceptron de Rosenblatt D'après ce que je comprends, dans l'algorithme de perceptron classique de Rosenblatt, les poids sont mis à jour simultanément après chaque exemple de formation …

2
Quel est le point de vue fréquentiste sur l'histoire du voltmètre?
Quel est le point de vue fréquentiste sur l'histoire du voltmètre et ses variations? L'idée sous-jacente est qu'une analyse statistique qui fait appel à des événements hypothétiques devrait être révisée si l'on apprenait plus tard que ces événements hypothétiques n'auraient pas pu se produire comme prévu. La version de l'histoire …

2
Création d'un index unique à partir de plusieurs composants principaux ou facteurs retenus de PCA / FA
J'utilise l'analyse en composantes principales (ACP) pour créer un index requis pour mes recherches. Ma question est de savoir comment créer un index unique en utilisant les principaux composants retenus calculés via PCA. Par exemple, j'ai décidé de conserver 3 composantes principales après avoir utilisé l'ACP et j'ai calculé les …

1
Avantages de Box-Muller par rapport à la méthode CDF inverse pour simuler une distribution normale?
Afin de simuler une distribution normale à partir d'un ensemble de variables uniformes, il existe plusieurs techniques: L'algorithme de Box-Muller , dans lequel on échantillonne deux variables uniformes indépendantes sur et les transforme en deux distributions normales standard indépendantes via: (0,1)(0,1)(0,1)Z0=−2lnU1−−−−−−√cos(2πU0)Z1=−2lnU1−−−−−−√sin(2πU0)Z0=−2lnU1cos(2πU0)Z1=−2lnU1sin(2πU0) Z_0 = \sqrt{-2\text{ln}U_1}\text{cos}(2\pi U_0)\\ Z_1 = \sqrt{-2\text{ln}U_1}\text{sin}(2\pi U_0) la …

2
Écart absolu médian (MAD) et écart-type de différentes distributions
Pour les données normalement distribuées, l'écart type σσ\sigma et l'écart médian absolu MADMAD\text{MAD} sont liés par: σ=Φ−1(3/4)⋅MAD≈1.4826⋅MAD,σ=Φ−1(3/4)⋅MAD≈1.4826⋅MAD,\sigma=\Phi^{-1}(3/4)\cdot \text{MAD}\approx1.4826\cdot\text{MAD}, où Φ()Φ()\Phi() est la fonction de distribution cumulative pour la distribution normale standard. Existe-t-il une relation similaire pour les autres distributions?

6
Quel est le problème avec les tests post-hoc?
Mon professeur de statistique le dit, tous les livres que je regarde le disent: les tests post-hoc ne sont pas scientifiques. Vous devez d'abord dériver une hypothèse de la théorie, puis collecter des données et les analyser. Mais je ne comprends vraiment pas quel est le problème. Supposons que je …
15 post-hoc 

1
2SLS mais Probit deuxième étage
J'essaie d'utiliser l'analyse des variables instrumentales pour inférer la causalité avec des données d'observation. J'ai rencontré une régression des moindres carrés en deux étapes (2SLS) qui est susceptible de résoudre le problème d'endogénéité dans mes recherches. Cependant, je voudrais que la première étape soit OLS et la deuxième étape soit …

3
Que signifie le test d'hypothèse bayésien dans le cadre de la théorie de l'inférence et de la décision?
Mon expérience est principalement dans l'apprentissage automatique et j'essayais de comprendre ce que signifiait le test d'hypothèse bayésienne. Je suis d'accord avec l'interprétation bayésienne de la probabilité et je la connais dans le contexte des modèles graphiques probabilistes. Cependant, ce qui m'embrouille, c'est ce que le mot «hypothèse» signifie dans …

2
«Variable fictive» versus «variable indicatrice» pour les données nominales / catégorielles
«Variable factice» et «variable indicatrice» sont des termes fréquemment utilisés pour décrire l'appartenance à une catégorie avec un codage 0/1; généralement 0: pas un membre de la catégorie, 1: membre de la catégorie. Le 26/11/2014, une recherche rapide sur scholar.google.com (avec guillemets inclus) révèle que "variable fictive" est utilisée dans …


3
Dans le lissage de Kneser-Ney, comment les mots invisibles sont-ils traités?
D'après ce que j'ai vu, la formule de lissage (de second ordre) de Kneser-Ney est d'une manière ou d'une autre donnée comme P2KN(wn|wn−1)=max{C(wn−1,wn)−D,0}∑w′C(wn−1,w′)+λ(wn−1)×Pcont(wn)PKN2(wn|wn−1)=max{C(wn−1,wn)−D,0}∑w′C(wn−1,w′)+λ(wn−1)×Pcont(wn) \begin{align} P^2_{KN}(w_n|w_{n-1}) &= \frac{\max \left\{ C\left(w_{n-1}, w_n\right) - D, 0\right\}}{\sum_{w'} C\left(w_{n-1}, w'\right)} + \lambda(w_{n-1}) \times P_{cont}(w_n) \end{align} avec le facteur de normalisation λ(wn−1)λ(wn−1)\lambda(w_{n-1}) donné comme λ(wn−1)=D∑w′C(wn−1,w′)×N1+(wn−1∙)λ(wn−1)=D∑w′C(wn−1,w′)×N1+(wn−1∙) \begin{align} …

4
Effet fixe vs effet aléatoire lorsque toutes les possibilités sont incluses dans un modèle d'effets mixtes
Dans un modèle à effets mixtes, la recommandation consiste à utiliser un effet fixe pour estimer un paramètre si tous les niveaux possibles sont inclus (par exemple, hommes et femmes). Il est en outre recommandé d'utiliser un effet aléatoire pour tenir compte d'une variable si les niveaux inclus ne sont …

2
Simulation de tirages à partir d'une distribution uniforme à l'aide de tirages à partir d'une distribution normale
J'ai récemment acheté une ressource d'entrevue en science des données dans laquelle l'une des questions de probabilité était la suivante: Étant donné les tirages d'une distribution normale avec des paramètres connus, comment pouvez-vous simuler les tirages d'une distribution uniforme? Mon processus de pensée original était que, pour une variable aléatoire …

11
Affichage de trois informations sur un graphique
Remarque: 50 points de données brutes sont désormais attachés. Je veux afficher la quantité d'études que j'ai faites et le nombre de pages que j'ai complétées au cours de la semaine, réparties par jour, et je l'ai fait comme indiqué ci-dessous: Des gens m'ont dit qu'ils ne pouvaient pas comprendre …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.