Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Comment fonctionne le L-BFGS?
Le but de l'article était d'optimiser certains paramètres en maximisant la log-vraisemblance régularisée. Ensuite, ils calculent des dérivées partielles. Et puis les auteurs mentionnent qu'ils optimisent l'équation en utilisant L-BFGS, une procédure standard de Newton pour optimiser les fonctions lisses de nombreuses variables (pas plus de détails). Comment ça marche …

4
Compréhension intuitive de la différence entre cohérent et asymptotiquement non biaisé
J'essaie d'obtenir une compréhension intuitive et de ressentir la différence et la différence pratique entre le terme cohérent et asymptotiquement impartial. Je connais leurs définitions mathématiques / statistiques, mais je cherche quelque chose d'intuitif. Pour moi, en regardant leurs définitions individuelles, ils semblent presque être la même chose. Je réalise …

2
Quelle est la distribution des moyennes d'échantillonnage d'une distribution de Cauchy?
Typiquement, lorsque l'on prend des moyennes d'échantillons aléatoires d'une distribution (avec une taille d'échantillon supérieure à 30), on obtient une distribution normale centrée autour de la valeur moyenne. Cependant, j'ai entendu dire que la distribution de Cauchy n'a pas de valeur moyenne. Quelle distribution obtient-on alors en obtenant des moyennes …
14 cauchy 




3
Quelle est exactement la différence entre un modèle paramétrique et non paramétrique?
Je suis confus avec la définition du modèle non paramétrique après avoir lu ce lien Modèles paramétriques vs modèles non paramétriques et répondre aux commentaires de ma autre question . À l'origine, je pensais que "paramétrique vs non paramétrique" signifie si nous avons des hypothèses de distribution sur le modèle …

1
Combinaison de plusieurs mesures pour fournir des comparaisons / classement des k objets [Question et demande de référence]
Collectionner nnn métriques sur kkk objets Supposons que je collectionne nnn métriques sur kkkobjets. Je cherche des moyens valables de comparer leskkkobjets afin qu'ils puissent être "classés". Je pense que cela peut être un terrain très fréquenté (statistiques sportives comme le total des quarts, etc.) mais je ne connais pas …

1
Une régression logistique maximisant la vraisemblance maximise-t-elle aussi nécessairement l'ASC par rapport aux modèles linéaires?
Étant donné un ensemble de données avec des résultats binaires y∈{0,1}ny∈{0,1}ny\in\{0,1\}^n et une matrice prédictive X∈Rn×pX∈Rn×pX\in\mathbb{R}^{n\times p} , le modèle de régression logistique standard estime les coefficients βMLEβMLE\beta_{MLE} qui maximisent la vraisemblance binomiale. Lorsque XXX est de rang complet βMLEβMLE\beta_{MLE} est unique; lorsque la séparation parfaite n'est pas présente, elle …

1
Abandon des valeurs aberrantes sur la base de «2,5 fois le RMSE»
Dans Kahneman et Deaton (2010) , les auteurs écrivent ce qui suit:††^\dagger Cette régression explique 37% de la variance, avec une erreur quadratique moyenne (RMSE) de 0,67852. Pour éliminer les valeurs aberrantes et les rapports de revenus peu plausibles, nous avons supprimé les observations dans lesquelles la valeur absolue de …

3
Existe-t-il des articles très cités sur les statistiques qui ont propagé de mauvaises pratiques statistiques?
Il existe évidemment de nombreuses manières d'abuser des méthodes statistiques. Connaissez-vous des exemples de mauvaises pratiques statistiques qui ont été publiés pour la première fois comme des conseils explicites (par exemple, "vous devriez utiliser cette méthode pour ..."), dans des revues universitaires réputées qui ont ensuite été citées à plusieurs …


5
Question philosophique sur la régression logistique: pourquoi la valeur seuil optimale n'est-elle pas formée?
Habituellement, dans la régression logistique, nous ajustons un modèle et obtenons des prédictions sur l'ensemble d'entraînement. Nous validons ensuite ces prévisions d'entraînement (quelque chose comme ici ) et décidons de la valeur seuil optimale en fonction de quelque chose comme la courbe ROC. Pourquoi ne pas intégrer la validation croisée …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.