Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Nombre optimal de cases dans l'histogramme par la règle de Freedman – Diaconis: différence entre le taux théorique et le nombre réel
Wikipédia signale que selon la règle de Freedman et Diaconis, le nombre optimal de casiers dans un histogramme, devrait croître commekkk k ∼n1 / 3k∼n1/3k\sim n^{1/3} où est la taille de l'échantillon.nnn Cependant, si vous regardez la nclass.FDfonction dans R, qui implémente cette règle, au moins avec les données gaussiennes …



2
Un intervalle de prédiction doit-il contenir la moyenne?
J'ai un énorme problème avec un problème conceptuel que j'ai trouvé. Disons qu'une entreprise a une distribution très asymétrique. Quelque chose de similaire à une exponentielle ou log-normale, mais plus extrême. Imaginez maintenant que la distribution est si asymétrique que la moyenne de la distribution est supérieure au 99% de …


3
Arrêt précoce vs validation croisée
J'utilise actuellement l'arrêt précoce de mon travail pour éviter un ajustement excessif. Plus précisément, ceux pris sous forme d' arrêt anticipé, mais quand? . Je veux maintenant comparer avec d'autres algorithmes de classification où il semble que la validation croisée 10 fois soit largement utilisée. Cependant, je ne sais pas …



1
Choix entre différentes régressions robustes dans R
J'écris un programme pour évaluer les biens immobiliers et je ne comprends pas vraiment les différences entre certains modèles de régression robustes, c'est pourquoi je ne sais pas lequel choisir. J'ai essayé lmrob, ltsReget rlm. pour le même ensemble de données, les trois méthodes m'ont donné des valeurs différentes pour …

4
Si
Une hypothèse pour l'analyse de régression est que et ne sont pas entrelacés. Cependant quand j'y pense Il me semble que cela a du sens.XXXOuiYY Voici un exemple. Si nous avons un test avec 3 sections (AB et C). La note globale du test est égale à la somme des …


2
R lmerTest et tests de plusieurs effets aléatoires
Je suis curieux de savoir comment le package lmerTest dans R, en particulier la fonction "rand", gère les tests d'effets aléatoires. Prenons l'exemple du pdf lmerTest sur CRAN qui utilise l'ensemble de données "carottes" intégré: #import lme4 package and lmerTest package library(lmerTest) #lmer model with correlation between intercept and slopes …

1
Limite supérieure sur où et
XXX est une variable aléatoire discrète qui peut prendre des valeurs de . Puisque est une fonction convexe, nous pouvons utiliser l'inégalité de Jensen pour dériver une borne inférieure : Est-il possible de dériver une borne supérieure ?(0,1)(0,1)(0,1)φ(x)=1/xφ(x)=1/x\varphi(x)=1/xE[11−X]≥11−E[X]=11−aE[11−X]≥11−E[X]=11−a E\left[\frac{1}{1-X}\right]\ge \frac{1}{1-E[X]}=\frac{1}{1-a}

2
Pourquoi y a-t-il un E dans le nom de l'algorithme EM?
Je comprends où l'étape E se produit dans l'algorithme (comme expliqué dans la section mathématique ci-dessous). Dans mon esprit, l'ingéniosité clé de l'algorithme est l'utilisation de l'inégalité de Jensen pour créer une limite inférieure à la vraisemblance logarithmique. En ce sens, prendre le Expectationest simplement fait pour reformuler la probabilité …

1
Comment calculer une taille d'échantillon pour valider la correcte / inexactitude des enregistrements dans un tableau de données?
J'ai lu les réponses existantes sur CrossValidated (et ailleurs en ligne) et je ne trouve pas ce que je recherche, mais veuillez me signaler les sources existantes si je les ai manquées. Disons que j'ai un ensemble de données de N = 1000 enregistrements, dont chacun peut être échantillonné manuellement …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.