Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


3
Exemple de distribution où une grande taille d'échantillon est nécessaire pour le théorème de la limite centrale
Certains livres indiquent qu'un échantillon de taille 30 ou plus est nécessaire pour que le théorème de la limite centrale donne une bonne approximation de . X¯X¯\bar{X} Je sais que cela ne suffit pas pour toutes les distributions. Je souhaite voir quelques exemples de distributions où, même avec un échantillon …

5
Quelle est la meilleure façon de visualiser la relation entre les variables discrètes et continues?
Quelle est la meilleure façon de montrer une relation entre: variable continue et discrète, deux variables discrètes? Jusqu'à présent, j'ai utilisé des diagrammes de dispersion pour examiner la relation entre les variables continues. Cependant, dans le cas de variables discrètes, les points de données sont cumulés à certains intervalles. Ainsi, …






3
Quelle est la différence pratique entre les règles d'association et les arbres de décision dans l'exploration de données?
Existe-t-il une description très simple des différences pratiques entre ces deux techniques? Les deux semblent être utilisés pour l'apprentissage supervisé (bien que les règles d'association puissent également gérer sans supervision). Les deux peuvent être utilisés pour la prédiction Le plus proche que j'ai trouvé à une «bonne» description est du …



2
Si le principe de vraisemblance se heurte à la probabilité fréquentiste, alors en rejetons-nous un?
Dans un commentaire récemment publié ici, un commentateur a signalé un blog de Larry Wasserman qui souligne (sans aucune source) que l'inférence fréquentiste se heurte au principe de vraisemblance. Le principe de vraisemblance dit simplement que les expériences produisant des fonctions de vraisemblance similaires devraient produire une inférence similaire. Deux …

1
Lmer () peut-il utiliser des splines comme effets aléatoires?
Supposons que nous travaillons sur un modèle à effets aléatoires de certaines données de comptage au fil du temps, et que nous voulons contrôler certaines tendances. Normalement, vous feriez quelque chose comme: lmer(counts ~ dependent_variable + (1+t+I(t^2)|ID), family="poisson") pour inclure une forme quadratique pour t. Est-il possible d'utiliser des techniques …


3
Interpréter trois formes d'un «modèle mixte»
Il y a une distinction qui me fait trébucher avec des modèles mixtes, et je me demande si je pourrais obtenir une certaine clarté. Supposons que vous ayez un modèle mixte de données de comptage. Il y a une variable que vous voulez comme effet fixe (A) et une autre …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.