Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données





2
Limite d'erreur au niveau de la famille: la réutilisation des ensembles de données sur différentes études de questions indépendantes entraîne-t-elle de multiples problèmes de test?
Si une équipe de chercheurs effectue plusieurs tests (d'hypothèse) sur un ensemble de données donné, il existe un volume de littérature affirmant qu'ils devraient utiliser une certaine forme de correction pour les tests multiples (Bonferroni, etc.), même si les tests sont indépendants. Ma question est la suivante: cette même logique …


1
Sélection du modèle bayésien dans PyMC3
J'utilise PyMC3 pour exécuter des modèles bayésiens sur mes données. Je suis nouveau dans la modélisation bayésienne mais selon certains articles de blogs , Wikipedia et QA de ce site, il semble que ce soit une approche valable pour utiliser le facteur Bayes et le critère BIC pour pouvoir choisir …

1
Combien de distributions sont dans le GLM?
J'ai identifié plusieurs endroits dans les manuels où le GLM est décrit avec 5 distributions (à savoir, Gamma, gaussienne, binomiale, gaussienne inverse et Poisson). Ceci est également illustré dans la fonction familiale dans R. Parfois, je rencontre des références au GLM où des distributions supplémentaires sont incluses ( exemple ). …


2
Quelles sont les différences entre la régression Ridge en utilisant glmnet de R et scikit-learn de Python?
Je passe par la section LAB §6.6 sur Ridge Regression / Lasso dans le livre 'An Introduction to Statistical Learning with Applications in R' de James, Witten, Hastie, Tibshirani (2013). Plus précisément, j'essaie d'appliquer le Ridgemodèle scikit-learn au jeu de données «Hitters» du package R «ISLR». J'ai créé le même …

3
Simuler une excursion brownienne à l'aide d'un pont brownien?
Je voudrais simuler un processus d'excursion brownienne (un mouvement brownien conditionné est toujours positif quand à à ). Puisqu'un processus d'excursion brownienne est un pont brownien qui est conditionné pour être toujours positif, j'espérais simuler le mouvement d'une excursion brownienne en utilisant un pont brownien.0 t = 10 < t …

1
Valeur p globale et valeurs p par paire?
J'ai ajusté un modèle linéaire général dont la probabilité logarithmique est .L uy= β0+ β1X1+ β2X2+ β3X3,y=β0+β1X1+β2X2+β3X3,y=\beta_0+\beta_1x_1+\beta_2x_2+\beta_3x_3,LuLuL_u Maintenant, je souhaite tester si les coefficients sont les mêmes. Tout d'abord, test global : la probabilité logarithmique du modèle réduit est . Par test de rapport de vraisemblance, le modèle complet est …


2
Pourquoi le maximum de vraisemblance restreint donne-t-il une meilleure estimation (non biaisée) de la variance?
Je lis le document de théorie de Doug Bates sur le package lme4 de R pour mieux comprendre les moindres détails des modèles mixtes, et suis tombé sur un résultat intrigant que j'aimerais mieux comprendre, à propos de l'utilisation du maximum de vraisemblance restreint (REML) pour estimer la variance . …

1
Pour quel type de sélection de fonctionnalités le test du chi carré peut-il être utilisé?
Ici, je demande ce que les autres font couramment pour utiliser le test du chi carré pour la sélection des fonctionnalités par rapport au résultat de l'apprentissage supervisé. Si je comprends bien, testent-ils l'indépendance entre chaque fonctionnalité et le résultat, et comparent-ils les valeurs de p entre les tests pour …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.