Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Taille de l'échantillon et méthodes de validation croisée pour les modèles prédictifs de régression de Cox
J'ai une question que je voudrais poser à la communauté. On m'a récemment demandé de fournir une analyse statistique pour une étude pronostique des marqueurs tumoraux . J'ai principalement utilisé ces deux références pour guider mon analyse: McShane LM et al. Rapports de recommandations pour les études pronostiques des marqueurs …


5
Pourquoi un modèle de régression linéaire à interception nulle prédit-il mieux qu'un modèle avec interception?
De nombreux manuels et articles ont déclaré que l'interception ne devait pas être supprimée. Récemment, j'ai utilisé un ensemble de données d'apprentissage pour construire un modèle de régression linéaire avec ou sans interception. J'ai été surpris de constater que le modèle sans interception prédit mieux que celui avec une interception …


1
Biais de régression Softmax et probabilités a priori pour des classes inégales
J'utilise la régression Softmax pour un problème de classification multi-classes. Je n'ai pas de probabilités antérieures égales pour chacune des classes. Je sais par régression logistique (régression softmax avec 2 classes) que les probabilités antérieures des classes sont implicitement ajoutées au biais ( ).log(p0/p1)log⁡(p0/p1)\log(p_0/p_1) Habituellement, ce que je fais est …

2
Bon livre de référence pour l'épidémiologie
Je recherche un bon ouvrage de référence en épidémiologie. J'ai Rothman's Epidemiology: An introduction et Porta's A Dictionary of Epidemiology . Rothman était une grosse déception car il est très simpliste et manque de tout ce qui est au-delà de l'évidence après les études de base. J'ai entendu dire que …

3
Comment les classifications sont-elles fusionnées dans un classificateur d'ensemble?
Comment un classificateur d'ensemble fusionne-t-il les prédictions de ses classificateurs constituants? J'ai du mal à trouver une description claire. Dans certains exemples de code que j'ai trouvés, l'ensemble fait simplement la moyenne des prédictions, mais je ne vois pas comment cela pourrait rendre possible une "meilleure" précision globale. Considérez le …

3
Distance métrique et malédiction des dimensions
Certains où j'ai lu une note que si vous avez beaucoup de paramètres et que vous essayez de trouver une "métrique de similitude" entre ces vecteurs, vous pouvez avoir une "malédiction de dimensioalité". Je crois que cela signifiait que la plupart des scores de similitude seront égaux et ne vous …

1
Variation technique par rapport au signal réel
Je teste la différence dans un résultat continu sous trois conditions différentes. Sous condition, l'IA mesure le résultat. Je le fais deux fois pour le même échantillon. Des exemples de valeurs pourraient être 2.2, 2.1. Ce sont des répliques "techniques" qui proviennent de la même source biologique Je fais de …
8 r  regression  anova 


2
Une mesure fiable de la similitude des séries - la corrélation ne suffit pas pour moi
J'essaie de déterminer une méthode pour comparer une série chronologique particulière à environ 10 000+ séries chronologiques de référence par programme, et de présélectionner ces séries chronologiques de référence qui peuvent être intéressantes. La méthode que j'utilisais était la corrélation de Pearson . Pour chacune des séries chronologiques de référence, …


3
Modèles longitudinaux en R et WINBUGS ou JAGS
J'ai essayé d'utiliser R pour s'adapter à certains modèles longitudinaux, principalement via lmeret nlmepackages. Cependant, il semble que de nombreux modèles standard font défaut, tels que les modèles d'antidépendance ou les modèles analytiques factoriels pour les matrices de covariance. Ces modèles sont facilement disponibles dans SAS. Quelqu'un recommanderait-il d'autres packages …
8 r  jags  panel-data 

1
Un nom pour cette condition de distribution?
J'ai rencontré une condition nécessaire sur une distribution de probabilité continue définie sur et je me demande si elle a un nom. Pour une distribution avec CDF et pdf j'ai besoin que la quantité: soit monotone non croissante. En mettant la condition sous une autre forme (en prenant des dérivées), …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.