Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

4
Quelle est la manière la plus appropriée de créer un ensemble d'exclusion: supprimer certains sujets ou supprimer certaines observations de chaque sujet?
J'ai un ensemble de données avec 26 fonctionnalités et 31000 lignes. C'est l'ensemble de données de 38 sujets. C'est pour un système biométrique. Je veux donc pouvoir identifier les sujets. Afin d'avoir un ensemble de tests, je sais que je dois supprimer certaines valeurs. Alors, que vaut-il mieux faire et …


3
Quels sont les avantages d'un générateur exponentiel aléatoire utilisant la méthode d'Ahrens et Dieter (1972) plutôt que par transformée inverse?
Ma question est inspirée du générateur exponentiel de nombres aléatoires intégré de R , la fonction rexp(). Lorsque vous essayez de générer des nombres aléatoires distribués de façon exponentielle, de nombreux manuels recommandent la méthode de transformation inverse, comme indiqué dans cette page Wikipedia . Je suis conscient qu'il existe …

1
Sélection du modèle Mclust
Le package R mclustutilise BIC comme critère de sélection de modèle de cluster. D'après ma compréhension, un modèle avec le BIC le plus bas devrait être sélectionné par rapport aux autres modèles (si vous ne vous souciez que du BIC). Cependant, lorsque les valeurs BIC sont toutes négatives, la Mclustfonction …





2
La régression linéaire multiple en 3 dimensions est-elle un plan de meilleur ajustement ou une ligne de meilleur ajustement?
Notre prof ne se lance pas dans les mathématiques ou même la représentation géométrique de la régression linéaire multiple et cela m'a légèrement confus. D'une part, il est toujours appelé régression linéaire multiple , même dans des dimensions plus élevées. D'un autre côté, si nous avons par exemple et que …


1
Comment interpréter les résultats du modèle TBATS et les diagnostics du modèle
J'ai une demi-heure de données sur la demande, qui est une série chronologique multi-saisonnière. J'ai utilisé tbatsdans le forecastpackage en R, et obtenu des résultats comme celui-ci: TBATS(1, {5,4}, 0.838, {<48,6>, <336,6>, <17520,5>}) Cela signifie-t-il que la série ne doit pas nécessairement utiliser la transformation de Box-Cox et que le …

2
techniques d'apprentissage automatique pour les données longitudinales
Je me demandais s'il y avait des techniques d'apprentissage automatique (non supervisées) pour modéliser des données longitudinales? J'ai toujours utilisé des modèles d'effets mixtes (principalement non linéaires) mais je me demandais s'il y avait d'autres façons de le faire (en utilisant l'apprentissage automatique). Par apprentissage automatique, je veux dire forêt …



2
Les réseaux résiduels sont-ils liés à l'augmentation du gradient?
Récemment, nous avons vu l'émergence du réseau neuronal résiduel, dans lequel, chaque couche se compose d'un module de calcul et d'une connexion de raccourci qui préserve l'entrée de la couche telle que la sortie de la ième couche présente: Le réseau permet d'extraire les caractéristiques résiduelles et permet une profondeur …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.