Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données




1
Régression logistique pour les données des distributions de Poisson
À partir de quelques notes d'apprentissage automatique parlant de certaines méthodes de classification discriminantes, en particulier la régression logistique, où y est l'étiquette de classe (0 ou 1) et x les données, il est dit que: si x|y=0∼Poisson(λ0)x|y=0∼Poisson(λ0)x|y = 0 \sim \mathrm{Poisson}(λ_0) , et x|y=1∼Poisson(λ1)x|y=1∼Poisson(λ1)x|y = 1 \sim \mathrm{Poisson}(λ_1) , …


2
Comment commencer à construire un modèle de régression lorsque le prédicteur le plus fortement associé est binaire
J'ai un ensemble de données contenant 365 observations de trois variables à savoir pm, tempet rain. Maintenant, je veux vérifier le comportement de la pmréponse aux changements dans les deux autres variables. Mes variables sont: pm10 = Réponse (dépendante) temp = prédicteur (indépendant) rain = prédicteur (indépendant) Voici la matrice …


3
Contre-exemples où la médiane est en dehors [Mode-Mean]
Cet article est au-dessus de ma ligue mais il parle d'un sujet qui m'intéresse, la relation entre la moyenne, le mode et la médiane. Ça dit : Il est largement admis que la médiane d'une distribution unimodale se situe «habituellement» entre la moyenne et le mode. Cependant, ceci n'est pas …
11 mean  median  mode 






3
Fiabilité d'une courbe ajustée?
Je voudrais estimer l'incertitude ou la fiabilité d'une courbe ajustée. Je ne nomme pas intentionnellement une quantité mathématique précise que je recherche, car je ne sais pas ce que c'est. Ici, (énergie) est la variable dépendante (réponse) et (volume) est la variable indépendante. Je voudrais trouver la courbe énergie-volume, , …

1
Pourquoi un grand choix de K réduit-il mon score de validation croisée?
En jouant avec le Boston Housing Dataset et RandomForestRegressor(avec les paramètres par défaut) dans scikit-learn, j'ai remarqué quelque chose d'étrange: le score moyen de validation croisée a diminué lorsque j'ai augmenté le nombre de plis au-delà de 10. Ma stratégie de validation croisée était la suivante: cv_met = ShuffleSplit(n_splits=k, test_size=1/k) …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.