Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Plusieurs filtres dans une couche convolutionnelle n'apprendraient-ils pas le même paramètre pendant l'entraînement?
D'après ce que j'ai appris, nous utilisons plusieurs filtres dans une couche Conv d'un CNN pour apprendre différents détecteurs de fonctionnalités. Mais puisque ces filtres sont appliqués de la même manière (c'est-à-dire glissés et multipliés aux régions de l'entrée), n'apprendraient-ils pas simplement les mêmes paramètres pendant l'entraînement? Par conséquent, l'utilisation …


1
Comment calculer les scores de confiance en régression (avec forêts aléatoires / XGBoost) pour chaque prédiction dans R?
Existe-t-il un moyen d'obtenir un score de confiance (on peut également l'appeler valeur de confiance ou probabilité) pour chaque valeur prédite lors de l'utilisation d'algorithmes comme Random Forests ou Extreme Gradient Boosting (XGBoost)? Supposons que ce score de confiance varie de 0 à 1 et montre à quel point je …



2
Test de Kolmogorov – Smirnov: la valeur p et la statistique du test ks diminuent à mesure que la taille de l'échantillon augmente
Pourquoi les valeurs de p et les statistiques du test ks diminuent avec l'augmentation de la taille de l'échantillon? Prenez ce code Python comme exemple: import numpy as np from scipy.stats import norm, ks_2samp np.random.seed(0) for n in [10, 100, 1000, 10000, 100000, 1000000]: x = norm(0, 4).rvs(n) y = …

2
Avantages et inconvénients du bootstrapping
Je viens d'apprendre le concept de bootstrap, et une question naïve m'est venue à l'esprit: si nous pouvons toujours générer de nombreux échantillons bootstrap de nos données, pourquoi se donner la peine d'obtenir davantage de données "réelles"? Je pense avoir une explication, dites-moi si j'ai raison: je pense que le …



1
Dois-je choisir un régresseur ou un classificateur Random Forest?
J'adapte un ensemble de données avec une classe cible binaire par la forêt aléatoire. En python, je peux le faire soit par randomforestclassifier ou randomforestregressor. Je peux obtenir la classification directement à partir de randomforestclassifier ou je pourrais d'abord exécuter randomforestregressor et récupérer un ensemble de scores estimés (valeur continue). …

3
Pourquoi l'estimateur OLS du coefficient AR (1) est-il biaisé?
J'essaie de comprendre pourquoi OLS donne un estimateur biaisé d'un processus AR (1). Considérez Dans ce modèle, l'exogénéité stricte est violée, c'est-à-dire que et sont corrélés mais et sont pas corrélés. Mais si cela est vrai, pourquoi la dérivation simple suivante ne tient-elle pas? ytεtyt-1εtplim βytϵt=α+βyt−1+ϵt,∼iidN(0,1).yt=α+βyt−1+ϵt,ϵt∼iidN(0,1). \begin{aligned} y_{t} &= \alpha …

3
Utilisez Holt-Winters ou ARIMA?
Ma question porte sur la différence conceptuelle entre Holt-Winters et ARIMA. Autant que je sache, Holt-Winters est un cas particulier d'ARIMA. Mais quand un algorithme est-il préféré à l'autre? Peut-être que Holt-Winters est incrémental et sert donc d'algorithme en ligne (plus rapide)? Dans l'attente de quelques informations ici.




En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.