Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai lu de la littérature que les forêts aléatoires ne peuvent pas saturer. Bien que cela semble génial, cela semble trop beau pour être vrai. Est-il possible pour les RF de sur-équiper?
Donc, si la statistique Chi Squared de Pearson est donnée pour une table , alors sa forme est:1×N1×N1 \times N ∑i=1n(Oi−Ei)2Ei∑i=1n(Oi−Ei)2Ei\sum_{i=1}^n\frac{(O_i - E_i)^2}{E_i} Ensuite, cela se rapproche de , la distribution du chi carré avec degrés de liberté, à mesure que la taille de l'échantillon augmente. χ2n−1χn−12\chi_{n-1}^2n−1n−1n-1NNN Ce que je …
J'ai écrit une fonction simple en Python pour calculer la moyenne pondérée exponentiellement: def test(): x = [1,2,3,4,5] alpha = 0.98 s_old = x[0] for i in range(1, len(x)): s = alpha * x[i] + (1- alpha) * s_old s_old = s return s Cependant, comment puis-je calculer le SD …
Toute la littérature sur la modélisation de la répartition des espèces suggère que lors de la prévision de la présence / absence d'une espèce à l'aide d'un modèle qui génère des probabilités (par exemple, RandomForests), le choix de la probabilité seuil par laquelle classer réellement une espèce comme présence ou …
Je comprends que si j'ai deux modèles A et B et A est imbriqué dans B, alors, compte tenu de certaines données, je peux ajuster les paramètres de A et B à l'aide de MLE et appliquer le test de rapport de vraisemblance logarithmique généralisé. En particulier, la distribution du …
L'ensachage est le processus de création de N apprenants sur N échantillons de bootstrap différents, puis de prise de la moyenne de leurs prédictions. Ma question est: pourquoi ne pas utiliser un autre type d'échantillonnage? Pourquoi utiliser des échantillons bootstrap?
Supposons que nous ayons un échantillon aléatoire d'une distribution normale bivariée qui a des zéros comme moyennes et des uns comme des variances, donc le seul paramètre inconnu est la covariance. Quel est le MLE de la covariance? Je sais que cela devrait être quelque chose comme mais comment savons-nous …
Lorsque vous effectuez une analyse d'intervention avec des données de série temporelle (aka série temporelle interrompue) comme discuté ici, par exemple, une exigence que j'ai est d'estimer le gain (ou la perte) total dû à l'intervention - c'est-à-dire le nombre d'unités gagnées ou perdues (la variable Y ). Ne comprenant …
J'ai du mal à comprendre comment varImpfonctionne la fonction pour un modèle randomForest avec le caretpackage. Dans l'exemple ci-dessous, la fonction var3 n'a aucune importance en utilisant la varImpfonction caret , mais le modèle final randomForest sous-jacent a une importance non nulle pour la fonction var3. pourquoi est-ce le cas? …
J'ai repensé une réponse que j'ai donnée à une question il y a quelques semaines La validation croisée hold-out produit un ensemble de tests unique qui peut être utilisé à plusieurs reprises pour la démonstration. Nous semblons tous convenir qu'il s'agit à bien des égards d'une caractéristique négative, car l'ensemble …
J'ai lu beaucoup de choses sur Dynamic Time Warping (DTW) récemment. Je suis très surpris qu'il n'y ait aucune littérature sur l'application du DTW aux séries chronologiques irrégulières, ou du moins je n'ai pas pu le trouver. Quelqu'un pourrait-il me donner une référence à quelque chose en rapport avec ce …
Donc, par exemple, voici les définitions que j'obtiens des manuels standard Variable - caractéristique de la population ou de l'échantillon. ex. Prix d'un stock ou d'une note sur un test Données - valeurs réelles observées Donc, pour un rapport à deux colonnes [Nom | Revenu] les noms des colonnes seraient …
Les distributions stables sont invariantes sous convolutions. Quelles sous-familles des distributions stables sont également fermées par multiplication? En ce sens que si et , alors la fonction de densité de probabilité du produit, (jusqu'à une constante de normalisation) appartient aussi à ?f ∈ F g ∈ F f ⋅ g …
Je travaille avec des données du monde réel et les modèles de régression donnent des résultats contre-intuitifs. Normalement, je fais confiance aux statistiques, mais en réalité, certaines de ces choses ne peuvent pas être vraies. Le principal problème que je vois est qu'une augmentation d'une variable entraîne une augmentation de …
Je suis relativement nouveau dans les statistiques et R. J'aimerais connaître le processus pour déterminer les paramètres ARIMA pour mon jeu de données. Pouvez-vous m'aider à comprendre la même chose en utilisant R et théoriquement (si possible)? La plage de données s'étend du 12 janvier au 14 mars et décrit …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.