Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Les éléments suivants sont similaires mais différents des articles précédents ici et ici Étant donné deux distributions qui admettent des moments de tous les ordres, si tous les moments de deux distributions sont les mêmes, sont-elles alors des distributions identiques ae? Étant donné deux distributions qui admettent des fonctions de …
Je n'ai pas l'habitude d'utiliser des variables au format de date dans R. Je me demande simplement s'il est possible d'ajouter une variable de date comme variable explicative dans un modèle de régression linéaire. Si c'est possible, comment interpréter le coefficient? Est-ce l'effet d'un jour sur la variable de résultat? …
J'essaie d'avoir de l'intuition pour chacune des principales fonctions de la science actuarielle (en particulier pour le modèle des risques proportionnels de Cox). Voici ce que j'ai jusqu'à présent: f(x)f(x)f(x) : à partir de l'heure de début, la distribution de probabilité de votre décès. F(x)F(x)F(x) : juste la distribution cumulative. …
J'espère que vous pourrez me faire quelques suggestions. J'enseigne dans un collège très diversifié (composé de groupes minoritaires) et les étudiants sont principalement des majors en psychologie. La plupart des élèves sont fraîchement sortis du secondaire, mais certains d'entre eux sont des élèves de retour plus âgés de plus de …
J'ai une trame de données qui contient deux séries chronologiques: les dates et les numéros de version des versions d'Emacs et de Firefox. En utilisant une commande ggplot2, il est facile de créer un graphique qui utilise le loess (d'une manière qui semble un peu amusante, ce qui ne me …
Je suis actuellement en train de faire une présentation par affiche et j'aimerais avoir des conseils (ou des références à des conseils) sur certains aspects du graphique. Pour des exemples d'affiches dont je parle, voir le matériel supplémentaire pour les articles ASA Data Expo dans le volume 20, numéro 2 …
J'ai utilisé LDA sur un corpus de documents et trouvé quelques sujets. La sortie de mon code est deux matrices contenant des probabilités; l'une des probabilités doc-topic et l'autre probabilités word-topic. Mais je ne sais pas comment utiliser ces résultats pour prédire le sujet d'un nouveau document. J'utilise l'échantillonnage Gibbs. …
Il existe de nombreux articles de blog, vidéos YouTube, etc. sur les idées d' ensachage ou de renforcement des arbres. Ma compréhension générale est que le pseudo-code pour chacun est: Ensachage: Prélever N échantillons aléatoires de x% des échantillons et y% des fonctionnalités Ajustez votre modèle (par exemple, arbre de …
J'essaie de comprendre comment je peux obtenir l'importance des fonctionnalités d'une variable catégorielle qui a été décomposée en variables fictives. J'utilise scikit-learn qui ne gère pas les variables catégorielles pour vous comme le font R ou H2O. Si je décompose une variable catégorielle en variables fictives, j'obtiens des importances de …
Je ne comprends pas exactement quelle est la différence entre les prévisions "dans l'échantillon" et "hors échantillon"? Une prévision dans l'échantillon utilise un sous - ensemble des données disponibles pour prévoir des valeurs en dehors de la période d'estimation. Une prévision hors échantillon utilise à la place toutes les données …
J'essaie de comprendre la sortie de la fonction de test de Kolmogorov-Smirnov (deux échantillons, deux côtés). Voici un test simple. x <- c(1,2,2,3,3,3,3,4,5,6) y <- c(2,3,4,5,5,6,6,6,6,7) z <- c(12,13,14,15,15,16,16,16,16,17) ks.test(x,y) # Two-sample Kolmogorov-Smirnov test # #data: x and y #D = 0.5, p-value = 0.1641 #alternative hypothesis: two-sided # #Warning …
La question J'ai du mal à comprendre comment la prédiction est maintenue dans l' intervalle lorsque je fais une classification binaire avec Gradient Boosting.[0,1][0,1][0,1] Supposons que nous travaillons sur un problème de classification binaire, et notre fonction objective est la perte de log, , où est la variable cible et …
Supposons que j'ai une variable comme Xavec une distribution inconnue. Dans Mathematica, en utilisant la SmoothKernelDensityfonction, nous pouvons avoir une fonction de densité estimée. Cette fonction de densité estimée peut être utilisée avec la PDFfonction pour calculer la fonction de densité de probabilité d'une valeur comme Xsous la forme de …
Les forêts aléatoires (RF) sont une méthode compétitive de modélisation / extraction de données. Un modèle RF a une sortie - la variable sortie / prédiction. L'approche naïve de la modélisation de plusieurs sorties avec des RF serait de construire une RF pour chaque variable de sortie. Nous avons donc …
Lorsque vous faites un GLM et que vous obtenez l'erreur "non défini en raison des singularités" dans la sortie anova, comment peut-on contrer cette erreur? Certains ont suggéré que cela est dû à la colinéarité entre les covariables ou que l'un des niveaux n'est pas présent dans l'ensemble de données …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.