Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Connaissez-vous une référence ou un nom pour la façon suivante de rechercher si une technique de modélisation complexe TTT est biaisé? Appliquez à l'ensemble de données d'origine. Mesurer ses performances (par exemple, R au carré dans le cadre de la régression).TTT Permutez au hasard la variable de réponse pour obtenir …
Supposons que nous ayons un test composé de 30 questions et que 10 personnes passent ce test. Le score moyen au test de ces 10 personnes est de 17, et l'écart-type de tous les scores de l'échantillon est de 4. Lorsque nous rapportons les statistiques descriptives à l'école, nous utilisons …
Mon problème est le suivant: j'ai un ensemble de prédicteurs qui produisent chacun une distribution sur un ensemble de classes. Ce que je voudrais faire, c'est d'abord avoir un préalable non informatif sur l'apparence de cette distribution d'étiquettes, puis le mettre à jour avec la prédiction de chaque membre de …
Dans tous les articles sur la forêt aléatoire (de régression) que j'ai lus, quand vient le temps de rassembler les prédictions de tous les arbres, nous prenons la valeur moyenne comme prédiction. Ma question est pourquoi faisons-nous cela? Existe-t-il une justification statistique pour prendre la moyenne? EDIT: Pour clarifier la …
Je comprends certains des nombreux problèmes de régression pas à pas. Cependant, en tant qu'entreprise universitaire, supposons que je souhaite utiliser la régression pas à pas pour un modèle prédictif et que je souhaite mieux comprendre les impacts qu'il peut avoir sur la performance. Étant donné un modèle linéaire, par …
Dans la plupart des cours de théorie des probabilités de base, vos fonctions de génération de moment (mgf) sont utiles pour calculer les moments d'une variable aléatoire. En particulier l'attente et la variance. Maintenant, dans la plupart des cours, les exemples qu'ils fournissent pour l'attente et la variance peuvent être …
Dans l' analyse économétrique de Jeff Wooldridge (2e édition), il dérive l'expression de l'estimateur de la différence dans la différence (DDD) à la page 151 pour le cas à deux périodes où l'État B met en œuvre un changement de politique de soins de santé destiné aux personnes âgées . …
On dit parfois que la régression quantile (QR) révèle des relations différentes entre les variables à différents quantiles de la distribution. Par exemple, Le Cook et al. «Penser au-delà de la moyenne: un guide pratique pour l'utilisation de méthodes de régression quantile pour la recherche sur les services de santé» …
Il s'agit d'une question concernant le test t dans SPSS. J'ai deux groupes et je veux tester si les deux moyennes sont égales. J'utilise le test t avec bootstrapping. En fin de compte, j'ai obtenu une valeur de p <0,005, ce qui me ferait généralement rejeter l'hypothèse nulle selon laquelle …
TL; DR (trop long, n'a pas lu): Je travaille sur un problème de prédiction de séries chronologiques, que je formule comme un problème de régression utilisant le Deep Learning (keras). Je veux optimiser la corrélation de Pearson entre ma prédiction et les vrais labels. Je suis confus par le fait …
Supposons que est un vecteur de variables aléatoires. Veuillez ensuite vérifier que .XXXk×1k×1k\times 1EX′(EXX′)−1EX≤1EX′(EXX′)−1EX≤1EX^{\prime}(EXX^{\prime})^{-1}EX\leq 1 Lorsque c'est un résultat bien connu que . Mais comment le revendiquer en général?K=1K=1K=1(EX)2≤EX2(EX)2≤EX2(EX)^{2}\leq EX^{2}
Mon problème de devoirs est de donner un contre-exemple où une certaine statistique n'est en général pas suffisamment minimale. Quels que soient les détails de la recherche d'un contre-exemple particulier pour cette statistique particulière, cela me pose la question suivante: Question: Comment peut-on formuler la condition de ne pas être …
J'examine actuellement certaines données produites par une simulation MC que j'ai écrite - je m'attends à ce que les valeurs soient normalement distribuées. Naturellement, j'ai tracé un histogramme et il semble raisonnable (je suppose?): [En haut à gauche: histogramme avec dist.pdf(), en haut à droite: histogramme cumulatif avec dist.cdf(), en …
Dans le "Guide du praticien des modèles linéaires généralisés" au paragraphe 1.83, il est indiqué que: "Dans le cas particulier d'un GLM multiplicatif de Poisson, il peut être démontré que la modélisation des comptes de sinistres avec un terme de décalage égal au log de l'exposition a produit des résultats …
Le lasso et le filet élastique ne sont pas en mesure de traiter des variables de plus de deux catégories et, par conséquent, une répartition des variables catégorielles en variables muettes est nécessaire pour l'application de ces méthodes. Cela peut entraîner plusieurs problèmes et il existe donc des extensions du …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.