Le package de traçage R ggplot2 a une fonction impressionnante appelée stat_smooth pour tracer une ligne (ou courbe) de régression avec la bande de confiance associée. Cependant, j'ai du mal à comprendre exactement comment cette bande de confiance est générée, à chaque fois que la ligne de régression (ou "méthode"). …
J'essaie d'utiliser la régression aléatoire des forêts dans scikits-learn. Le problème est que j'obtiens une erreur de test très élevée: train MSE, 4.64, test MSE: 252.25. Voici à quoi ressemblent mes données: (bleu: données réelles, vert: prévu): J'utilise 90% pour la formation et 10% pour le test. Voici le code …
Récemment, un client est venu me voir pour faire une analyse bootstrap parce qu'un examinateur de la FDA a dit que la régression des erreurs dans les variables n'était pas valide car lors de la mise en commun des données des sites, l'analyse inclut la mise en commun des données …
Existe-t-il une procédure standard (telle que l'on pourrait la citer comme référence) pour sélectionner le sous-ensemble de points de données dans un pool plus large avec la corrélation la plus forte (le long de deux dimensions seulement)? Par exemple, supposons que vous ayez 100 points de données. Vous voulez un …
Je pense aux formules ajustées au R proposées par: Ezekiel (1930), qui je crois est celui actuellement utilisé dans SPSS. R2adjusted=1−(N−1)(N−p−1)(1−R2)Runeréjusteré2=1-(N-1)(N-p-1)(1-R2)R^2_{\rm adjusted} = 1 - \frac{(N-1)}{(N-p-1)} (1-R^2) Olkin et Pratt (1958) R2unbiased=1−(N−3)(1−R2)(N−p−1)−2(N−3)(1−R2)2(N−p−1)(N−p+1)Runbiased2=1−(N−3)(1−R2)(N−p−1)−2(N−3)(1−R2)2(N−p−1)(N−p+1)R^2_{\rm unbiased} = 1 - \frac{(N-3)(1-R^2)}{(N-p-1)} - \frac{2(N-3)(1-R^2)^2}{(N-p-1)(N-p+1)} Dans quelles circonstances (le cas échéant) devrais-je préférer «ajusté» à «impartial» …
Je travaille avec un ensemble de données ayant N environ 200 000. Dans les régressions, je vois des valeurs de signification très faibles << 0,001 associées à de très petites tailles d'effet, par exemple r = 0,028. Ce que j'aimerais savoir, est-ce qu'il existe un moyen de principe de décider …
Y a-t-il une raison de ce à quoi je peux penser, pour transformer les données avec une racine carrée? Je veux dire que ce que j'observe toujours, c'est que le R ^ 2 augmente. Mais c'est probablement juste à cause du centrage des données! Toute pensée est appréciée!
J'ai posé cette question sur le site matemathics stackexchange et on m'a recommandé de la poser ici. Je travaille sur un projet de passe-temps et j'aurais besoin d'aide pour résoudre le problème suivant. Un peu de contexte Disons qu'il existe une collection d'articles avec une description des fonctionnalités et un …
Étant donné deux tableaux x et y, tous deux de longueur n, j'adapte un modèle y = a + b * x et je veux calculer un intervalle de confiance à 95% pour la pente. C'est (b - delta, b + delta) où b se trouve de la manière habituelle …
Il y a quelque temps, un utilisateur de la liste de diffusion R-help a posé des questions sur la validité de l'utilisation des scores PCA dans une régression. L'utilisateur essaie d'utiliser des scores PC pour expliquer les variations sur un autre PC (voir la discussion complète ici ). La réponse …
Ma question est très simple: pourquoi nous choisissons la distribution normale comme terme d'erreur dans l'hypothèse d'une régression linéaire? Pourquoi nous n'en choisissons pas d'autres comme l'uniforme, le t ou quoi?
En régression linéaire, nous faisons les hypothèses suivantes La moyenne de la réponse, , à chaque ensemble de valeurs des prédicteurs, , est une fonction linéaire des prédicteurs.E(Yi)E(Yi)E(Y_i)(x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) Les erreurs, εiεiε_i , sont indépendantes. Les erreurs, εiεiε_i , à chaque ensemble de valeurs des prédicteurs, (x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) , sont …
J'ai lu les livres les plus populaires en apprentissage statistique 1- Les éléments de l'apprentissage statistique. 2- Une introduction à l'apprentissage statistique . Les deux mentionnent que la régression de crête a deux formules qui sont équivalentes. Existe-t-il une preuve mathématique compréhensible de ce résultat? Je suis également passé par …
Je n'ai pas trouvé de réponse satisfaisante à cela de Google . Bien sûr, si les données dont je dispose sont de l'ordre de millions, l'apprentissage en profondeur est la solution. Et j'ai lu que lorsque je n'ai pas de données volumineuses, il est peut-être préférable d'utiliser d'autres méthodes d'apprentissage …
Question: Quelles sont les principales différences et similitudes entre l'utilisation des erreurs types de Newey-West (1987) et de Hansen-Hodrick (1980)? Dans quelles situations faut-il privilégier l’un d’eux? Remarques: Je sais comment fonctionne chacune de ces procédures d'ajustement; cependant, je n'ai pas encore trouvé de document qui les comparerait, en ligne …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.