Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je fais une régression en utilisant des forêts aléatoires pour prédire les prix en fonction de plusieurs attributs. Le code est écrit en Python à l'aide de Scikit-learn. Comment décidez-vous si vous devez transformer vos variables en utilisant exp/ logavant de l'utiliser pour l'adapter au modèle de régression? Est-il nécessaire …
J'espère que cette question ne sera pas marquée comme «trop générale» et j'espère qu'une discussion commencera qui bénéficiera à tous. En statistiques, nous passons beaucoup de temps à apprendre de grandes théories d'échantillonnage. Nous souhaitons vivement évaluer les propriétés asymptotiques de nos estimateurs, notamment s’ils sont asymptotiquement impartiaux, asymptotiquement efficaces, …
Éditer J'ai trouvé un document décrivant exactement la procédure dont j'ai besoin. La seule différence est que le papier interpole les données moyennes mensuelles au quotidien, tout en préservant les moyennes mensuelles. J'ai du mal à mettre en œuvre l'approche en R. Tous les indices sont appréciés. Original Pour chaque …
J'ai exécuté PCA sur 25 variables et sélectionné les 7 meilleurs PC utilisant prcomp. prc <- prcomp(pollutions, center=T, scale=T, retx=T) J'ai ensuite fait une rotation varimax sur ces composants. varimax7 <- varimax(prc$rotation[,1:7]) Et maintenant, je souhaite faire pivoter varimax les données pivotées par PCA (car elles ne font pas partie …
Si, dans les régressions OLS standard, deux hypothèses sont violées (distribution normale des erreurs, homoscédasticité), l'amorçage des erreurs standard et des intervalles de confiance est-il une alternative appropriée pour obtenir des résultats significatifs en ce qui concerne la signification des coefficients du régresseur? Les tests de signification avec des erreurs …
Le dictionnaire Merriam-Webster définit un événement ou une situation contingente comme 1 : likely but not certain to happen : possible 2 : not logically necessary; especially : empirical 3 a : happening by chance or unforeseen causes b : subject to chance or unseen effects : unpredictable c : …
Je suis nouveau dans la science des données et j'ai du mal à trouver des clusters dans un ensemble de données avec 200 000 lignes et 50 colonnes en R. Étant donné que les données ont des variables numériques et nominales, des méthodes comme K-means qui utilise la mesure de …
Question assez basique: Que signifie une distribution normale des résidus d'une régression linéaire? En termes de, comment cela se reflète-t-il sur mes données d'origine de la régression? Je suis totalement perplexe, merci les gars
Imaginez qu'il y ait 80 joueurs de ballon chasseur dans le monde. Chacun d'eux a joué des milliers de parties de ballon chasseur avec les 79 autres joueurs dans un ordre plus ou moins aléatoire. C'est un monde sans équipes (par exemple, chaque joueur a une chance d'être repêché dans …
Voici mon contexte pour cette question: D'après ce que je peux dire, nous ne pouvons pas exécuter une régression ordinaire des moindres carrés dans R lors de l'utilisation de données pondérées et du surveypackage. Ici, nous devons utiliser svyglm(), qui exécute à la place un modèle linéaire généralisé (qui peut …
Selon l'article de Wikipedia sur la distribution Gamma : Si et Y ∼ G a m m a ( b , θ ) , où X et Y sont des variables aléatoires indépendantes, alors X + Y ∼ G a m m a ( a + b , θ ) …
Est-il "correct" d'ajouter une ligne verticale à un histogramme pour visualiser la valeur moyenne? Cela me semble bien, mais je n'ai jamais vu cela dans les manuels et autres, alors je me demande s'il y a une sorte de convention pour ne pas faire ça? Le graphique est pour un …
Mes prédictions provenant d'un modèle de régression logistique (glm dans R) ne sont pas limitées entre 0 et 1 comme je m'y attendais. Ma compréhension de la régression logistique est que vos paramètres d'entrée et de modèle sont combinés linéairement et la réponse est transformée en probabilité à l'aide de …
Je suis très nouveau dans ce domaine et j'ai du mal à comprendre le concept de rejet de l'hypothèse nulle sur la base des résultats de la table ANOVA. Comment le F calculé et la valeur critique sont-ils liés à la valeur de p? Et si le F calculé est …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.