Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je travaille sur la mesure d'importance de la fonctionnalité Gini pour la forêt aléatoire. Par conséquent, je dois calculer la diminution de Gini de l'impureté du nœud. Voici la façon dont je le fais, ce qui conduit à un conflit avec la définition, suggérant que je dois me tromper quelque …
En particulier, je me demande pourquoi nous avons ce concept Multiple R (que je peux comprendre comme la corrélation entre les scores observés et prédits dans la régression multiple), puis un concept séparé R au carré qui est juste le carré ou R. J'ai été informé que le R au …
J'ai essayé de calculer l'AIC d'une régression linéaire dans R mais sans utiliser la AICfonction, comme ceci: lm_mtcars <- lm(mpg ~ drat, mtcars) nrow(mtcars)*(log((sum(lm_mtcars$residuals^2)/nrow(mtcars))))+(length(lm_mtcars$coefficients)*2) [1] 97.98786 Cependant, AICdonne une valeur différente: AIC(lm_mtcars) [1] 190.7999 Quelqu'un pourrait-il me dire ce que je fais mal?
Ainsi, dans la modélisation de texte (non supervisée), l'allocation de Dirichlet latent (LDA) est une version bayésienne de l'analyse sémantique probabiliste latente (PLSA). Essentiellement, LDA = PLSA + Dirichlet prioritaire sur ses paramètres. Ma compréhension est que LDA est maintenant l'algorithme de référence et est implémenté dans divers packages, tandis …
J'ai réalisé une forte relation linéaire entre ma variable et après avoir doublement transformé la réponse. Le modèle était mais je l'ai transformé en améliorant de 0,19 à 0,76.XXXYYYY∼XY∼XY\sim XYX−−√∼X−−√YX∼X\sqrt{\frac{Y}{X}}\sim \sqrt{X}R2R2R^2 De toute évidence, j'ai fait une chirurgie décente sur cette relation. Quelqu'un peut-il discuter des écueils de cette démarche, …
Certains bayésiens attaquent l'inférence fréquentiste en déclarant qu '"il n'y a pas de distribution d'échantillonnage unique" car cela dépend des intentions du chercheur (Kruschke, Aguinis et Joo, 2012, p. 733). Par exemple, disons qu'un chercheur commence la collecte de données, mais son financement a été inopinément réduit après 40 participants. …
Je travaille sur une série chronologique dont les valeurs sont strictement positives . En travaillant avec différents modèles, notamment AR, MA, ARMA, etc., je n'ai pas pu trouver de moyen simple d'obtenir des prévisions strictement positives. J'utilise R pour faire mes prévisions, et tout ce que j'ai pu trouver était …
Les tests de permutation (également appelés test de randomisation, test de re-randomisation ou test exact) sont très utiles et s'avèrent utiles lorsque l'hypothèse de distribution normale requise par exemple t-testn'est pas remplie et lorsque la transformation des valeurs par classement des un test non paramétrique comme Mann-Whitney-U-testcela entraînerait la perte …
J'essaie de comprendre comment les paramètres sont estimés dans la modélisation ARIMA / Box Jenkins (BJ). Malheureusement, aucun des livres que j'ai rencontrés ne décrit en détail la procédure d'estimation telle que la procédure d'estimation de log-vraisemblance. J'ai trouvé le site Web / matériel pédagogique très utile. Voici l'équation de …
C'est une question très fondamentale. Pourquoi utilisons-nous une distribution chi carré? Quelle est la signification de cette distribution? Pourquoi cette distribution est-elle utilisée pour créer un intervalle de confiance pour la variance? Chaque endroit où je cherche une explication sur google présente ce fait, expliquant quand utiliser le chi, mais …
J'ai quelques données (158 cas) qui ont été dérivées d'une réponse d'échelle de Likert à 21 éléments de questionnaire. Je veux / dois vraiment effectuer une analyse de régression pour voir quels éléments du questionnaire prédisent la réponse à un élément global (satisfaction). Les réponses ne sont pas normalement distribuées …
J'essaie de comprendre la logique de séparation d dans les réseaux bayésiens causaux. Je sais comment fonctionne l'algorithme, mais je ne comprends pas exactement pourquoi le "flux d'informations" fonctionne comme indiqué dans l'algorithme. Par exemple dans le graphique ci-dessus, supposons que l'on ne nous donne que X et qu'aucune autre …
Quelqu'un peut-il m'aider à comprendre la formule de corrélation de Pearson? l'échantillon = la moyenne des scores produits des types de variables et .rrrXXXOuiOuiY Je comprends en quelque sorte pourquoi ils doivent normaliser et , mais comment comprendre les produits des deux scores z? XXXOuiOuiY Cette formule est également appelée …
Supposons que et ont un second moment fini. Dans l'espace de Hilbert de variables aléatoires de second moment fini (avec le produit interne de défini par , ), nous pouvons interpréter comme la projection de sur l'espace des fonctions de .XXXYYYT1,T2T1,T2T_1,T_2E(T1T2)E(T1T2)E(T_1T_2)||T||2=E(T2)||T||2=E(T2)||T||^2=E(T^2)E(Y|X)E(Y|X)E(Y|X)OuiOuiYXXX Nous savons également que la loi de la variance …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.