Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Issu d'une formation rigoureuse en analyse et en théorie des probabilités moderne, je trouve les statistiques bayésiennes simples et faciles à comprendre, et les statistiques fréquentistes incroyablement déroutantes et peu intuitives. Il semble que les fréquentistes fassent vraiment des statistiques bayésiennes, sauf avec des "prieurs secrets" qui ne sont pas …
Je suis totalement nouveau dans les statistiques et le domaine des intervalles de confiance. Cela peut donc être très trivial ou même stupide. J'apprécierais si vous pouviez m'aider à comprendre ou me diriger vers de la littérature / du texte / un blog qui explique mieux cela. Je vois sur …
Je ne connais pas grand-chose aux statistiques, alors restez avec moi. Disons que j'ai un ensemble de 1000 travailleurs. Je veux savoir qui est le travailleur le plus acharné, mais je ne peux mesurer que la quantité de travail effectuée en groupes de 1 à 100 personnes sur une heure …
D'accord, j'essaie donc de comprendre la régression linéaire. J'ai un ensemble de données et tout semble assez bien, mais je suis confus. Voici mon modèle de résumé linéaire: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 0.2068621 0.0247002 8.375 4.13e-09 *** temp 0.0031074 0.0004779 6.502 4.79e-07 *** --- Signif. codes: …
Je veux comparer les taux d'incidence entre deux groupes (un sans maladie et un avec). Je prévoyais de calculer le taux d'incidence (IRR), c'est-à-dire le groupe de taux d'incidence B / groupe de taux d'incidence A, puis de tester si ce taux est égal à 1, et enfin de calculer …
Avec des données continues, une régression linéaire Y=β1+β2X2+uY=β1+β2X2+uY=\beta_1+\beta_2X_2+u suppose que le terme d'erreur est distribué N (0, σ2σ2\sigma^2 ) 1) Supposons-nous que Var (Y | x) est également ~ N (0, σ2σ2\sigma^2 )? 2) Quelle est cette distribution d'erreur dans la régression logistique? Lorsque les données sont sous la forme …
Lors de l'utilisation libsvm, le paramètre est un paramètre de la fonction noyau. Sa valeur par défaut est configurée comme γ = 1γγ\gammaγ= 1nombre de fonctionnalités.γ=1nombre de fonctionnalités.\gamma = \frac{1}{\text{number of features.}} Existe-t-il des directives théoriques pour la configuration de ce paramètre en plus des méthodes existantes, par exemple, la …
J'ai une table en trois dimensions de taille . Chaque cellule du tableau est un test d'hypothèse. Trancher le tableau sur la troisième dimension produit ensembles de tests d'hypothèse qui sont indépendants entre les ensembles mais dépendants au sein des ensembles. À l'origine, je pensais que je pouvais simplement contrôler …
L'attribution aléatoire est précieuse car elle garantit l'indépendance du traitement par rapport aux résultats potentiels. C'est ainsi que cela conduit à des estimations non biaisées de l'effet moyen du traitement. Mais d'autres schémas d'affectation peuvent également garantir systématiquement l'indépendance du traitement par rapport aux résultats potentiels. Alors pourquoi avons-nous besoin …
Quelle est la relation entre la ou les premières composantes principales et la corrélation moyenne dans la matrice de corrélation? Par exemple, dans une application empirique, j'observe que la corrélation moyenne est presque la même que le rapport de la variance de la première composante principale (première valeur propre) à …
J'utilise PROC GLM dans SAS pour ajuster une équation de régression de la forme suivante Oui= b0+ b1X1+ b2X2+ b3X3+ b4tOui=b0+b1X1+b2X2+b3X3+b4t Y = b_0 + b_1X_1 + b_2X_2 + b_3X_3 + b_4t Le tracé QQ des résidus rouges résultants indique un écart par rapport à la normalité. Toute transformation de …
La documentation indique que R gbm avec distribution = "adaboost" peut être utilisé pour un problème de classification 0-1. Considérez le fragment de code suivant: gbm_algorithm <- gbm(y ~ ., data = train_dataset, distribution = "adaboost", n.trees = 5000) gbm_predicted <- predict(gbm_algorithm, test_dataset, n.trees = 5000) Il peut être trouvé …
Supposons que j'ai un échantillon de fréquences de 4 événements possibles: Event1 - 5 E2 - 1 E3 - 0 E4 - 12 et j'ai les probabilités attendues que mes événements se produisent: p1 - 0.2 p2 - 0.1 p3 - 0.1 p4 - 0.6 Avec la somme des fréquences …
Petite question: pourquoi est-ce vrai ?? Longue question: Très simplement, j'essaie de comprendre ce qui justifie cette première équation. L'auteur du livre que je lis, (contexte ici si vous le souhaitez, mais pas nécessaire), affirme ce qui suit: En raison de l'hypothèse de quasi-gaussianité, nous pouvons écrire: p0(ξ)=Aϕ(ξ)exp(an+1ξ+(an+2+12)ξ2+∑i=1naiGi(ξ))p0(ξ)=Aϕ(ξ)exp(an+1ξ+(an+2+12)ξ2+∑i=1naiGi(ξ)) p_0(\xi) = …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.