Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
1. Le problème J'ai des mesures d'une variable ytyty_t , où t=1,2,..,nt=1,2,..,nt=1,2,..,n , pour lequel j'ai une distribution obtenue via MCMC, qui pour simplifier je suppose que c'est un gaussien de moyenne et de variance .fyt(yt)fyt(yt)f_{y_t}(y_t)μtμt\mu_tσ2tσt2\sigma_t^2 J'ai un modèle physique pour ces observations, disons , mais les résidus semblent être …
Je n'ai aucune formation en mathématiques, mais je comprends comment fonctionne le simple Perceptron et je pense que je saisis le concept d'un hyperplan (je l'imagine géométriquement comme un avion dans l'espace 3D qui sépare deux nuages de points, tout comme une ligne sépare deux nuages de points dans l'espace …
Lors de la validation croisée de k-fold, je comprends que vous obtenez les mesures de précision en pointant tous les plis sauf un sur ce pli et faites des prédictions, puis répétez ce processus fois. Vous pouvez ensuite exécuter des métriques d'exactitude sur toutes vos instances (précision, rappel,% correctement classées), …
Disons que vous avez un ensemble de valeurs et que vous voulez savoir s'il est plus probable qu'elles aient été échantillonnées à partir d'une distribution gaussienne (normale) ou échantillonnées à partir d'une distribution lognormale? Bien sûr, idéalement, vous devriez savoir quelque chose sur la population ou sur les sources d'erreur …
Je veux tester la corrélation d'un échantillon pour la signification, en utilisant des valeurs de p, c'est-à-direrrr H0:ρ=0,H1:ρ≠0.H0:ρ=0,H1:ρ≠0.H_0: \rho = 0, \; H_1: \rho \neq 0. J'ai compris que je peux utiliser la transformée en z de Fisher pour calculer cela en zobs=n−3−−−−−√2ln(1+r1−r)zobs=n−32ln(1+r1−r)z_{obs}= \displaystyle\frac{\sqrt{n-3}}{2}\ln\left(\displaystyle\frac{1+r}{1-r}\right) et trouver la valeur de p …
Je connais relativement bien la distinction entre les termes statistique et paramètre. Je vois une statistique comme la valeur obtenue en appliquant une fonction aux données d'échantillon. Cependant, la plupart des exemples de paramètres concernent la définition d'une distribution paramétrique. Un exemple courant est la moyenne et l'écart type pour …
J'utilise un modèle de régression logistique sous la forme: lmer(response~1+(1|site), family=binomial, REML = FALSE) Normalement, je calculerais l'ICC à partir des variances d'interception et résiduelles, mais le résumé du modèle n'inclut pas la variance résiduelle. Comment puis-je calculer cela?
Pour les données distribuées approximativement normalement, les boîtes à moustaches sont un excellent moyen de visualiser rapidement la médiane et la répartition des données, ainsi que la présence de valeurs aberrantes. Cependant, pour les distributions plus lourdes, de nombreux points sont indiqués comme des valeurs aberrantes, car les valeurs aberrantes …
J'ai un ensemble de valeurs xxx et yyy qui sont théoriquement liées de façon exponentielle: y=axby=axby = ax^b Une façon d'obtenir les coefficients consiste à appliquer des logarithmes naturels des deux côtés et à ajuster un modèle linéaire: > fit <- lm(log(y)~log(x)) > a <- exp(fit$coefficients[1]) > b <- fit$coefficients[2] …
Supposons que j'ai un partage 80/20 entre les observations de modélisation / validation. J'ai ajusté un modèle à l'ensemble de données de modélisation et je suis à l'aise avec l'erreur que je vois sur l'ensemble de données de validation. Avant de déployer mon modèle pour noter les observations futures, est-il …
J'ai donc entendu dire que ce n'était pas une bonne idée de choisir un test statistique en fonction des résultats d'un autre. Cela me semble cependant étrange. Par exemple, les gens choisissent souvent d'utiliser un test non paramétrique lorsqu'un autre test suggère que les résidus ne sont pas normalement distribués. …
J'essaie de comprendre comment fonctionne Random Forest. J'ai une compréhension de la façon dont les arbres sont construits, mais je ne comprends pas comment Random Forest fait des prédictions sur l'échantillon hors du sac. Quelqu'un pourrait-il me donner une explication simple, s'il vous plaît? :)
J'utilise package R lavaan pour estimer un modèle d'équation structurelle. Disons que le modèle se compose de 1 variable manifeste endogène avec 1 variable explicative latente et 2 variables explicites manifestes: group = {0,1} attitude1 = latent,scale age = respondent's age Le modèle de lave souhaité est alors (ne fonctionne …
J'ai un ensemble de données longitudinales d'individus et certains d'entre eux ont été soumis à un traitement et d'autres non. Tous les individus sont inclus dans l'échantillon de la naissance jusqu'à l'âge de 18 ans et le traitement a lieu à un âge compris entre cette plage. L'âge du traitement …
La normalisation d'une variable dépendante au sein du groupe d'identification est-elle logique? Le document de travail suivant (Ralentissement de la déforestation en Amazonie légale; prix ou politiques?, Pdf ) utilise une variable dépendante standardisée pour analyser l'effet du changement de politique générale au Brésil sur la déforestation. La normalisation se …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.