Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai un ensemble de données de séries chronologiques multivariées comprenant des variables biologiques et environnementales en interaction (plus éventuellement des variables exogènes). Outre la saisonnalité, il n'y a pas de tendance claire à long terme dans les données. Mon but est de voir quelles variables sont liées les unes aux …
Cette question donne une définition quantitative de l'entropie croisée, en termes de formule. Je cherche une définition plus théorique, wikipedia dit: En théorie de l'information, l'entropie croisée entre deux distributions de probabilité mesure le nombre moyen de bits nécessaires pour identifier un événement à partir d'un ensemble de possibilités, si …
Je voudrais faire correspondre les sorties de lmer (vraiment glmer) avec un exemple binomial jouet. J'ai lu les vignettes et je crois comprendre ce qui se passe. Mais apparemment non. Après être resté coincé, j'ai corrigé la "vérité" en termes d'effets aléatoires et je suis allé après l'estimation des effets …
Pour que le CLT se vérifie, nous avons besoin que la distribution que nous souhaitons approximer ait une moyenne et une variance finie σ 2 . Serait-il vrai de dire que pour le cas de la distribution de Cauchy, dont la moyenne et la variance ne sont pas définies, le …
Dans Libre Office Calc, la rand()fonction est disponible, qui choisit une valeur aléatoire entre 0 et 1 dans une distribution uniforme. Je suis un peu rouillé sur ma probabilité, alors quand j'ai vu le comportement suivant, j'ai été perplexe: A = 200x1 colonne de rand()^2 B = 200x1 colonne de …
J'ai un modèle linéaire avec environ 6 prédicteurs et je vais présenter les estimations, les valeurs F, les valeurs p, etc. Cependant, je me demandais quel serait le meilleur tracé visuel pour représenter l'effet individuel d'un seul prédicteur sur la variable de réponse? Scatterplot? Tracé conditionnel? Tracé d'effets? etc? Comment …
J'ai du mal à dériver la Hesse de la fonction objectif, l(θ)l(θ)l(\theta) , en régression logistique où l(θ)l(θ)l(\theta) est: l(θ)=∑i=1m[yilog(hθ(xi))+(1−yi)log(1−hθ(xi))]l(θ)=∑i=1m[yilog(hθ(xi))+(1−yi)log(1−hθ(xi))] l(\theta)=\sum_{i=1}^{m} \left[y_{i} \log(h_\theta(x_{i})) + (1- y_{i}) \log (1 - h_\theta(x_{i}))\right] hθ(x)hθ(x)h_\theta(x) est une fonction logistique. Le Hessian estXTDXXTDXX^T D X . J'ai essayé de le dériver en calculant∂2l(θ)∂θi∂θj∂2l(θ)∂θi∂θj\frac{\partial^2 l(\theta)}{\partial \theta_i …
Au cours des dernières semaines, j'ai essayé de comprendre MCMC et les algorithmes de Metropolis-Hastings. Chaque fois que je pense le comprendre, je me rends compte que je me trompe. La plupart des exemples de code que je trouve en ligne implémentent quelque chose qui n'est pas cohérent avec la …
Disons que j'ai un classificateur de régression logistique. Dans l'apprentissage par lots normal, j'aurais un terme régularisateur pour éviter le surapprentissage et garder mes poids petits. Je normaliserais également et ferais évoluer mes fonctionnalités. Dans un environnement d'apprentissage en ligne, je reçois un flux continu de données. Je fais une …
J'ai une série chronologique que j'essaie de prévoir, pour laquelle j'ai utilisé le modèle saisonnier ARIMA (0,0,0) (0,1,0) [12] (= fit2). C'est différent de ce que R a suggéré avec auto.arima (R calculé ARIMA (0,1,1) (0,1,0) [12] serait un meilleur ajustement, je l'ai nommé fit1). Cependant, au cours des 12 …
J'ai récemment reçu la question suivante par e-mail. Je posterai une réponse ci-dessous, mais j'étais intéressé à entendre ce que les autres pensaient. Diriez-vous que la régression logistique est un test non paramétrique? Je crois comprendre que le simple étiquetage d'un test non paramétrique parce que ses données ne sont …
Je travaille actuellement sur un modèle de régression où je n'ai que des variables catégorielles / factorielles comme variables indépendantes. Ma variable dépendante est un rapport transformé logit. Il est assez facile d'exécuter une régression normale dans R, car R sait automatiquement coder les nuls dès qu'ils sont du type …
Je me demandais si quelqu'un pouvait expliquer la différence entre une précision équilibrée qui est b_acc = (sensitivity + specificity)/2 et le score f1 qui est: f1 = 2*precision*recall/(precision + recall)
Je ne suis pas trop doué en statistiques, donc je m'excuse s'il s'agit d'une question simpliste. J'ajuste une courbe à certaines données, et parfois mes données correspondent le mieux à une exponentielle négative sous la forme , et parfois l'ajustement est plus proche de a ∗ e ( - b …
J'ai vu différentes métriques d'erreur utilisées dans les compétitions Kaggle: RMS, moyenne quadratique, AUC, entre autres. Quelle est la règle générale sur le choix d'une métrique d'erreur, c'est-à-dire comment savoir quelle métrique d'erreur utiliser pour un problème donné? Y a-t-il des directives?
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.