Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Dans diverses sources (voir par exemple ici ), la formule suivante est donnée pour l'intervalle de confiance pour la médiane (en particulier dans le but de tracer des encoches sur des parcelles en boîte et moustaches): 95% CImedian=Median±1.57×IQRN−−√95% CImedian=Median±1.57×IQRN 95\%\ CI_{\rm median} = {\rm Median} \pm \frac{1.57\times IQR}{\sqrt{N}} La constante …
Que signifie la notation (point sur tilde), dans le contexte comme ?∼˙∼˙\dot\simx∼˙N(0,1)x∼˙N(0,1)x \mathrel{\dot\sim} \mathcal N(0,1) Il s'avère qu'il est plus facile de trouver comment le composer correctement: tex.SE explique que l'on devrait taper \mathrel{\dot\sim}au lieu de simplement \dot\simrésoudre le problème d'espacement - que de trouver ce que cela signifie réellement. …
Je fais une étude sur la polytoxicomanie. J'ai un ensemble de données de 400 toxicomanes, qui ont chacun déclaré les drogues qu'ils abusent. Il existe plus de 10 médicaments et donc de grandes combinaisons possibles. J'ai recodé la plupart des drogues qu'ils consomment en variables binaires (c'est-à-dire que l'héroïne est …
Comment puis-je obtenir des p,d and qvaleurs dans le ARIMA(p,d,q)modèle estimées par auto.arima(mytimeseries)? arima_model <- auto.arima (mytimeseries, ic = 'bic') Si nous regardons la sortie de arima_model $ arma on a, [1] 1 0 0 0 1 2 0 Quelle est la signification des nombres apparaissant dans la séquence ci-dessus?
J'essaie de comprendre l'utilisation de la régression logistique dans les tables de contingence 2x2 et Ix2. Par exemple, en utilisant cela comme exemple Quelle est la différence entre l'utilisation du test du chi carré et l'utilisation de la régression logistique? Qu'en est-il d'une table avec plusieurs facteurs nominaux (table Ix2) …
Je lis actuellement sur la technique de visualisation t-SNE et il a été mentionné que l'un des inconvénients de l'utilisation de l'analyse en composantes principales (ACP) pour visualiser des données de grande dimension est qu'elle ne conserve que de grandes distances par paires entre les points. Les points signifiants qui …
Les problèmes de classification avec des limites non linéaires ne peuvent pas être résolus par un simple perceptron . Le code R suivant est à des fins d'illustration et est basé sur cet exemple en Python): nonlin <- function(x, deriv = F) { if (deriv) x*(1-x) else 1/(1+exp(-x)) } X …
Dans cet article (disponible gratuitement via PubMed Central), les auteurs utilisent une régression binomiale négative pour modéliser le score sur un instrument de dépistage à 10 éléments noté 0-40. Cette procédure suppose des données de comptage, ce qui n'est clairement pas le cas ici. J'aimerais avoir votre avis sur la …
Un réseau de petit monde est un type de graphe mathématique dans lequel la plupart des nœuds ne sont pas voisins les uns des autres, mais la plupart des nœuds peuvent être atteints les uns des autres par un petit nombre de sauts ou d'étapes. Plus précisément, un réseau de …
Aujourd'hui, notre professeur a déclaré en classe qu '"il n'est pas possible de sur-équiper les classificateurs linéaires". Je pense que c'est faux, car même les classificateurs linéaires peuvent être sensibles aux valeurs aberrantes dans l'ensemble de formation - prenez par exemple une machine à vecteur de support à marge dure: …
J'ai une question concernant la validité de l'utilisation de RMSE (Root Mean Squared Error) pour comparer différents modèles logistiques. La réponse est soit 0ou 1et les prédictions sont des probabilités entre 0- 1? La manière appliquée ci-dessous est-elle également valable avec les réponses binaires? # Using glmnet require(glmnet) load(url("https://github.com/cran/glmnet/raw/master /data/BinomialExample.RData")) …
Supposons que j'essaye de re-paramétrer une fonction de vraisemblance qui est distribuée de façon exponentielle. Si ma fonction de vraisemblance d'origine est: p ( y∣ θ ) = θ e- θ yp(y∣θ)=θe-θy p(y \mid \theta) = \theta e^{-\theta y} et je voudrais le re-paramétrer en utilisant , puisqueθn'est pas une …
Le cas échéant, entre l'ajustement d'une ligne à plusieurs "expériences" distinctes, puis la moyenne des ajustements, ou la moyenne des données des expériences distinctes, puis l'ajustement des données moyennes. Permettez-moi d'expliquer: J'effectue des simulations informatiques qui génèrent une courbe, illustrée ci-dessous. Nous extrayons une quantité, appelons-la "A" en ajustant la …
J'ai quelques données qui existent sur un graphique . Les sommets appartiennent à l'une des deux classes , et je suis intéressé à former un SVM pour distinguer les deux classes. Un noyau approprié pour cela est le noyau de diffusion , où est le laplacien de et est un …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.