Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Quelle est la justification, le cas échéant, pour utiliser l'analyse discriminante (DA) sur les résultats d'un algorithme de clustering comme k-means, comme je le vois de temps en temps dans la littérature (essentiellement sur le sous-typage clinique des troubles mentaux)? Il n'est généralement pas recommandé de tester les différences de …
Je dois faire une régression logistique binaire avec beaucoup de variables indépendantes. La plupart d'entre elles sont binaires, mais quelques-unes des variables catégorielles ont plus de deux niveaux. Quelle est la meilleure façon de gérer ces variables? Par exemple, pour une variable avec trois valeurs possibles, je suppose que deux …
Je veux prévoir les articles au détail (par semaine) à l'aide du lissage exponentiel. Je suis coincé en ce moment dans la façon de calculer, stocker et appliquer les indices de sésonalité. Le problème est que tous les exemples que j'ai trouvés traitent d'une sorte de saisonnalité simple. Dans mon …
Si l'on teste l'hypothèse d'homoscédasticité, des tests paramétriques (test de Bartlett d'homogénéité des variances bartlett.test) et non paramétriques (test de Figner-Killeen d'homogénéité des variances fligner.test) sont disponibles. Comment savoir quel type utiliser? Cela devrait-il dépendre, par exemple, de la normalité des données?
Le qq-plot peut être utilisé pour visualiser la similitude de deux distributions (par exemple, visualiser la similitude d'une distribution à une distribution normale, mais aussi pour comparer deux distributions de données de bibliothèque). Existe-t-il des statistiques qui génèrent une mesure numérique plus objective qui représente leur similitude (de préférence sous …
Je fais une estimation de la densité du noyau, avec un ensemble de points pondérés (c'est-à-dire que chaque échantillon a un poids qui n'est pas nécessaire), en N dimensions. De plus, ces échantillons sont juste dans un espace métrique (c'est-à-dire que nous pouvons définir une distance entre eux) mais rien …
J'ai les résultats d'un test sanguin administré à 2500 personnes quatre fois à six mois d'intervalle. Les résultats consistent principalement en deux mesures de la réponse immunitaire - une en présence de certains antigènes de la tuberculose, une en l'absence. Actuellement, chaque test est évalué comme positif ou négatif en …
J'examine quelques données de couverture génomique qui sont essentiellement une longue liste (quelques millions de valeurs) d'entiers, chacun indiquant dans quelle mesure (ou "profondément") cette position dans le génome est couverte. Je voudrais rechercher dans ces données des "vallées", c'est-à-dire des régions nettement "inférieures" à leur environnement. Notez que la …
Je recherche la distribution limite de la distribution multinomiale sur les résultats d. IE, la distribution des éléments suivants limn → ∞n- 12Xnlimn→∞n−12Xn\lim_{n\to \infty} n^{-\frac{1}{2}} \mathbf{X_n} Où XnXn\mathbf{X_n} est une variable aléatoire de valeur vectorielle de densité Fn( x )fn(x)f_n(\mathbf{x}) pour Xx\mathbf{x} telle que ∑jeXje= n∑ixi=n\sum_i x_i=n , Xje∈ Z …
Dans l'analyse des résultats aux tests (par exemple, en éducation ou en psychologie), les techniques d'analyse courantes supposent souvent que les données sont normalement distribuées. Cependant, peut-être plus souvent qu'autrement, les scores ont tendance à s'écarter parfois sauvagement de la normale. Je connais certaines transformations de normalisation de base, telles …
Dans l'état actuel des choses, cette question ne convient pas à notre format de questions / réponses. Nous nous attendons à ce que les réponses soient étayées par des faits, des références ou une expertise, mais cette question suscitera probablement un débat, des arguments, des sondages ou une discussion approfondie. …
Lors de la régression linéaire multiple OLS, plutôt que de tracer les résidus par rapport aux valeurs ajustées, je trace les résidus Studentized (internes) par rapport aux valeurs ajustées (idem pour les covariables). Ces résidus sont définis comme: e∗je= ejes2( 1 - hje je)---------√eje∗=ejes2(1-hjeje)\begin{equation} e^*_i = \frac{e_i}{\sqrt{s^2 (1-h_{ii})}} \end{equation} où …
J'ai besoin d'analyser avec R les données d'une enquête médicale (avec plus de 100 colonnes codées) qui vient dans un CSV. Je vais utiliser le hochet pour une première analyse mais en coulisses c'est toujours R. Si je lis.csv () le fichier, les colonnes avec des codes numériques sont traitées …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.