Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Qu'est-ce que l '«attente de probabilité maximale ciblée»?
J'essaie de comprendre certains articles de Mark van der Laan. Il est un statisticien théorique à Berkeley travaillant sur des problèmes qui se chevauchent de manière significative avec l'apprentissage automatique. Un problème pour moi (en plus des mathématiques approfondies) est qu'il finit souvent par décrire des approches d'apprentissage machine familières …

2
Quelle est la définition de la précision Top-n?
Je lis un article scientifique sur la classification des images. Dans les résultats expérimentaux, ils parlent de la précision du top 1 et du top 5, mais je n'ai jamais entendu parler du terme et je ne le trouve pas en utilisant Google. Quelqu'un peut-il me donner une définition ou …

1
Comment interpréter ACF négatif (fonction d'autocorrélation)?
J'ai donc tracé l'ACF / PACF des retours de pétrole et je m'attendais à voir une autocorrélation positive, mais à ma grande surprise, je n'obtiens qu'une autocorrélation négative significative. Comment dois-je interpréter le graphique ci-dessus? Ils semblent indiquer que les rendements pétroliers ont tendance à augmenter lorsqu'ils ont diminué précédemment …



3
Comparaison des listes classées
Supposons que deux groupes, comprenant et n 2 classent chacun un ensemble de 25 éléments du plus important au moins important. Quelles sont les meilleures façons de comparer ces classements?n1n1n_1n2n2n_2 De toute évidence, il est possible de faire 25 tests de Mann-Whitney U, mais cela entraînerait 25 résultats de tests …

1
Corrélation de distance versus information mutuelle
Je travaille avec l'information mutuelle depuis un certain temps. Mais j'ai trouvé une mesure très récente dans le "monde de corrélation" qui peut également être utilisée pour mesurer l'indépendance de distribution, la soi-disant "corrélation de distance" (également appelée corrélation brownienne): http://en.wikipedia.org/wiki/Brownian_covariance . J'ai vérifié les papiers où cette mesure est …


1
Quelles sont les limites de queue connues les plus nettes pour les variables distribuées
Soit une variable aléatoire distribuée khi carré avec k degrés de liberté. Quelles sont les limites connues les plus précises pour les probabilités suivantesX∼χ2kX∼χk2X \sim \chi^2_kkkk P[X&gt;t]≤1−δ1(t,k)P[X&gt;t]≤1−δ1(t,k) \mathbb{P}[X > t] \leq 1 - \delta_1(t, k) et P[X&lt;z]≤1−δ2(z,k)P[X&lt;z]≤1−δ2(z,k) \mathbb{P}[X < z] \leq 1 - \delta_2(z, k) où et δ 2 sont …




2
Pourquoi avez-vous besoin de mettre à l'échelle des données dans KNN
Quelqu'un pourrait-il m'expliquer pourquoi vous devez normaliser les données lors de l'utilisation de K voisins les plus proches. J'ai essayé de chercher ça, mais je n'arrive toujours pas à le comprendre. J'ai trouvé le lien suivant: https://discuss.analyticsvidhya.com/t/why-it-is-necessary-to-normalize-in-knn/2715 Mais dans cette explication, je ne comprends pas pourquoi une plus grande plage …

3
Zéro distributions gonflées, quelles sont-elles vraiment?
J'ai du mal à comprendre les distributions zéro gonflées. Que sont-ils? À quoi ça sert? Si j'ai des données avec plusieurs zéros, alors je pourrais ajuster une régression logistique d'abord calculer la probabilité des zéros, puis je pourrais supprimer tous les zéros, puis ajuster une régression régulière en utilisant mon …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.