Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai un grand ensemble de données (20 000 points de données), à partir duquel je veux prélever des échantillons répétés de 10 points de données. Cependant, une fois que j'ai sélectionné ces 10 points de données, je veux qu'ils ne soient plus sélectionnés. J'ai essayé d'utiliser la samplefonction, mais il …
Je recherche des livres / manuels sur les statistiques basées sur les mathématiques fractales. Je sais que ce n'est pas un domaine très connu et qu'il est assez difficile de trouver de la bonne littérature. Toutes les suggestions sont les bienvenues (livres, manuels, matériel en ligne).
J'ai hérité d'un code d'analyse de données que, n'étant pas économétricien, j'ai du mal à comprendre. Un modèle exécute une régression de variables instrumentales avec la commande Stata suivante ivreg my_dv var1 var2 var3 (L.my_dv = D2.my_dv D3.my_dv D4.my_dv) Cet ensemble de données est un panneau avec plusieurs observations séquentielles …
Je fais des analyses de panier mon ensemble de données est un ensemble de vecteurs de transaction, avec les articles que les produits sont achetés. Lors de l'application de k-means sur les transactions, j'obtiendrai toujours un résultat. Une matrice aléatoire montrerait probablement aussi quelques grappes. Existe-t-il un moyen de tester …
Existe-t-il une règle empirique ou même un moyen quelconque de déterminer la taille d'un échantillon afin d'estimer un modèle avec un nombre donné de paramètres? Ainsi, par exemple, si je veux estimer une régression des moindres carrés avec 5 paramètres, quelle devrait être la taille de l'échantillon? Quelle est la …
À titre d'exemple d'application, envisagez de suivre deux propriétés des utilisateurs de Stack Overflow: la réputation et le nombre de vues de profil . On s'attend à ce que pour la plupart des utilisateurs, ces deux valeurs soient proportionnelles: les utilisateurs à haute réputation attirent plus d'attention et obtiennent donc …
Je suis débutant et j'essaie de comprendre ce que montre un graphique d'autocorrélation. J'ai lu plusieurs explications de différentes sources telles que cette page ou la page Wikipédia connexe entre autres que je ne cite pas ici. J'ai ce code très simple, où j'ai des dates dans mon index pour …
Je fais référence au réglage de la porte arrière et du réglage de la porte avant ici : Ajustement de porte dérobée : Le problème épidémiologique archétypal en statistique est d'ajuster l'effet d'un facteur de confusion mesuré. Le critère de la porte dérobée de Pearl généralise cette idée. Ajustement à …
La fonction softmax, couramment utilisée dans les réseaux de neurones pour convertir des nombres réels en probabilités, est la même fonction que la distribution de Boltzmann, la distribution de probabilité sur les énergies pour un ensemble de particules en équilibre thermique à une température donnée T en thermodynamique. Je peux …
Je me demande quelle est la valeur intrinsèque de l'utilisation de la moyenne harmonique (par exemple pour calculer les mesures F), par opposition à la moyenne arithmétique pondérée pour combiner précision et rappel? Je pense que la moyenne arithmétique pondérée pourrait jouer le rôle de moyenne harmonique, ou est-ce que …
J'ai regardé les conférences CS231N de Stanford et j'essaie de comprendre quelques problèmes dans les architectures CNN. Ce que j'essaie de comprendre, c'est s'il existe des directives générales pour choisir la taille du filtre de convolution et des choses comme les enjambées ou est-ce plus un art qu'une science? Je …
Je comprends que, étant donné un ensemble de observations indépendantes l' estimateur du maximum de vraisemblance (ou, de manière équivalente, le MAP avec a priori plat / uniforme) qui identifie les paramètres \ mathbf {θ} qui produisent la distribution du modèle p_ {modèle} \ gauche (\, \ cdot \,; \ …
Cela fait plus de 2 ans que je travaille sur différentes séries chronologiques. J'ai lu sur de nombreux articles qu'ACF est utilisé pour identifier l'ordre des termes MA et PACF pour AR. Il y a une règle générale selon laquelle pour MA, le décalage où ACF s'arrête soudainement est l'ordre …
Dans quelles situations devrions-nous utiliser t-SNE (en dehors de la visualisation des données)? T-SNE est utilisé pour la réduction de dimensionnalité. La réponse à cette question suggère que t-SNE devrait être utilisé uniquement pour la visualisation et que nous ne devrions pas l'utiliser pour le clustering. Alors, quelle est la …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.