Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Test de la classification sur des données de déséquilibre suréchantillonnées
Je travaille sur des données gravement déséquilibrées. Dans la littérature, plusieurs méthodes sont utilisées pour rééquilibrer les données en utilisant un rééchantillonnage (sur ou sous-échantillonnage). Deux bonnes approches sont: SMOTE: TEchnique de suréchantillonnage des minorités synthétiques ( SMOTE ) ADASYN: Approche d'échantillonnage synthétique adaptative pour l'apprentissage déséquilibré ( ADASYN ) …


1
Construction de la distribution Dirichlet avec distribution Gamma
Soit X1,…,Xk+1X1,…,Xk+1X_1,\dots,X_{k+1} des variables aléatoires mutuellement indépendantes, ayant chacune une distribution gamma avec les paramètres αi,i=1,2,…,k+1αi,i=1,2,…,k+1\alpha_i,i=1,2,\dots,k+1 montrent que Yi=XiX1+⋯+Xk+1,i=1,…,kYi=XiX1+⋯+Xk+1,i=1,…,kY_i=\frac{X_i}{X_1+\cdots+X_{k+1}},i=1,\dots,k, ont une distribution commune commeDirichlet(α1,α2,…,αk;αk+1)Dirichlet(α1,α2,…,αk;αk+1)\text{Dirichlet}(\alpha_1,\alpha_2,\dots,\alpha_k;\alpha_{k+1}) PDF commun de (X1,…,Xk+1)=e−∑k+1i=1xixα1−11…xαk+1−1k+1Γ(α1)Γ(α2)…Γ(αk+1)(X1,…,Xk+1)=e−∑i=1k+1xix1α1−1…xk+1αk+1−1Γ(α1)Γ(α2)…Γ(αk+1)(X_1,\dots,X_{k+1})=\frac{e^{-\sum_{i=1}^{k+1}x_i}x_1^{\alpha_1-1}\dots x_{k+1}^{\alpha_{k+1}-1}}{\Gamma(\alpha_1)\Gamma(\alpha_2)\dots \Gamma(\alpha_{k+1})} .Puis pour trouver le pdf commun de(Y1,…,Yk+1)(Y1,…,Yk+1)(Y_1,\dots,Y_{k+1})je ne peux pas trouver jacobien ieJ(x1,…,xk+1y1,…,yk+1)J(x1,…,xk+1y1,…,yk+1)J(\frac{x_1,\dots,x_{k+1}}{y_1,\dots,y_{k+1}})

2
Visualisation d'une base spline
Les manuels ont généralement de beaux exemples de la base des splines uniformes lorsqu'ils expliquent le sujet. Quelque chose comme une rangée de petits triangles pour une spline linéaire, ou une rangée de petits bosses pour une spline cubique. Voici un exemple typique: http://support.sas.com/documentation/cdl/en/statug/63033/HTML/default/viewer.htm#statug_introcom_a0000000525.htm Je me demande s'il existe un …



1
Hypothèses LASSO
Dans un scénario de régression LASSO où y=Xβ+ϵy=Xβ+ϵy= X \beta + \epsilon , et les estimations de LASSO sont données par le problème d'optimisation suivant minβ||y−Xβ||+τ||β||1minβ||y−Xβ||+τ||β||1 \min_\beta ||y - X \beta|| + \tau||\beta||_1 Existe-t-il des hypothèses de distribution concernant le ?ϵϵ\epsilon Dans un scénario OLS, on peut s'attendre à ce …



4
Formule ACF et PACF
Je veux créer un code pour tracer ACF et PACF à partir de données de séries chronologiques. Tout comme ce graphique généré à partir de minitab (ci-dessous). J'ai essayé de rechercher la formule, mais je ne la comprends toujours pas bien. Pourriez-vous me dire la formule et comment l'utiliser, s'il …

2
Combien de fois devons-nous répéter un CV multiplié par K?
Je suis tombé sur ce fil en regardant les différences entre le bootstrap et la validation croisée - une excellente réponse et des références d'ailleurs. Ce que je me demande maintenant, c'est si je devais répéter un CV multiplié par 10 pour calculer la précision d'un classificateur, combien de fois …





En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.