Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Expression de forme fermée pour les quantiles de
J'ai deux variables aléatoires, αi∼iid U(0,1),i=1,2αi∼iid U(0,1),i=1,2\alpha_i\sim \text{iid }U(0,1),\;\;i=1,2 oùU(0,1)U(0,1)U(0,1) est la distribution uniforme de 0-1. Ensuite, cela donne un processus, disons: P(x)=α1sin(x)+α2cos(x),x∈(0,2π)P(x)=α1sin⁡(x)+α2cos⁡(x),x∈(0,2π)P(x)=\alpha_1\sin(x)+\alpha_2\cos(x), \;\;\;x\in (0,2\pi) Maintenant, je me demandais s'il y avait une expression de forme fermée pour F−1(P(x);0.75)F−1(P(x);0.75)F^{-1}(P(x);0.75) le quantile théorique à 75% de P(x)P(x)P(x) pour un x∈(0,2π)x∈(0,2π)x\in(0,2\pi) donné …



2
Mesures de l'hétéroscédasticité résiduelle
Ce lien wikipedia répertorie un certain nombre de techniques pour détecter l'hétéroscédasticité des résidus OLS. Je voudrais savoir quelle technique pratique est plus efficace pour détecter les régions affectées par l'hétéroscédasticité. Par exemple, ici, la région centrale du graphique OLS `` Résidus vs ajustés '' semble avoir une variance plus …

2
Qu'est-ce que la structure R de la structure G dans un glmm?
J'ai utilisé le MCMCglmmpackage récemment. Je suis confus par ce que l'on appelle dans la documentation structure R et structure G. Ceux-ci semblent se rapporter aux effets aléatoires - en particulier en spécifiant les paramètres de la distribution antérieure sur eux, mais la discussion dans la documentation semble supposer que …

3
Auto.arima vs autobox diffèrent-ils?
De la lecture des messages sur ce site, je sais qu'il existe une fonction R auto.arima(dans le forecast package ). Je sais également qu'IrishStat , membre de ce site, a construit la boîte automatique du package commercial au début des années 1980. Comme ces deux packages existent aujourd'hui et sélectionnent …

1
Processus gaussien: propriétés d'approximation de fonction
J'apprends le processus gaussien et n'ai entendu que des morceaux. J'apprécierais vraiment les commentaires et les réponses. Pour tout ensemble de données, est-il vrai qu'une approximation de la fonction du processus gaussien donnerait une erreur d'ajustement nulle ou négligeable aux points de données? Dans un autre endroit, j'ai également entendu …




4
Nettoyage des données de format incohérent dans R?
Je traite souvent des données d'enquête en désordre qui nécessitent beaucoup de nettoyage avant de pouvoir effectuer des statistiques. J'avais l'habitude de le faire "manuellement" dans Excel, parfois en utilisant des formules Excel, et parfois en vérifiant les entrées une par une. J'ai commencé à faire de plus en plus …
16 r  data-cleaning 

2
Calcul de l'erreur standard dans l'estimation moyenne pondérée
Supposons que w1,w2,…,wnw1,w2,…,wnw_1,w_2,\ldots,w_n et x1,x2,...,xnx1,x2,...,xnx_1,x_2,...,x_n sont chacun tirés iid de certaines distributions, avec wiwiw_i indépendant de xixix_i . Les sont strictement positifs. Vous observez tous les , mais pas les ; vous observez plutôt . Je souhaite estimerwiwiw_iwiwiw_ixixix_i∑ixiwi∑ixiwi\sum_i x_i w_iE[x]E⁡[x]\operatorname{E}\left[x\right]à partir de ces informations. Il est clair que l'estimateur est …

3
Calcul du nouvel écart-type à l'aide de l'ancien écart-type après modification de l'ensemble de données
J'ai un tableau de nnn valeurs réelles, qui a la moyenne μoldμold\mu_{old} et l'écart type σoldσold\sigma_{old} . Si un élément du tableau xixix_i est remplacé par un autre élément xjxjx_j , alors la nouvelle moyenne sera μnew=μold+xj−xinμnew=μold+xj−xin\mu_{new}=\mu_{old}+\frac{x_j-x_i}{n} L'avantage de cette approche est qu'elle nécessite un calcul constant quelle que soit …


3
Trouver le MLE pour un processus Hawkes exponentiel univarié
Le processus exponentiel univarié de Hawkes est un processus ponctuel auto-excitant avec un taux d'arrivée d'événements de: λ(t)=μ+∑ti&lt;tαe−β(t−ti)λ(t)=μ+∑ti&lt;tαe−β(t−ti) \lambda(t) = \mu + \sum\limits_{t_i<t}{\alpha e^{-\beta(t-t_i)}} où sont les heures d'arrivée des événements.t1,..tnt1,..tn t_1,..t_n La fonction de vraisemblance logarithmique est −tnμ+αβ∑(e−β(tn−ti)−1)+∑i&lt;jln(μ+αe−β(tj−ti))−tnμ+αβ∑(e−β(tn−ti)−1)+∑i&lt;jln⁡(μ+αe−β(tj−ti)) - t_n \mu + \frac{\alpha}{\beta} \sum{( e^{-\beta(t_n-t_i)}-1 )} + \sum\limits_{i<j}{\ln(\mu+\alpha e^{-\beta(t_j-t_i)})} …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.