Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
R comme alternative à SAS pour les données volumineuses
Je sais que R n'est pas particulièrement utile pour analyser de grands ensembles de données étant donné que R charge toutes les données en mémoire alors que quelque chose comme SAS fait une analyse séquentielle. Cela dit, il existe des packages tels que bigmemory qui permettent aux utilisateurs d'effectuer une …
8 r  sas  large-data 

3
Détection de clusters dans une séquence binaire
J'ai une séquence binaire telle que 11111011011110101100000000000100101011011111101111100000000000011010100000010000000011101111 Où les grappes de la plupart des 1 sont suivies d'un plus grand nombre de zéros, comme dans l'image ci-dessous (noir signifie 1): Je voudrais appliquer une technique (de préférence en R ou en Python) où je peux détecter automatiquement ces grappes de …

4
Comment puis-je échantillonner à partir d'une distribution avec CDF incomputable?
Problème lié à la simulation semi-informatique ici. J'ai une distribution où P (x) =(eb−1)eb(n−x)ebn+b−1(eb−1)eb(n−x)ebn+b−1\frac{(e^b-1) e^{b (n-x)}}{e^{b n+b}-1} pour certaines constantes b et n, et x est un entier tel que .0≤x≤n0≤x≤n0\leq x \leq n Maintenant, je dois échantillonner à partir de cette distribution. Il a un CDF inversible, il est …

1
Application de la récence dans la régression logistique
Existe-t-il des concepts ou des théories statistiques sur la façon de mesurer efficacement la récence dans laquelle les événements récents ont plus de poids que les événements plus anciens. Je crée un modèle de régression logistique et je voudrais appliquer un ajustement à divers facteurs en fonction de la récence …


2
Pour quelle distribution une moyenne ajustée est-elle l'estimateur du maximum de vraisemblance?
La moyenne de l'échantillon est l'estimateur du maximum de vraisemblance de pour une distribution normale . La médiane de l'échantillon est l'estimateur du maximum de vraisemblance de pour une distribution de Laplace (également appelée distribution exponentielle double).μμ\muNormal(μ,σ)Normal(μ,σ)\text{Normal}(\mu,\sigma)mmm Laplace(m,s)Laplace(m,s)\text{Laplace}(m,s) Existe-t-il une distribution avec un paramètre d'emplacement pour lequel la moyenne de …

1
Chaque modèle log-linéaire a-t-il une régression logistique parfaitement équivalente?
J'essaie d'adapter un modèle log-linéaire à un grand nombre de variables à partir de données d'enquête. Il y a certaines raisons pour lesquelles il pourrait être préférable d'adapter les régressions logistiques à ces données. Plusieurs autorités suggèrent que celles-ci sont équivalentes. Cependant, j'ai quelques raisons d'en douter. Les modèles log-linéaires …


1
Prédire le vainqueur d'un match de football basé uniquement sur le résultat des matchs précédents entre les deux équipes
Je suis un grand fan de football et je m'intéresse aussi à l'apprentissage automatique. En tant que projet pour mon cours de ML, j'essaie de construire un modèle qui prédirait les chances de gagner pour l'équipe à domicile, étant donné les noms de l'équipe à domicile et à l'extérieur. (Je …

2
Comprendre le graphique partagé
Quelqu'un peut-il m'expliquer l'intuition derrière l'intrigue partagée? D'après ce que je comprends, il s'agit essentiellement d'une randomisation restreinte. Mais je ne le comprends toujours pas très bien. Y a-t-il une ressource ou un exemple que quelqu'un peut me donner pour que ce soit plus clair?


1
Impossible d'ajuster la régression binomiale négative dans R (tentative de réplication des résultats publiés)
Tenter de reproduire les résultats de l'article récemment publié, Aghion, Philippe, John Van Reenen et Luigi Zingales. 2013. «Innovation and Institutional Ownership». American Economic Review, 103 (1): 277-304. (Les données et le code stata sont disponibles sur http://www.aeaweb.org/aer/data/feb2013/20100973_data.zip ). Je n'ai aucun problème à recréer les 5 premières régressions dans …

2
Anova de l'interprétation de sortie R
J'ai une question sur la façon dont un statisticien interpréterait normalement une sortie anova. Disons que j'ai une sortie anova de R. > summary(fitted_data) Call: lm(formula = V1 ~ V2) Residuals: Min 1Q Median 3Q Max -2.74004 -0.33827 0.04062 0.44064 1.22737 Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 2.11405 …

1
La racine carrée d'une matrice semi-définie positive est-elle un résultat unique?
J'essaie de décomposer une série chronologique de observations en structure de variance-covariance et une série aléatoire .nnnvcvc\bf{\mathrm{v_c}}n×nn×nn \times n∑∑\sumvv\bf{\mathrm{v}} Donc, je peux dériver la matrice de variance-covariance de la fonction d'autocorrélation de . Ce sera une matrice de Toeplitz, qui est semi-définie positive. Par conséquent, je suis capable de calculer …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.