Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je sais que R n'est pas particulièrement utile pour analyser de grands ensembles de données étant donné que R charge toutes les données en mémoire alors que quelque chose comme SAS fait une analyse séquentielle. Cela dit, il existe des packages tels que bigmemory qui permettent aux utilisateurs d'effectuer une …
J'ai une séquence binaire telle que 11111011011110101100000000000100101011011111101111100000000000011010100000010000000011101111 Où les grappes de la plupart des 1 sont suivies d'un plus grand nombre de zéros, comme dans l'image ci-dessous (noir signifie 1): Je voudrais appliquer une technique (de préférence en R ou en Python) où je peux détecter automatiquement ces grappes de …
Problème lié à la simulation semi-informatique ici. J'ai une distribution où P (x) =(eb−1)eb(n−x)ebn+b−1(eb−1)eb(n−x)ebn+b−1\frac{(e^b-1) e^{b (n-x)}}{e^{b n+b}-1} pour certaines constantes b et n, et x est un entier tel que .0≤x≤n0≤x≤n0\leq x \leq n Maintenant, je dois échantillonner à partir de cette distribution. Il a un CDF inversible, il est …
Existe-t-il des concepts ou des théories statistiques sur la façon de mesurer efficacement la récence dans laquelle les événements récents ont plus de poids que les événements plus anciens. Je crée un modèle de régression logistique et je voudrais appliquer un ajustement à divers facteurs en fonction de la récence …
J'ai lu que pour le SVM Maximal Margin Classifier, après avoir résolu le double problème, la plupart des multiplicateurs de décalage se révèlent être des zéros. Seuls ceux correspondant aux vecteurs supports se révèlent positifs. Pourquoi donc?
La moyenne de l'échantillon est l'estimateur du maximum de vraisemblance de pour une distribution normale . La médiane de l'échantillon est l'estimateur du maximum de vraisemblance de pour une distribution de Laplace (également appelée distribution exponentielle double).μμ\muNormal(μ,σ)Normal(μ,σ)\text{Normal}(\mu,\sigma)mmm Laplace(m,s)Laplace(m,s)\text{Laplace}(m,s) Existe-t-il une distribution avec un paramètre d'emplacement pour lequel la moyenne de …
J'essaie d'adapter un modèle log-linéaire à un grand nombre de variables à partir de données d'enquête. Il y a certaines raisons pour lesquelles il pourrait être préférable d'adapter les régressions logistiques à ces données. Plusieurs autorités suggèrent que celles-ci sont équivalentes. Cependant, j'ai quelques raisons d'en douter. Les modèles log-linéaires …
Ce qui suit est un problème de Bayesian Data Analysis 2nd ed , p. 97. Andrew Gelman n'a pas inclus sa solution dans le guide sur son site Web et cela m'a rendu fou toute la journée. Littéralement toute la journée. Pour certaines données , modélisées comme une distribution binomiale …
Je suis un grand fan de football et je m'intéresse aussi à l'apprentissage automatique. En tant que projet pour mon cours de ML, j'essaie de construire un modèle qui prédirait les chances de gagner pour l'équipe à domicile, étant donné les noms de l'équipe à domicile et à l'extérieur. (Je …
Quelqu'un peut-il m'expliquer l'intuition derrière l'intrigue partagée? D'après ce que je comprends, il s'agit essentiellement d'une randomisation restreinte. Mais je ne le comprends toujours pas très bien. Y a-t-il une ressource ou un exemple que quelqu'un peut me donner pour que ce soit plus clair?
Nous savons que si un estimateur est un estimateur sans biais de thêta et si sa variance tend vers 0 alors que n tend vers l'infini, alors c'est un estimateur cohérent pour thêta. Mais c'est une condition suffisante et non nécessaire. Je cherche un exemple d'estimateur cohérent mais dont la …
Tenter de reproduire les résultats de l'article récemment publié, Aghion, Philippe, John Van Reenen et Luigi Zingales. 2013. «Innovation and Institutional Ownership». American Economic Review, 103 (1): 277-304. (Les données et le code stata sont disponibles sur http://www.aeaweb.org/aer/data/feb2013/20100973_data.zip ). Je n'ai aucun problème à recréer les 5 premières régressions dans …
J'ai une question sur la façon dont un statisticien interpréterait normalement une sortie anova. Disons que j'ai une sortie anova de R. > summary(fitted_data) Call: lm(formula = V1 ~ V2) Residuals: Min 1Q Median 3Q Max -2.74004 -0.33827 0.04062 0.44064 1.22737 Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 2.11405 …
J'essaie de décomposer une série chronologique de observations en structure de variance-covariance et une série aléatoire .nnnvcvc\bf{\mathrm{v_c}}n×nn×nn \times n∑∑\sumvv\bf{\mathrm{v}} Donc, je peux dériver la matrice de variance-covariance de la fonction d'autocorrélation de . Ce sera une matrice de Toeplitz, qui est semi-définie positive. Par conséquent, je suis capable de calculer …
Je cherche à construire un modèle prédictif où la variable de résultat est binaire et l'entrée est une série temporelle. Pour le rendre plus concret, le modèle prédira si un client se désiste (a quitté l'entreprise; codé 1 ou 0) en fonction du montant qu'il a dépensé avec l'entreprise au …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.