Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


3
Comment évaluer les résultats de la régression linéaire
J'ai un problème de régression linéaire. En bref, j'ai un ensemble de données, je l'ai divisé en deux sous-ensembles. Un sous-ensemble est utilisé pour trouver la régression linéaire (sous-ensemble d'apprentissage), un autre est utilisé pour l'évaluer (sous-ensemble d'évaluation). Ma question est de savoir comment évaluer le résultat de cette régression …

1
MCMC et augmentation des données
J'ai regardé une question d'augmentation de données MCMC; la forme générale de la question est la suivante: Supposons que les données recueillies sur un processus suggèrent et qu'un a priori pour le paramètre de débit soit suggéré comme . Les données sont enregistrées et présentées sous une forme typique (c'est-à-dire …

1
Pourquoi y a-t-il autant de générateurs aléatoires dans R?
Un rapide coup d' oeil à la page d'aide du générateur de nombres aléatoires de R montre que vous pouvez choisir parmi 7 générateurs prédéfinis ( Wichmann-Hill, Marsaglia-Multicarry, Super-Duper, Mersenne-Twister, Knuth-TAOCP-2002, Knuth-TAOCP, L'Ecuyer-CMRG). ?Random La valeur par défaut est Mersenne-Twister , qui semble très bonne. Alors pourquoi auriez-vous besoin d'en …


2
Expliquer le graphique de densité du noyau
J'exécute la simulation sur un modèle linéaire. J'obtiens 1000 résultats et les résultats sont mis dans un graphique de densité. Je comprends que le xaxis est la variable dépendante et que les yaxis représentent la densité du noyau. Yaxis est en nombres décimaux comme de 0 à 0,15. Comment expliquer …




2
Non paramétrique pour ANOVA bidirectionnelle (3x3)
Ma variable dépendante est continue, non normale (asymétrique à gauche selon le test de Shapiro-Wilk). J'ai deux variables indépendantes (groupe de traitement par couleur, type d'aliment). Il y a 3 niveaux dans chaque variable indépendante. Le nombre d'observations pour chaque variable indépendante n'est pas égal. J'ai recherché des tests non …


6
L'utilisation des mêmes données pour la sélection d'entités et la validation croisée est-elle biaisée ou non?
Nous avons un petit ensemble de données (environ 250 échantillons * 100 entités) sur lequel nous voulons construire un classificateur binaire après avoir sélectionné le meilleur sous-ensemble d'entités. Disons que nous partitionnons les données en: Formation, validation et tests Pour la sélection des fonctionnalités, nous appliquons un modèle de wrapper …

1
Covariance d'une variable et d'une combinaison linéaire d'autres variables
Soit variables de séries temporelles et la covariance entre deux paires quelconques de celles-ci est connue.X,A,B,C,DX,A,B,C,DX,A,B,C,D Supposons que nous voulons trouver , où a, b, c, d sont des constantes.cov(X,aA+bB+cC+dD)cov(X,aA+bB+cC+dD)\textrm{cov}(X,aA + bB + cC + dD)a,b,c,da,b,c,da,b,c,d Existe-t-il un moyen de le faire sans développer E[(X−E[X])(aA+......)]E[(X−E[X])(aA+......)]E[(X-E[X])(aA+......)] ?


1
Problème d'identification des paramètres
J'ai toujours du mal à obtenir la véritable essence de l'identification en économétrie. Je sais que nous déclarons qu'un paramètre (par exemple ) peut être identifié si, simplement en regardant sa distribution (conjointe), nous pouvons déduire la valeur du paramètre. Dans un cas simple de y = b_1X + u …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.