Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


2
Comment la statistique Chi Squared de Pearson se rapproche-t-elle d'une distribution Chi Chi
Donc, si la statistique Chi Squared de Pearson est donnée pour une table , alors sa forme est:1×N1×N1 \times N ∑i=1n(Oi−Ei)2Ei∑i=1n(Oi−Ei)2Ei\sum_{i=1}^n\frac{(O_i - E_i)^2}{E_i} Ensuite, cela se rapproche de , la distribution du chi carré avec degrés de liberté, à mesure que la taille de l'échantillon augmente. χ2n−1χn−12\chi_{n-1}^2n−1n−1n-1NNN Ce que je …




1
Pourquoi l'ensachage utilise-t-il des échantillons de bootstrap?
L'ensachage est le processus de création de N apprenants sur N échantillons de bootstrap différents, puis de prise de la moyenne de leurs prédictions. Ma question est: pourquoi ne pas utiliser un autre type d'échantillonnage? Pourquoi utiliser des échantillons bootstrap?
10 bagging 

2
Quelle est l'estimation du maximum de vraisemblance de la covariance des données normales bivariées lorsque la moyenne et la variance sont connues?
Supposons que nous ayons un échantillon aléatoire d'une distribution normale bivariée qui a des zéros comme moyennes et des uns comme des variances, donc le seul paramètre inconnu est la covariance. Quel est le MLE de la covariance? Je sais que cela devrait être quelque chose comme mais comment savons-nous …


2
VarImp du curseur pour le modèle randomForest
J'ai du mal à comprendre comment varImpfonctionne la fonction pour un modèle randomForest avec le caretpackage. Dans l'exemple ci-dessous, la fonction var3 n'a aucune importance en utilisant la varImpfonction caret , mais le modèle final randomForest sous-jacent a une importance non nulle pour la fonction var3. pourquoi est-ce le cas? …
10 r  caret  random-forest 



2
Les types de données (nominaux / ordinaux / intervalle / ratio) devraient-ils vraiment être considérés comme des types de variables?
Donc, par exemple, voici les définitions que j'obtiens des manuels standard Variable - caractéristique de la population ou de l'échantillon. ex. Prix ​​d'un stock ou d'une note sur un test Données - valeurs réelles observées Donc, pour un rapport à deux colonnes [Nom | Revenu] les noms des colonnes seraient …


3
Est-il possible en R (ou en général) de forcer les coefficients de régression à être un certain signe?
Je travaille avec des données du monde réel et les modèles de régression donnent des résultats contre-intuitifs. Normalement, je fais confiance aux statistiques, mais en réalité, certaines de ces choses ne peuvent pas être vraies. Le principal problème que je vois est qu'une augmentation d'une variable entraîne une augmentation de …

4
Détermination des paramètres (p, d, q) pour la modélisation ARIMA
Je suis relativement nouveau dans les statistiques et R. J'aimerais connaître le processus pour déterminer les paramètres ARIMA pour mon jeu de données. Pouvez-vous m'aider à comprendre la même chose en utilisant R et théoriquement (si possible)? La plage de données s'étend du 12 janvier au 14 mars et décrit …
10 r  arima  box-jenkins 

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.