Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


6
Comment se lit la notation
Comment se lit la notation ? Est-ce que X suit une distribution normale? Ou X est une distribution normale? Ou peut-être que X est à peu près normal ..X∼ N(μ,σ2)X∼N(μ,σ2)X\sim N(\mu,\sigma^2)XXX XXX XXX Et s'il y a plusieurs variables qui suivent (ou quels que soient les mots) la même distribution? …

1
Cette interprétation de la rareté est-elle exacte?
Selon la documentation de la removeSparseTermsfonction du tmpackage, voici ce que la rareté implique: A term-document matrix where those terms from x are removed which have at least a sparse percentage of empty (i.e., terms occurring 0 times in a document) elements. I.e., the resulting matrix contains only terms with …

3
Identification des fonctionnalités filtrées après la sélection des fonctionnalités avec scikit learn
Voici mon code pour la méthode de sélection des fonctionnalités en Python: from sklearn.svm import LinearSVC from sklearn.datasets import load_iris iris = load_iris() X, y = iris.data, iris.target X.shape (150, 4) X_new = LinearSVC(C=0.01, penalty="l1", dual=False).fit_transform(X, y) X_new.shape (150, 3) Mais après avoir obtenu un nouveau X (variable dépendante - …

1
Validation croisée de la régression du lasso en R
La fonction R cv.glm (bibliothèque: boot) calcule l'erreur de prédiction de validation croisée K-fold estimée pour les modèles linéaires généralisés et renvoie delta. Est-il judicieux d'utiliser cette fonction pour une régression au lasso (bibliothèque: glmnet) et si oui, comment peut-elle être réalisée? La bibliothèque glmnet utilise une validation croisée pour …

3
relation entre
Une question très basique concernant les régressions R2R2R^2 des OLS exécuter la régression OLS y ~ x1, nous avons un R2R2R^2 , disons 0,3 exécuter la régression OLS y ~ x2, nous avons un autre R2R2R^2 , disons 0,4 maintenant nous exécutons une régression y ~ x1 + x2, quelle …


2
Qu'est-ce que la bucketisation?
J'ai fait le tour pour trouver une explication claire de la «bucketisation» dans l'apprentissage automatique sans succès. Ce que je comprends jusqu'à présent, c'est que la bucketisation est similaire à la quantification dans le traitement numérique du signal où une plage de valeurs continues est remplacée par une valeur discrète. …


2
Différence entre l'ACP et le clustering spectral pour un petit ensemble d'échantillons de fonctionnalités booléennes
J'ai un ensemble de données de 50 échantillons. Chaque échantillon est composé de 11 entités booléennes (éventuellement corrélées). J'aimerais savoir comment visualiser ces échantillons sur un tracé 2D et examiner s'il y a des grappes / groupements parmi les 50 échantillons. J'ai essayé les deux approches suivantes: (a) Exécutez PCA …





2
Évaluer la distribution prédictive postérieure dans la régression linéaire bayésienne
Je ne sais pas comment évaluer la distribution prédictive postérieure de la régression linéaire bayésienne, après le cas de base décrit ici à la page 3, et copié ci-dessous. p(y~∣y)=∫p(y~∣β,σ2)p(β,σ2∣y)p(y~∣y)=∫p(y~∣β,σ2)p(β,σ2∣y) p(\tilde y \mid y) = \int p(\tilde y \mid \beta, \sigma^2) p(\beta, \sigma^2 \mid y) Le cas de base est …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.