Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Les avantages et les inconvénients de la lissage de la spline
J'ai une question générale. Récemment, je viens d'apprendre l'expansion et la régularisation de la base. Il existe plusieurs techniques intéressantes, notamment: spline cubique, spline naturelle, spline b et spline de lissage . La question est, quels sont les avantages et les inconvénients (s'il y en a) du lissage de la …

3
Rappel élevé - faible précision pour un ensemble de données déséquilibré
Je rencontre actuellement des problèmes lors de l'analyse d'un ensemble de données de tweet avec des machines à vecteurs de support. Le problème est que j'ai un ensemble d'entraînement en classe binaire déséquilibré (5: 2); qui devrait être proportionnelle à la distribution réelle des classes. Lors de la prédiction, j'obtiens …






4
La moyenne d'un ensemble de moyennes sera-t-elle toujours la même que la moyenne obtenue à partir de l'ensemble des données brutes?
Si j'ai calculé la moyenne de 4 ensembles de données (qui ont des tailles d'échantillon différentes), puis-je alors obtenir une "moyenne globale" en calculant la "moyenne des moyennes"? Si oui, cette «moyenne des moyens» sera-t-elle la même que si j'avais combiné les données des 4 ensembles et calculé la moyenne?

1
Nombre de composants principaux lors du prétraitement à l'aide de PCA dans le package caret dans R
J'utilise le caretpackage Rpour la formation des classificateurs SVM binaires. Pour réduire les fonctionnalités, je prétraitement avec PCA en utilisant la fonction intégrée preProc=c("pca")lors de l'appel train(). Voici mes questions: Comment le curseur sélectionne-t-il les principaux composants? Existe-t-il un nombre fixe de composants principaux sélectionnés? Les principales composantes sont-elles sélectionnées …

1
Questions sur PCA: quand les PC sont-ils indépendants? pourquoi PCA est-il sensible à la mise à l'échelle? pourquoi les PC sont-ils contraints d'être orthogonaux?
J'essaie de comprendre certaines descriptions de l'ACP (les deux premières proviennent de Wikipedia), emphase ajoutée: Les composants principaux ne sont garantis indépendants que si l'ensemble de données est distribué normalement conjointement . L'indépendance des principaux composants est-elle très importante? Comment puis-je comprendre cette description? L'ACP est sensible à la mise …


2
Régression multiple avec prédicteurs catégoriques et numériques
Je suis relativement nouveau dans R et j'essaie d'adapter un modèle à des données qui se composent d'une colonne catégorielle et d'une colonne numérique (entière). La variable dépendante est un nombre continu. Les données ont le format suivant: predCateg, predIntNum, ResponseVar Les données ressemblent à ceci: ranking, age_in_years, wealth_indicator category_A, …


2
Propriété d'invariance de MLE: quel est le MLE de de normal, ?
Propriété d'invariance de MLE: si est le MLE de , alors pour toute fonction , le MLE de est . θ^θ^\hat{\theta}θθ\thetaf(θ)f(θ)f(\theta)f(θ)f(θ)f(\theta)f(θ^)f(θ^)f(\hat{\theta}) De plus, doit être une fonction biunivoque.fff Le livre dit: "Par exemple, pour estimer , le carré d'une moyenne normale, la cartographie n'est pas biunivoque." Donc, nous ne pouvons …

1
Erreur «le mineur majeur de l'ordre 1 n'est pas défini définitivement» en utilisant 2l.norm chez la souris
J'ai un problème avec la 2l.normméthode d'imputation multiniveau dans mice. Malheureusement, je ne peux pas publier d'exemple reproductible en raison de la taille de mes données - lorsque je réduis la taille, le problème disparaît. Pour une variable particulière, micegénère les erreurs et avertissements suivants: Error in chol.default(inv.sigma2[class] * X.SS[[class]] …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.