Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai une question générale. Récemment, je viens d'apprendre l'expansion et la régularisation de la base. Il existe plusieurs techniques intéressantes, notamment: spline cubique, spline naturelle, spline b et spline de lissage . La question est, quels sont les avantages et les inconvénients (s'il y en a) du lissage de la …
Je rencontre actuellement des problèmes lors de l'analyse d'un ensemble de données de tweet avec des machines à vecteurs de support. Le problème est que j'ai un ensemble d'entraînement en classe binaire déséquilibré (5: 2); qui devrait être proportionnelle à la distribution réelle des classes. Lors de la prédiction, j'obtiens …
Je travaille avec des données déséquilibrées, où il y a environ 40 cas class = 0 pour chaque classe = 1. Je peux raisonnablement faire la distinction entre les classes en utilisant des fonctionnalités individuelles, et la formation d'un classificateur naïf Bayes et SVM sur 6 fonctionnalités et des données …
J'ai rencontré un problème dans les manuels pour estimer la moyenne. Le problème des manuels est le suivant: On suppose que points de données, , ,. . . , , ont été générés par un pdf gaussien unidimensionnel de moyenne inconnue, mais de variance connue. Dériver l'estimation ML de la …
Mathématiquement, on voit souvent que les expressions et les algorithmes pour la maximisation des attentes (EM) sont souvent plus simples pour les modèles mixtes, mais il semble que presque tout (sinon tout) qui peut être résolu avec EM peut également être résolu avec MLE (par, disons, la méthode Newton-Raphson, pour …
J'ai trouvé de nombreux articles utiles sur les variables indépendantes standardisées et les variables indépendantes centrées sur stats.stackexchange.com, mais je suis toujours un peu confus. Je vous demande une évaluation de ce que j'ai compris. De plus, si ce qui suit n'est pas correct, pourriez-vous me corriger? Comment normaliser. Les …
Disons que l'on a couru mmmchaînes MCMC parallèles où chaque chaîne a subi un rodage. Soit les chaînes résultantes désignées par X( i )1, … ,X( i )N pour i = 1 , … , m ,X1(je),…,XN(je) pour je=1,…,m, x_1^{(i)},\dots,x_N^{(i)} \quad \text{ for } i=1,\dots,m, où NNN est la longueur …
Si j'ai calculé la moyenne de 4 ensembles de données (qui ont des tailles d'échantillon différentes), puis-je alors obtenir une "moyenne globale" en calculant la "moyenne des moyennes"? Si oui, cette «moyenne des moyens» sera-t-elle la même que si j'avais combiné les données des 4 ensembles et calculé la moyenne?
J'utilise le caretpackage Rpour la formation des classificateurs SVM binaires. Pour réduire les fonctionnalités, je prétraitement avec PCA en utilisant la fonction intégrée preProc=c("pca")lors de l'appel train(). Voici mes questions: Comment le curseur sélectionne-t-il les principaux composants? Existe-t-il un nombre fixe de composants principaux sélectionnés? Les principales composantes sont-elles sélectionnées …
J'essaie de comprendre certaines descriptions de l'ACP (les deux premières proviennent de Wikipedia), emphase ajoutée: Les composants principaux ne sont garantis indépendants que si l'ensemble de données est distribué normalement conjointement . L'indépendance des principaux composants est-elle très importante? Comment puis-je comprendre cette description? L'ACP est sensible à la mise …
J'essaie de mettre en œuvre et d'apprendre un processus Dirichlet pour regrouper mes données (ou pendant que les gens apprennent automatiquement, estimer la densité). J'ai lu beaucoup d'articles sur le sujet et j'ai en quelque sorte eu l'idée. Mais je suis toujours confus; voici une série de questions, 1) Quelle …
Je suis relativement nouveau dans R et j'essaie d'adapter un modèle à des données qui se composent d'une colonne catégorielle et d'une colonne numérique (entière). La variable dépendante est un nombre continu. Les données ont le format suivant: predCateg, predIntNum, ResponseVar Les données ressemblent à ceci: ranking, age_in_years, wealth_indicator category_A, …
Je cherche à générer 450 points de données en R. Il y a trois ensembles distincts 150 chacun répartis dans une bande circulaire avec des rayons différents (à 1, 2,8 et 5). En particulier, je cherche à reproduire le premier graphique à la p546 de The Elements of Statistical Learning. …
Propriété d'invariance de MLE: si est le MLE de , alors pour toute fonction , le MLE de est . θ^θ^\hat{\theta}θθ\thetaf(θ)f(θ)f(\theta)f(θ)f(θ)f(\theta)f(θ^)f(θ^)f(\hat{\theta}) De plus, doit être une fonction biunivoque.fff Le livre dit: "Par exemple, pour estimer , le carré d'une moyenne normale, la cartographie n'est pas biunivoque." Donc, nous ne pouvons …
J'ai un problème avec la 2l.normméthode d'imputation multiniveau dans mice. Malheureusement, je ne peux pas publier d'exemple reproductible en raison de la taille de mes données - lorsque je réduis la taille, le problème disparaît. Pour une variable particulière, micegénère les erreurs et avertissements suivants: Error in chol.default(inv.sigma2[class] * X.SS[[class]] …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.