Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Étant donné variable aléatoire , avec une distribution de probabilité , la matrice de corrélation est positive semi-définie, c'est-à-dire ses valeurs propres sont positifs ou nuls.nnnXiXiX_iP( X1, … , Xn)P(X1,…,Xn)P(X_1,\ldots,X_n)Cje j= E[ XjeXj] - E[ Xje] E[ Xj]Cij=E[XiXj]−E[Xi]E[Xj]C_{ij}=E[X_i X_j]-E[X_i]E[X_j] Je m'intéresse aux conditions sur qui sont nécessaires et / ou …
Si j'ai bien compris, k-NN est un algorithme d'apprentissage paresseux et il n'a pas besoin d'une phase de formation. Alors, pourquoi devons-nous utiliser .fit()avec sklearn et que se passe-t-il lorsque nous l'utilisons?
Quelle est la meilleure façon de diviser les données de séries chronologiques en ensembles train / test / validation, où l'ensemble de validation serait utilisé pour le réglage d'hyperparamètre? Nous avons 3 ans de données de vente quotidiennes, et notre plan est d'utiliser 2015-2016 comme données de formation, puis échantillonner …
Sur leur page wiki , les développeurs de Stan déclarent: Quelques principes que nous n'aimons pas: l'invariance, Jeffreys, l'entropie Au lieu de cela, je vois beaucoup de recommandations de distribution normale. Jusqu'à présent, j'ai utilisé des méthodes bayésiennes qui ne reposaient pas sur l'échantillonnage, et j'étais plutôt content d'avoir compris …
Ma compréhension de SVM est qu'elle est très similaire à une régression logistique (LR), c'est-à-dire qu'une somme pondérée de caractéristiques est passée à la fonction sigmoïde pour obtenir une probabilité d'appartenance à une classe, mais au lieu de la perte d'entropie croisée (logistique) fonction, la formation est effectuée en utilisant …
J'essaie d'implémenter l'algorithme Nelder-Mead pour optimiser une fonction. La page wikipedia sur Nelder-Mead est étonnamment claire sur l'ensemble de l'algorithme, à l'exception de son critère d'arrêt. Là, il dit malheureusement: Vérifier la convergence [clarification nécessaire] . J'ai moi-même essayé et testé quelques critères: Arrêtez si où ϵ est petit et …
Si nous considérons un arbre de décision complet (c'est-à-dire un arbre de décision non élagué), il présente une variance élevée et un faible biais. L'ensachage et les forêts aléatoires utilisent ces modèles à variance élevée et les agrègent afin de réduire la variance et ainsi améliorer la précision des prévisions. …
Au risque de rendre la question spécifique au logiciel, et avec l'excuse de son ubiquité et de ses idiosyncrasies, je veux poser des questions sur la fonction biplot()dans R, et, plus précisément, sur le calcul et le tracé de sa valeur par défaut, des flèches rouges superposées, correspondant aux variables …
Je commence par l'apprentissage en profondeur, et j'ai une question dont je n'ai pas trouvé la réponse, peut-être que je n'ai pas cherché correctement. J'ai vu cette réponse , mais on ne sait toujours pas quelle est la perte de perte de poids et comment est-elle liée à la fonction …
Les modèles d'effets mixtes linéaires sont des extensions des modèles de régression linéaire pour les données collectées et résumées en groupes. Les principaux avantages sont que les coefficients peuvent varier par rapport à une ou plusieurs variables de groupe. Cependant, je me bats avec quand utiliser le modèle à effets …
Modèle linéaire simple: x=αt+ϵtx=αt+ϵtx=\alpha t + \epsilon_t où ~ iid N ( 0 , σ 2 )ϵtϵt\epsilon_tN(0,σ2)N(0,σ2)N(0,\sigma^2) avec etV a r ( x ) = σ 2E(x)=αtE(x)=αtE(x) = \alpha tVar(x)=σ2Var(x)=σ2Var(x)=\sigma^2 AR (1): Xt=αXt−1+ϵtXt=αXt−1+ϵtX_t =\alpha X_{t-1} + \epsilon_t où ~ iid N ( 0 , σ 2 )ϵtϵt\epsilon_tN(0,σ2)N(0,σ2)N(0,\sigma^2) avec etV a …
Intrigué par une question à math.stackexchange , et en l'examinant empiriquement, je me pose des questions sur l'énoncé suivant sur la racine carrée des sommes des variables aléatoires iid. Supposons que sont des variables aléatoires iid avec une moyenne finie et une variance et . Le théorème de limite centrale …
Récemment, j'ai examiné l'algorithme XGBoost et j'ai remarqué que cet algorithme peut gérer les données manquantes (sans nécessiter d'imputation) dans la phase de formation. Je me demandais si XGboost peut gérer les données manquantes (sans nécessiter d'imputation) quand il est utilisé pour prévoir de nouvelles observations ou s'il est nécessaire …
Le mgcvpackage pour Ra deux fonctions pour ajuster les interactions des produits tensoriels: te()et ti(). Je comprends la division de base du travail entre les deux (ajustement d'une interaction non linéaire vs décomposition de cette interaction en effets principaux et interaction). Ce que je ne comprends pas, c'est pourquoi te(x1, …
Dans tous les systèmes de recommandation modernes que j'ai vus qui reposent sur la factorisation matricielle, une factorisation matricielle non négative est effectuée sur la matrice utilisateur-film. Je peux comprendre pourquoi la non-négativité est importante pour l'interprétabilité et / ou si vous voulez des facteurs clairsemés. Mais si vous ne …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.