Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Régression pas à pas dans R - Comment ça marche?
J'essaie de comprendre la différence de base entre la régression pas à pas et la régression vers l'arrière dans R en utilisant la fonction step. Pour la régression pas à pas, j'ai utilisé la commande suivante step(lm(mpg~wt+drat+disp+qsec,data=mtcars),direction="both") J'ai obtenu la sortie ci-dessous pour le code ci-dessus. Pour la sélection des …
15 r  regression 


3
Régression logistique: Scikit Learn vs glmnet
J'essaie de dupliquer les résultats de sklearnla bibliothèque de régression logistique en utilisant le glmnetpackage dans R. À partir de la documentation desklearn régression logistique , il essaie de minimiser la fonction de coût sous pénalité l2 min w , c 1minw , c12wTw + C∑i = 1NJournal( exp( - …

5
Problèmes de singularité dans le modèle de mélange gaussien
Dans le chapitre 9 du livre Reconnaissance de formes et apprentissage automatique, il y a cette partie sur le modèle de mélange gaussien: Pour être honnête, je ne comprends pas vraiment pourquoi cela créerait une singularité. Quelqu'un peut-il m'expliquer cela? Je suis désolé mais je suis juste un étudiant de …


3
Pour les classificateurs linéaires, des coefficients plus importants impliquent-ils des caractéristiques plus importantes?
Je suis un ingénieur logiciel travaillant sur l'apprentissage automatique. D'après ma compréhension, la régression linéaire (comme OLS) et la classification linéaire (comme la régression logistique et SVM) font une prédiction basée sur un produit interne entre les coefficients formés et les variables caractéristiques :w⃗ w→\vec{w}x⃗ x→\vec{x} y^=f(w⃗ ⋅x⃗ )=f(∑iwixi)y^=f(w→⋅x→)=f(∑iwixi) \hat{y} …


2
Variation élevée de la validation croisée avec absence
J'ai lu maintes et maintes fois que la validation croisée "Leave-one-out" a une grande variance en raison du grand chevauchement des plis de formation. Cependant, je ne comprends pas pourquoi: les performances de la validation croisée ne devraient-elles pas être très stables (faible variance) exactement parce que les ensembles d'entraînement …



3
Un modèle de données non négatives avec agrégation de zéros (Tweedie GLM, zéro gonflé GLM, etc.) peut-il prédire des zéros exacts?
Une distribution de Tweedie peut modéliser des données asymétriques avec une masse ponctuelle à zéro lorsque le paramètre (exposant dans la relation moyenne-variance) est compris entre 1 et 2.ppp De même, un modèle gonflé à zéro (qu'il soit par ailleurs continu ou discret) peut avoir un grand nombre de zéros. …


5
Kernel SVM: Je veux une compréhension intuitive de la mise en correspondance avec un espace d'entités de dimension supérieure, et comment cela rend possible la séparation linéaire
J'essaie de comprendre l'intuition derrière les SVM du noyau. Maintenant, je comprends comment fonctionne le SVM linéaire, par lequel une ligne de décision est faite qui divise les données du mieux qu'elle peut. Je comprends également le principe derrière le portage de données vers un espace de dimension supérieure, et …


1
J'ai une ligne de meilleur ajustement. J'ai besoin de points de données qui ne changeront pas ma ligne de meilleur ajustement
Je fais une présentation sur l'ajustement des lignes. J'ai une fonction linéaire simple, . J'essaie d'obtenir des points de données dispersées que je peux mettre dans un nuage de points qui maintiendra ma ligne de meilleur ajustement dans la même équation.y=1x+by=1x+by=1x+b Je serais ravi d'apprendre cette technique dans R ou …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.