Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai lu que l'estimateur 2SLS est toujours cohérent même avec la variable endogène binaire ( http://www.stata.com/statalist/archive/2004-07/msg00699.html ). Dans un premier temps, un modèle de traitement probit sera exécuté au lieu d'un modèle linéaire. Existe-t-il une preuve formelle pour montrer que 2SLS est toujours cohérent même lorsque la 1ère étape est …
J'ai lu un peu sur le renforcement des algorithmes pour les tâches de classification et Adaboost en particulier. Je comprends que le but d'Adaboost est de prendre plusieurs "apprenants faibles" et, à travers un ensemble d'itérations sur les données de formation, de pousser les classificateurs à apprendre à prédire les …
J'utilise actuellement Scikit learn avec le code suivant: clf = svm.SVC(C=1.0, tol=1e-10, cache_size=600, kernel='rbf', gamma=0.0, class_weight='auto') puis ajuster et prévoir pour un ensemble de données avec 7 étiquettes différentes. J'ai une sortie bizarre. Quelle que soit la technique de validation croisée que j'utilise, l'étiquette prédite sur l'ensemble de validation sera …
L'un des problèmes importants auxquels sont confrontés les prévisionnistes est de savoir si la série donnée peut être prévue ou non? Je suis tombé sur un article intitulé " L'entropie comme indicateur a priori de la prévisibilité " de Peter Catt qui utilise l' entropie approximative (ApEn) comme mesure relative …
Je joue avec l'ensemble de données sur le cancer du sein et j'ai créé un nuage de points de tous les attributs pour avoir une idée de ceux qui ont le plus d'effet sur la prédiction de la classe malignant(bleu) de benign(rouge). Je comprends que la ligne représente l'axe des …
Supposons que j'ai un -vecteur Y de variables dépendantes et un N -vecteur X de variable indépendante. Lorsque Y est tracé contre 1NNNYOuiYNNNXXXYOuiY , je vois qu'il y a une relation linéaire (tendance à la hausse) entre les deux. Maintenant, cela aussi signifie qu'il ya une tendancebaisse linéaire entreYetX.1X1X\frac{1}{X}YYYXXX Maintenant, …
De nombreux manuels de statistiques fournissent une illustration intuitive de ce que sont les vecteurs propres d'une matrice de covariance: Les vecteurs u et z forment les vecteurs propres (enfin les axes propres). C'est logique. Mais la seule chose qui me déroute, c'est que nous extrayons des vecteurs propres de …
Je suis coincé sur la façon de résoudre ce problème. Donc, nous avons deux séquences de variables aléatoires, et Y i pour i = 1 , . . . , n . Maintenant, X et Y sont des distributions exponentielles indépendantes avec les paramètres λ et μ . Cependant, au …
Avant de poser cette question, j'ai fait une recherche sur notre site et j'ai trouvé beaucoup de questions similaires (comme ici , ici et ici ). Mais je pense que ces questions connexes n'ont pas été bien répondues ou discutées, je voudrais donc soulever à nouveau cette question. Je pense …
J'utilise l'analyse sémantique latente pour représenter un corpus de documents dans un espace dimensionnel inférieur. Je veux regrouper ces documents en deux groupes en utilisant k-means. Il y a plusieurs années, j'ai fait cela en utilisant le gensim de Python et en écrivant mon propre algorithme k-means. J'ai déterminé les …
Je connais quelques bons exemples de paires de variables aléatoires corrélées qui sont légèrement normales mais pas conjointement normales. Voir cette réponse de Dilip Sarwate , et celle de Cardinal . Je connais également un exemple de deux variables aléatoires normales dont la somme n'est pas normale. Voir cette réponse …
J'ai récemment entendu une histoire dans laquelle quelqu'un a dit que s'il voulait tuer quelqu'un (et s'en tirer), il le ferait avec sa voiture. Ils ont cité diverses statistiques sur le nombre de décès liés à l'automobile (y compris les piétons en voiture) couplées à des statistiques supplémentaires sur le …
Le problème Je veux ajuster les paramètres du modèle d'une population de mélange 2-gaussien simple. Étant donné tout le battage médiatique autour des méthodes bayésiennes, je veux comprendre si pour ce problème l'inférence bayésienne est un meilleur outil que les méthodes d'ajustement traditionnelles. Jusqu'à présent, MCMC fonctionne très mal dans …
Supposons que j'ai un petit échantillon, par exemple N = 100 et deux classes. Comment dois-je choisir la formation, la validation croisée et la taille des ensembles de tests pour l'apprentissage automatique? Je choisirais intuitivement Taille de l'ensemble d'entraînement: 50 Ensemble de validation croisée taille 25, et Taille du test: …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.