Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
En tant que novice en statistiques et en R, j'ai eu beaucoup de mal à essayer de générer des qqplots avec un rapport d'aspect de 1: 1. ggplot2 semble offrir beaucoup plus de contrôle sur le traçage que les packages de traçage R par défaut, mais je ne vois pas …
Je me demande simplement si quelqu'un est familier avec le regroupement des entrées nominales. J'ai regardé SOM comme une solution mais apparemment, cela ne fonctionne qu'avec des fonctionnalités numériques. Existe-t-il des extensions pour les fonctionnalités catégorielles? Plus précisément, je me posais des questions sur les «jours de la semaine» comme …
J'utilise l'indexation sémantique latente pour trouver des similitudes entre les documents ( merci JMS! ) Après la réduction des dimensions, j'ai essayé le clustering k-means pour regrouper les documents en clusters, ce qui fonctionne très bien. Mais j'aimerais aller un peu plus loin et visualiser les documents comme un ensemble …
J'enseigne un cours d'introduction à la géographie économique. Pour aider mes élèves à mieux comprendre les types de pays que l'on trouve dans l'économie mondiale contemporaine et à apprécier les techniques de réduction des données, je veux construire un devoir qui crée une typologie de différents types de pays (par …
Je travaille avec de grands ensembles de données en utilisant le paquet gbm dans R. Ma matrice de prédicteur et mon vecteur de réponse sont assez clairsemés (c'est-à-dire que la plupart des entrées sont nulles). J'espérais construire des arbres de décision en utilisant un algorithme qui tire parti de cette …
J'ai utilisé un large éventail de tests pour mes données de thèse, des ANOVA paramétriques et des tests t aux tests Kruskal-Wallis non paramétriques et Mann-Whitneys, ainsi que des ANOVA bidirectionnelles transformées par rang et des GzLM avec binaire, poisson et données proportionnelles. Maintenant, je dois tout rapporter pendant que …
Je veux former un classificateur, par exemple SVM, ou une forêt aléatoire, ou tout autre classificateur. L'une des fonctionnalités de l'ensemble de données est une variable catégorielle avec 1000 niveaux. Quelle est la meilleure façon de réduire le nombre de niveaux dans cette variable. Dans R, il y a une …
Le modèle "Linear Ballistic Accumulator" (LBA) est un modèle plutôt réussi pour le comportement humain dans des tâches de décision simples et rapides. Donkin et al (2009, PDF ) fournissent un code qui permet d'estimer les paramètres du modèle compte tenu des données de comportement humain, et j'ai copié ce …
Quels sont les avantages de donner certaines valeurs initiales aux probabilités de transition dans un modèle de Markov caché? Finalement, le système les apprendra, alors quel est l'intérêt de donner des valeurs autres que aléatoires? L'algorithme sous-jacent fait-il une différence comme Baum – Welch? Si je connais très précisément les …
Le test F classique pour des sous-ensembles de variables en régression multilinéaire a la forme où est la somme des erreurs quadratiques sous le modèle "réduit", qui nichent à l'intérieur du "grand" modèle , et sont les degrés de liberté du deux modèles. Dans l'hypothèse nulle selon laquelle les variables …
Une statistique typique de traitement d'image est l'utilisation des caractéristiques de texture Haralick , qui sont 14. Je m'interroge sur le 14e de ces caractéristiques: étant donné une carte d'adjacence (que nous pouvons simplement visualiser une distribution empirique de deux entiers i , j < 256 ), elle est définie …
Fermé . Cette question est basée sur l'opinion . Il n'accepte pas actuellement les réponses. Voulez-vous améliorer cette question? Mettez à jour la question afin d'y répondre avec des faits et des citations en modifiant ce message . Fermé il y a 6 mois . Contexte J'ai lu à propos …
J'ai le nombre total d'appels reçus chaque semaine et les ai tracés sur un graphique, remontant à près de 3 ans. À l'œil nu, il semble qu'il y ait eu une baisse massive de Noël, qui ne semble pas avoir récupéré, il semble qu'il y ait eu un changement radical …
Disons que j'ai un modèle de classification prédictif basé sur une forêt aléatoire (en utilisant le package randomForest dans R). Je voudrais le configurer pour que les utilisateurs finaux puissent spécifier un élément pour lequel générer une prédiction, et cela produira une probabilité de classification. Jusqu'à présent, aucun problème. Mais …
La covariance entre deux variables aléatoires définit une mesure de leur lien linéaire entre elles. Mais que se passe-t-il si la distribution conjointe est circulaire? Il y a sûrement une structure dans la distribution. Comment cette structure est-elle extraite?
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.