Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Pour une application, je souhaite regrouper des données (potentiellement de grande dimension) et extraire la probabilité d'appartenir à un cluster. Je considère en ce moment des cartes auto-organisées ou des k-moyens du noyau pour faire le travail. Quels sont les avantages et les inconvénients de chaque classificateur pour cette tâche? …
Dans une récente conférence, on m'a dit que, pour que l'estimation du maximum de vraisemblance soit valide, la probabilité logarithmique doit aller à moins l'infini lorsque le paramètre va à la limite de l'espace des paramètres. Mais je ne comprends pas pourquoi c'est essentiel. Supposons que la probabilité logarithmique va …
Ma question générale est: pourquoi utiliser à la bayesglmplace d'autres méthodes de classification? Remarque: Je ne m'intéresse qu'à la prédiction. J'ai une quantité décente de données (~ 100 000 obs.). J'ai l'impression que la taille de l'échantillon est suffisamment grande pour que les paramètres d'une régression logistique régulière soient distribués …
La subitisation est l'énumération rapide et précise des affichages à faible numérosité, qui se distingue du comptage par une forte non-linéarité dans le tracé des temps de réponse. Vous trouverez ci-dessous un graphique représentatif de Watson, DG, Maylor, EA et Bruce, LAM (2007). Notez que les temps de dénombrement moyens …
La nature discrète du DP le rend impropre à des applications générales dans les paramètres non paramétriques bayésiens, mais il est bien adapté au problème de placement des a priori sur les composants du mélange dans la modélisation des mélanges. Cette citation est extraite des processus hiérarchiques de Dirichlet (Teh, …
J'ai un petit ensemble de données déséquilibrées (70 positives, 30 négatives), et j'ai joué avec la sélection de modèle pour les paramètres SVM en utilisant BAC (précision équilibrée) et AUC (zone sous la courbe). J'ai utilisé différents poids de classe pour le paramètre C dans libSVM pour compenser les données …
Serait - il possible de rapprocher avec précision les quantités relatives de timbrés , Twoonies , quartiers, dimes, Nickles (et peut - être le denier fin de série) en circulation d'obtenir simplement un échantillon suffisamment grand de pièces de monnaie par l' utilisation de tous les jours? Par usage quotidien, …
J'essaie de prédire une variable de réponse en régression linéaire qui devrait toujours être positive (coût par clic). C'est un montant monétaire. Dans AdWords, vous payez Google pour les clics sur vos annonces, et un nombre négatif signifie que Google vous paie lorsque les utilisateurs cliquent sur: P Les prédicteurs …
Cette question a été soulevée dans un autre fil que j'ai commencé, alors j'ai pensé que j'obtiendrais les opinions de plus de gens à ce sujet. Ma question est Est le résiduel, e, un estimateur de l'erreur, ϵϵ\epsilon? La raison que je demande est la suivante. Dans OLS, la variance …
J'essaie de générer des ensembles de variables aléatoires liées de manière causale et j'ai commencé à le faire avec une approche de monte carlo. La ligne de base est un histogramme mesuré en 2 dimensions à partir duquel je tire des valeurs aléatoires. Dans mes exemples concrets, ces variables sont …
Je travaille avec le code forestier aléatoire de Breiman ( http://stat-www.berkeley.edu/users/breiman/RandomForests/cc_manual.htm#c2 ) pour la classification des données satellites (apprentissage supervisé). J'utilise un ensemble de données de formation et de test ayant une taille d'échantillon de 2000 et une taille variable 10. Les données sont classées en deux classes, A et …
J'ai lu les articles suivants qui ont répondu à la question que j'allais poser: Utilisez le modèle Random Forest pour faire des prédictions à partir des données des capteurs Arbre de décision pour la prédiction de sortie Voici ce que j'ai fait jusqu'à présent: j'ai comparé la régression logistique aux …
Dans une distribution de Poisson, la moyenne est égale à la variance. Je voudrais trouver un intervalle de confiance de la variance. Mon raisonnement ci-dessous est-il correct? En utilisant le théorème de la limite centrale, je construis un intervalle de confiance à 95% pour la moyenneμμ\mu L ≤ μ ≤ …
J'ai un problème de régression avec 5-6k variables. Je divise mes données en 3 ensembles qui ne se chevauchent pas: formation, validation et tests. Je m'entraîne en utilisant uniquement l'ensemble d'entraînement et je génère de nombreux modèles de régression linéaire différents en choisissant un ensemble différent de 200 variables pour …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.