Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Cartes auto-organisées vs k-means du noyau
Pour une application, je souhaite regrouper des données (potentiellement de grande dimension) et extraire la probabilité d'appartenir à un cluster. Je considère en ce moment des cartes auto-organisées ou des k-moyens du noyau pour faire le travail. Quels sont les avantages et les inconvénients de chaque classificateur pour cette tâche? …

1
Pourquoi la probabilité logarithmique doit-elle aller à moins l'infini lorsque le paramètre s'approche de la limite de l'espace des paramètres?
Dans une récente conférence, on m'a dit que, pour que l'estimation du maximum de vraisemblance soit valide, la probabilité logarithmique doit aller à moins l'infini lorsque le paramètre va à la limite de l'espace des paramètres. Mais je ne comprends pas pourquoi c'est essentiel. Supposons que la probabilité logarithmique va …

1
Pourquoi utiliser bayesglm?
Ma question générale est: pourquoi utiliser à la bayesglmplace d'autres méthodes de classification? Remarque: Je ne m'intéresse qu'à la prédiction. J'ai une quantité décente de données (~ 100 000 obs.). J'ai l'impression que la taille de l'échantillon est suffisamment grande pour que les paramètres d'une régression logistique régulière soient distribués …

2
À la recherche du «coude» dans les données
La subitisation est l'énumération rapide et précise des affichages à faible numérosité, qui se distingue du comptage par une forte non-linéarité dans le tracé des temps de réponse. Vous trouverez ci-dessous un graphique représentatif de Watson, DG, Maylor, EA et Bruce, LAM (2007). Notez que les temps de dénombrement moyens …

1
Pourquoi le processus de Dirichlet ne convient-il pas aux applications en paramètres non paramétriques bayésiens?
La nature discrète du DP le rend impropre à des applications générales dans les paramètres non paramétriques bayésiens, mais il est bien adapté au problème de placement des a priori sur les composants du mélange dans la modélisation des mélanges. Cette citation est extraite des processus hiérarchiques de Dirichlet (Teh, …

3
Choix d'une métrique de performances de classification pour la sélection de modèle, la sélection de fonctionnalités et la publication
J'ai un petit ensemble de données déséquilibrées (70 positives, 30 négatives), et j'ai joué avec la sélection de modèle pour les paramètres SVM en utilisant BAC (précision équilibrée) et AUC (zone sous la courbe). J'ai utilisé différents poids de classe pour le paramètre C dans libSVM pour compenser les données …

2
Approximation des quantités relatives de pièces au Canada
Serait - il possible de rapprocher avec précision les quantités relatives de timbrés , Twoonies , quartiers, dimes, Nickles (et peut - être le denier fin de série) en circulation d'obtenir simplement un échantillon suffisamment grand de pièces de monnaie par l' utilisation de tous les jours? Par usage quotidien, …




3
Comment effectuer une classification Random Forest non supervisée en utilisant le code de Breiman?
Je travaille avec le code forestier aléatoire de Breiman ( http://stat-www.berkeley.edu/users/breiman/RandomForests/cc_manual.htm#c2 ) pour la classification des données satellites (apprentissage supervisé). J'utilise un ensemble de données de formation et de test ayant une taille d'échantillon de 2000 et une taille variable 10. Les données sont classées en deux classes, A et …



2
Gérer de bonnes performances sur les données de formation et de validation, mais de très mauvaises performances sur les données de test
J'ai un problème de régression avec 5-6k variables. Je divise mes données en 3 ensembles qui ne se chevauchent pas: formation, validation et tests. Je m'entraîne en utilisant uniquement l'ensemble d'entraînement et je génère de nombreux modèles de régression linéaire différents en choisissant un ensemble différent de 200 variables pour …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.