Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Comment calculer l'erreur standard des rapports de cotes?
J'ai deux ensembles de données provenant d'études d'association à l'échelle du génome. Les seules informations disponibles sont le rapport de cotes et la valeur de p pour le premier ensemble de données. Pour le deuxième ensemble de données, j'ai le rapport de cotes, la valeur de p et les fréquences …

1
Test de permutation aléatoire pour la sélection des fonctionnalités
Je suis confus au sujet de l'analyse de permutation pour la sélection d'entités dans un contexte de régression logistique. Pourriez-vous fournir une explication claire du test de permutation aléatoire et comment s'applique-t-il à la sélection des fonctionnalités? Peut-être avec un algorithme et des exemples exacts. Enfin, comment se compare-t-il aux …


1
Comment interpréter les résultats de la réduction de dimensionnalité / mise à l'échelle multidimensionnelle?
J'ai effectué à la fois une décomposition SVD et une mise à l'échelle multidimensionnelle d'une matrice de données à 6 dimensions, afin de mieux comprendre la structure des données. Malheureusement, toutes les valeurs singulières sont du même ordre, ce qui implique que la dimensionnalité des données est bien de 6. …



3
Cluster efficace dans l'espace
La plupart des algorithmes de clustering que j'ai vus commencent par créer des distances de chaque point entre tous les points, ce qui devient problématique sur des ensembles de données plus importants. Y en a-t-il un qui ne le fait pas? Ou le fait-il dans une sorte d'approche partielle / …

3
Cyclisme dans l'algorithme k-means
Selon wiki, le critère de convergence le plus utilisé est "l'assignation n'a pas changé". Je me demandais si le cyclisme peut se produire si nous utilisons un tel critère de convergence? Je serais heureux si quelqu'un faisait référence à un article qui donne un exemple de cyclisme ou prouve que …


3
Traiter les niveaux de variables catégorielles «Ne sait pas / Refus»
Je modélise la prédiction du diabète à l'aide de la régression logistique. L'ensemble de données utilisé est le système de surveillance des facteurs de risque comportementaux (BRFSS) du Center for Disease Control (CDC). L'une des variables indépendantes est l'hypertension artérielle. Il est catégorique avec les niveaux suivants «Oui», «Non», «Ne …


2
Comment appliquer correctement la validation croisée dans le contexte de la sélection des paramètres d'apprentissage pour les machines à vecteurs de support?
Le merveilleux paquet libsvm fournit une interface python et un fichier "easy.py" qui recherche automatiquement les paramètres d'apprentissage (coût et gamma) qui maximisent la précision du classificateur. Dans un ensemble de paramètres d'apprentissage candidat donné, la précision est opérationnalisée par la validation croisée, mais j'ai l'impression que cela sape l'objectif …

4
Comment calculer les intervalles de confiance pour les ratios impairs regroupés dans la méta-analyse?
J'ai deux ensembles de données provenant d'études d'association à l'échelle du génome. Les seules informations disponibles sont les rapports impairs et leurs intervalles de confiance (95%) pour chaque SNP génotypé. Je veux générer un graphique forestier comparant ces deux rapports de cotes, mais je ne trouve pas le moyen de …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.