Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai deux ensembles de données provenant d'études d'association à l'échelle du génome. Les seules informations disponibles sont le rapport de cotes et la valeur de p pour le premier ensemble de données. Pour le deuxième ensemble de données, j'ai le rapport de cotes, la valeur de p et les fréquences …
Je suis confus au sujet de l'analyse de permutation pour la sélection d'entités dans un contexte de régression logistique. Pourriez-vous fournir une explication claire du test de permutation aléatoire et comment s'applique-t-il à la sélection des fonctionnalités? Peut-être avec un algorithme et des exemples exacts. Enfin, comment se compare-t-il aux …
C'est une question assez générale (c'est-à-dire pas nécessairement spécifique aux statistiques), mais j'ai remarqué une tendance dans l'apprentissage automatique et la littérature statistique où les auteurs préfèrent suivre l'approche suivante: Approche 1 : obtenir une solution à un problème pratique en formulant une fonction de coût pour laquelle il est …
J'ai effectué à la fois une décomposition SVD et une mise à l'échelle multidimensionnelle d'une matrice de données à 6 dimensions, afin de mieux comprendre la structure des données. Malheureusement, toutes les valeurs singulières sont du même ordre, ce qui implique que la dimensionnalité des données est bien de 6. …
Supposons que j'ai des observations appariées tirées iid comme pour . Soit Z_I = X_i + y_i, et on note Z_ {} i_j la j ème valeur observée de Z . Quelle est la distribution (conditionnelle) de X_ {i_j} ? (ou de manière équivalente, celle de Y_ {i_j} )i = …
Je travaille avec une série chronologique de scores d'anomalies (l'arrière-plan est la détection d'anomalies dans les réseaux informatiques). Chaque minute, j'obtiens un score d'anomalie qui me dit à quel point l'état actuel du réseau est "inattendu" ou anormal. Plus le score est élevé, plus l'état actuel est anormal. Des scores …
La plupart des algorithmes de clustering que j'ai vus commencent par créer des distances de chaque point entre tous les points, ce qui devient problématique sur des ensembles de données plus importants. Y en a-t-il un qui ne le fait pas? Ou le fait-il dans une sorte d'approche partielle / …
Selon wiki, le critère de convergence le plus utilisé est "l'assignation n'a pas changé". Je me demandais si le cyclisme peut se produire si nous utilisons un tel critère de convergence? Je serais heureux si quelqu'un faisait référence à un article qui donne un exemple de cyclisme ou prouve que …
J'ai ajusté deux modèles d'équations d'estimation généralisées (GEE) à mes données: 1) Modèle 1: le résultat est une variable longitudinale Oui / Non (A) (année 1,2,3,4,5) avec prédicteur continu longitudinal (B) pour les années 1,2,3,4,5. 2) Modèle 2: Le résultat est la même variable longitudinale Oui / Non (A), mais …
Je modélise la prédiction du diabète à l'aide de la régression logistique. L'ensemble de données utilisé est le système de surveillance des facteurs de risque comportementaux (BRFSS) du Center for Disease Control (CDC). L'une des variables indépendantes est l'hypertension artérielle. Il est catégorique avec les niveaux suivants «Oui», «Non», «Ne …
Le contexte: J'ai deux ensembles de données provenant du même questionnaire sur deux ans. Chaque question est mesurée à l'aide d'une échelle de 5 Likert. Q1: Schéma de codage Pour le moment, j'ai codé mes réponses sur un intervalle [0, 1], 0 signifiant "la réponse la plus négative", 1 signifiant …
Le merveilleux paquet libsvm fournit une interface python et un fichier "easy.py" qui recherche automatiquement les paramètres d'apprentissage (coût et gamma) qui maximisent la précision du classificateur. Dans un ensemble de paramètres d'apprentissage candidat donné, la précision est opérationnalisée par la validation croisée, mais j'ai l'impression que cela sape l'objectif …
J'ai deux ensembles de données provenant d'études d'association à l'échelle du génome. Les seules informations disponibles sont les rapports impairs et leurs intervalles de confiance (95%) pour chaque SNP génotypé. Je veux générer un graphique forestier comparant ces deux rapports de cotes, mais je ne trouve pas le moyen de …
Une équipe de football anglaise joue une série de matchs contre différents adversaires de capacités variables. Un bookmaker propose des cotes pour chaque match, qu'il s'agisse d'une victoire à domicile, d'une victoire à l'extérieur ou d'un match nul. À mi-chemin de la saison, l'équipe a joué nnn matchs et en …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.