Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Les données déséquilibrées à échantillonnage supérieur ou inférieur sont-elles réellement efficaces? Pourquoi?
J'entends souvent un échantillonnage à la hausse ou à la baisse des données discutées comme moyen de traiter la classification des données déséquilibrées. Je comprends que cela pourrait être utile si vous travaillez avec un classificateur binaire (par opposition à un classificateur probabiliste ou basé sur les scores) et que …

1
Pourquoi voudrais-je bootstrap lors du calcul d'un échantillon t-test indépendant? (comment justifier, interpréter et signaler un test t amorcé)
Disons que j'ai deux conditions, et ma taille d'échantillon pour les deux conditions est extrêmement faible. Disons que je n'ai que 14 observations dans la première condition et 11 dans l'autre. Je veux utiliser le test t pour tester si les différences moyennes sont significativement différentes les unes des autres. …



1
Comment utiliser le test Hausman pour la discrimination fondée sur le sexe?
J'essaie d'estimer l'écart salarial entre hommes et femmes pour les employés de bureau masculins et féminins d'une grande entreprise suédoise afin de vérifier s'il existe une discrimination fondée sur le sexe. Le test de Hausman rejette la valeur nulle selon laquelle les effets fixes individuels sont aléatoires et, par conséquent, …


2
Existe-t-il un moyen de forcer une relation entre les coefficients de régression logistique?
Je voudrais spécifier un modèle de régression logistique où j'ai la relation suivante: E[Yi|Xi]=f(βxi1+β2xi2)E[Yi|Xi]=f(βxi1+β2xi2)E[Y_i|X_i] = f(\beta x_{i1} + \beta^2x_{i2}) où est la fonction logit inverse.fff Existe-t-il un moyen "rapide" de le faire avec des fonctions R préexistantes ou existe-t-il un nom pour un modèle comme celui-ci? Je me rends compte …






2
Une personne sélectionne à plusieurs reprises les deux éléments les plus similaires sur trois. Comment modéliser / estimer une distance perceptuelle entre les objets?
Une personne reçoit trois articles, par exemple des images de visages, et est invitée à choisir quels sont les deux visages les plus similaires. Cette opération est répétée un grand nombre de fois avec différentes combinaisons de visages, chaque visage pouvant apparaître dans de nombreuses combinaisons. Compte tenu de ce …



En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.