Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


5
Régression logistique par étapes et échantillonnage
J'ajuste une régression logistique pas à pas sur un ensemble de données dans SPSS. Dans la procédure, j'adapte mon modèle à un sous-ensemble aléatoire qui est d'env. 60% de l'échantillon total, soit environ 330 cas. Ce que je trouve intéressant, c'est que chaque fois que je rééchantillonne mes données, différentes …

1
LARS vs descente coordonnée pour le lasso
Quels sont les avantages et les inconvénients de l'utilisation de LARS [1] par rapport à l'utilisation de la descente de coordonnées pour ajuster la régression linéaire régularisée L1? Je m'intéresse principalement aux aspects de performance (mes problèmes ont tendance à avoir Ndes centaines de milliers et p<20). Cependant, toute autre …


2
Ressources en ligne pour l'apprentissage des statistiques, exercices (avec solutions)?
Je travaille actuellement comme assistant d'enseignement dans mon université, dans un cours d'introduction aux statistiques (pour les étudiants en médecine). Hors ligne, il existe de nombreux livres contenant des informations pour aider l'enseignant. Cependant, ce que je suis intéressé de savoir, c'est si vous pouvez m'orienter vers de (bonnes) ressources …

1
Calcul de la médiane des médianes
Je fais un tas de rapports immobiliers et le prix médian est souvent rapporté, notamment par la NAR (National Association Of Realtors). Autant que je sache, ils n'obtiennent que la médiane des prix de l'immobilier dans chaque région. Ma question est la suivante: comment calculer la médiane nationale, compte tenu …
13 median 


1
Interprétation / utilisation de la densité du noyau
C'est peut-être une question naïve, mais voilà. Si j'ai un ensemble de données empiriques et que j'y ajuste une densité de noyau, puis que j'obtiens une nouvelle valeur unique qui peut éventuellement provenir du même processus qui a généré l'ensemble de données d'origine, puis-je attribuer une probabilité que cette nouvelle …
13 kde 


2
Comprendre les critères AIC et Schwarz
Je gère un modèle logistique. L'ensemble de données du modèle réel comporte plus de 100 variables, mais je choisis un ensemble de données de test dans lequel il y a environ 25 variables. Avant cela, j'ai également créé un ensemble de données contenant 8 à 9 variables. On me dit …



4
Tests post hoc en ANCOVA
Question: Quelle est la bonne méthode pour effectuer des tests post hoc des différences entre les moyennes d'un groupe après ajustement pour l'effet d'une covariable? Exemple prototype: Quatre groupes, 30 participants par groupe (par exemple, quatre populations différentes de psychologie clinique) La variable dépendante est numérique (par exemple, les scores …

3
Une explication facile pour le tracé des coordonnées parallèles
J'ai lu et vu beaucoup de tracés de coordonnées parallèles. Quelqu'un peut-il répondre à l'ensemble des questions suivantes: Que sont les tracés de coordonnées parallèles (PCP) en termes simples, pour qu'un profane puisse comprendre? Une explication mathématique avec une certaine intuition si possible Quand le PCP est-il utile et quand …

1
Comment effectuer efficacement la modélisation du réseau neuronal?
Quel devrait être le rapport entre le nombre d'observations et le nombre de variables? Comment détecter le sur-ajustement dans le modèle de réseau neuronal et comment éviter le sur-ajustement? Si je veux effectuer une classification avec Neural Network, les cours doivent-ils avoir une fréquence égale? Sil te plait aide moi.

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.