Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


5
Quel langage de programmation recommandez-vous pour prototyper un problème d'apprentissage automatique?
Travaille actuellement dans Octave, mais en raison de la mauvaise documentation, les progrès sont très lents. Quelle langue est facile à apprendre et à utiliser et bien documentée pour résoudre les problèmes d'apprentissage automatique? Je cherche à prototyper sur un petit ensemble de données (des milliers d'exemples), donc la vitesse …



1
Puis-je utiliser un test t apparié lorsque les échantillons sont normalement distribués mais que leur différence ne l'est pas?
J'ai des données d'une expérience où j'ai appliqué deux traitements différents dans des conditions initiales identiques, produisant un entier entre 0 et 500 dans chaque cas comme résultat. Je veux utiliser un test t apparié pour déterminer si les effets produits par les deux traitements sont significativement différents. Les résultats …

1
Qu'est-ce qu'un bon indice du degré de violation de la normalité et quelles étiquettes descriptives pourraient être attachées à cet indice?
Le contexte: Dans une question précédente, @Robbie a demandé dans une étude portant sur environ 600 cas pourquoi les tests de normalité suggéraient une non-normalité significative alors que les graphiques suggéraient des distributions normales . Plusieurs personnes ont souligné que les tests de signification de la normalité ne sont pas …





3
Estimation des paramètres d'un processus spatial
On me donne une grille de valeurs entières positives. Ces chiffres représentent une intensité qui devrait correspondre à la force de croyance d'une personne occupant cet emplacement de grille (une valeur plus élevée indiquant une croyance plus élevée). Une personne aura en général une influence sur plusieurs cellules de la …


4
Comment réaliser l'ACP pour des données de très grande dimensionnalité?
Pour effectuer une analyse en composantes principales (ACP), vous devez soustraire la moyenne de chaque colonne des données, calculer la matrice des coefficients de corrélation, puis trouver les vecteurs propres et les valeurs propres. Eh bien, c'est plutôt ce que j'ai fait pour l'implémenter en Python, sauf qu'il ne fonctionne …
12 pca  python 


1
Une recherche de grille SVM doit-elle montrer une région de haute précision avec de faibles précisions autour?
J'ai 12 ensembles d'entraînement positifs (cellules cancéreuses traitées avec des médicaments avec chacun des 12 mécanismes d'action différents). Pour chacun de ces ensembles d'entraînement positifs, je voudrais former une machine à vecteur de support pour la distinguer d'un ensemble négatif de taille égale échantillonné de l'expérience. Chaque ensemble a entre …
12 svm 

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.