Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Comment gérer la modification de la longueur du vecteur d'entrée avec les réseaux de neurones
Je veux former un réseau neuronal avec une séquence de caractères comme vecteur d'entrée. Les exemples d'apprentissage ont une longueur différente et pour cette raison, je ne sais pas comment les représenter. Disons que j'ai deux exemples de séquences, voici des noms: john doe maurice delanoe Le premier exemple est …



2
Sélection de nœuds pour un GAM
Lors de la sélection d'un nombre approprié de nœuds pour un GAM, on peut vouloir prendre en compte le nombre de données et d'incréments sur l'axe des x. Et si nous avons 100 incréments sur l'axe des x avec 1000 points de données à chaque incrément. L'info ici dit: S'ils …
9 r  gam  splines 

4
Comment vérifie-t-on la causalité?
Après avoir montré que deux quantités sont corrélées, comment déduire que la relation est causale? Et en plus lequel cause quoi? Or, en théorie, on peut utiliser une «assignation aléatoire» (quel que soit le bon mot), pour rompre tout lien accidentel pouvant exister entre deux variables. Mais dans certains cas, …

1
Dérivées de gradient et de vecteur: vecteur ligne ou colonne?
Un grand nombre de références (y compris wikipedia et http://www.atmos.washington.edu/~dennis/MatrixCalculus.pdf et http://michael.orlitzky.com/articles/the_derivative_of_a_quadratic_form.php ) définissent la dérivée d'un fonction par un vecteur comme dérivées partielles de la fonction disposée en ligne (donc une dérivée d'une fonction à valeur scalaire est un vecteur de ligne). Dans cette convention, le gradient et la …

4
Comment les données sont-elles générées dans le cadre bayésien et quelle est la nature du paramètre qui génère les données?
J'essayais de réapprendre les statistiques bayésiennes (à chaque fois que je pensais l'avoir enfin, quelque chose d'autre apparaissait que je n'avais pas envisagé plus tôt ...) mais il n'était pas clair (pour moi) quel était le processus de génération de données dans le cadre bayésien est en fait. Le cadre …

1
Surajustement du réseau neuronal
J'ai appris qu'un sur-ajustement peut être détecté en traçant l'erreur d'apprentissage et l'erreur de test en fonction des époques. Comme dans: J'ai lu ce blog où ils disent que le réseau neuronal, net5 est trop adapté et ils fournissent ce chiffre: Ce qui est étrange pour moi, car l'erreur de …

1
Interprétation de la causalité de Granger avec R
J'ai trois variables macroéconomiques (ICS - sentiment des consommateurs, ER - taux d'emploi, DGO - commande de biens durables) et j'ai effectué des tests de causalité de Granger en R sur eux. Je ne sais pas vraiment comment interpréter les résultats d'un test de Granger. Quelqu'un pourrait-il m'aider à donner …

1
Peut-on modéliser des facteurs non aléatoires comme aléatoires dans un plan à plusieurs niveaux / hiérarchique?
La distinction entre les variables strictement aléatoires (qui devraient être modélisées en tant que telles) et les variables non aléatoires qui, selon certains, pourraient être modélisées comme aléatoires s'il s'agit d'un modèle hiérarchique / à plusieurs niveaux, est floue pour moi. Bates et Bolker illustrent les effets aléatoires avec des …



1
Qualité de l'ajustement pour les données discrètes: meilleure approche
Les données: Aux fins de cette question / communication, nous pouvons supposer que les données ressemblent rnbinom(1000,size=0.1,prob=0.01)à R, qui génère un échantillon aléatoire de 1 000 observations à partir d'une distribution binomiale négative (avec size=0.1et probabilité de succès prob=0.01). Il s'agit de la paramétrisation où la variable aléatoire représente le …

3
La meilleure façon de regrouper une matrice d'adjacence
J'ai eu du mal à interpréter les grappes résultantes d'une matrice d'adjacence. J'ai 200 matrices relativement grandes représentant des sujets qui contiennent des corrélations partielles (scores z) de séries chronologiques (données neuronales). L'objectif est de regrouper ces 210 matrices et de détecter toute communauté potentielle non découverte. J'ai donc fait …

1
Équivalence entre un modèle anova à mesures répétées et un modèle mixte: lmer vs lme, et symétrie composée
J'ai du mal à obtenir des résultats équivalents entre un aovmodèle de mesures répétées inter-intra et un lmermodèle mixte. Mes données et mon script se présentent comme suit data=read.csv("https://www.dropbox.com/s/zgle45tpyv5t781/fitness.csv?dl=1") data$id=factor(data$id) data id FITNESS TEST PULSE 1 1 pilates CYCLING 91 2 2 pilates CYCLING 82 3 3 pilates CYCLING 65 …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.