Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données





2
Normalisation des variables fictives
Mes données consistent en plusieurs mesures continues et quelques variables fictives représentant les années pendant lesquelles les mesures ont été effectuées. Maintenant, je veux apprendre un réseau neuronal avec les données. Par conséquent, je normalise zScore toutes les variables, y compris les variables fictives. Cependant, je me demande si c'est …

1
Modèles d'état caché vs modèles sans état pour la régression des séries chronologiques
C'est une question assez générique: supposons que je veuille construire un modèle pour prédire la prochaine observation sur la base des observations précédentes ( peut être un paramètre à optimiser expérimentalement). Nous avons donc essentiellement une fenêtre coulissante d'entités d'entrée pour prédire la prochaine observation.NNNNNN Je peux utiliser une approche …





1
Y aurait-il un problème de sélection de modèle si nous avions accès à un oracle qui nous a donné l'erreur de généralisation exacte?
Soit une fonction qui, compte tenu d'une hypothèse renvoie l'erreur de généralisation pour cet fixe .E(h)E(h)\mathcal{E(h)}hhhhhh Je lisais quelques notes sur la sélection du modèle et l'erreur de généralisation et il disait: "Si nous avions accès à , il n'y aurait pas de problème de sélection de modèle non plus. …

1
Comment initier doucement les épidémiologistes / collègues de la santé publique à la modélisation prédictive avancée?
Issu d'une formation en sciences sociales et en épidémiologie, mes collègues ont été formés à la régression des moindres carrés, à la régression logistique et à l'analyse de survie. Ils aiment voir des intervalles de confiance à 95% et des valeurs de p avec les coefficients des paramètres, et se …


1
Probabilité vs probabilité
J'ai des difficultés avec Likelihoods . Je comprends le théorème de Bayes p(A|B,H)=p(B|A,H)p(A|H)p(B|H)p(A|B,H)=p(B|A,H)p(A|H)p(B|H)p(A|B, \mathcal{H}) = \frac{p(B|A, \mathcal{H}) p(A|\mathcal{H})}{p(B|\mathcal{H})} qui peut être directement déduit de l'application p(A,B)=p(B)⋅p(A|B)=p(A)p(B|A)=p(B,A)p(A,B)=p(B)⋅p(A|B)=p(A)p(B|A)=p(B,A)p(A,B) = p(B) \cdot p(A|B) = p (A) p(B|A) = p(B,A). Ainsi, dans mon interprétation, lep(⋅)p(⋅)p(\cdot)Les fonctions du théorème de Bayes sont en quelque sorte …

1
Lors de l'optimisation d'un modèle de régression logistique, parfois plus de données accélèrent * les choses *. Une idée pourquoi?
J'ai joué avec la régression logistique avec divers algorithmes d'optimisation par lots (gradient conjugué, newton-raphson et diverses méthodes de quasinewton). Une chose que j'ai remarquée est que, parfois, l'ajout de données à un modèle peut en fait rendre la formation du modèle beaucoup moins longue. Chaque itération nécessite de regarder …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.