Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Et si la précision de validation était élevée mais la précision de test faible dans la recherche?
J'ai une question spécifique sur la validation dans la recherche d'apprentissage automatique. Comme nous le savons, le régime d'apprentissage automatique demande aux chercheurs de former leurs modèles sur les données de formation, de choisir parmi les modèles candidats par ensemble de validation et de rendre compte de la précision sur …

3
Splines vs régression du processus gaussien
Je sais que la régression de processus gaussienne (GPR) est une alternative à l'utilisation de splines pour ajuster des modèles flexibles non linéaires. Je voudrais savoir dans quelles situations l'une serait plus appropriée que l'autre, notamment dans le cadre de régression bayésienne. J'ai déjà examiné quels sont les avantages / …




4
De combien de données avez-vous besoin pour un réseau neuronal convolutionnel?
Si j'ai un réseau neuronal convolutif (CNN), qui a environ 1 000 000 de paramètres, combien de données d'entraînement sont nécessaires (supposons que je fais une descente de gradient stochastique)? Y a-t-il une règle d'or? Notes supplémentaires: Lorsque j'ai effectué une descente de gradient stochastique (par exemple, 64 patchs pour …

3
Choisir le K optimal pour KNN
J'ai effectué un CV 5 fois pour sélectionner le K optimal pour KNN. Et il semble que plus le K est grand, plus l'erreur est petite ... Désolé je n'avais pas de légende, mais les différentes couleurs représentent différents essais. Il y en a 5 au total et il semble …

2
Explication des degrés de liberté non entiers dans le test t avec des variances inégales
La procédure SPSS t-Test rapporte 2 analyses lors de la comparaison de 2 moyennes indépendantes, une analyse avec des variances égales supposées et une avec des variances égales non supposées. Les degrés de liberté (df) lorsque des variances égales sont supposées sont toujours des valeurs entières (et égales n-2). Les …

3
Comment choisir un nombre optimal de facteurs latents dans la factorisation matricielle non négative?
Étant donné une matrice Vm×nVm×n\mathbf V^{m \times n} , la factorisation matricielle non négative (NMF) trouve deux matrices non négatives Wm×kWm×k\mathbf W^{m \times k} et Hk×nHk×n\mathbf H^{k \times n} (c'est-à-dire avec tous les éléments ≥0≥0\ge 0 ) pour représenter la matrice décomposée comme: V≈WH,V≈WH,\mathbf V \approx \mathbf W\mathbf H, WW\mathbf …

4
Signification des caractéristiques latentes?
J'essaie de comprendre les modèles de factorisation matricielle pour les systèmes recommandés et je lis toujours les «fonctionnalités latentes», mais qu'est-ce que cela signifie? Je sais ce que signifie une fonctionnalité pour un ensemble de données de formation, mais je ne parviens pas à comprendre l'idée des fonctionnalités latentes. Chaque …

1
Comment calculer la pureté?
Dans l'analyse en grappes, comment calculer la pureté? Quelle est l'équation? Je ne cherche pas de code pour le faire pour moi. Soit ωkωk\omega_k le cluster k et cjcjc_j la classe j. La pureté est-elle pratiquement exacte? il semble que l'on additionne la quantité de classes véritablement classées par cluster …
15 clustering 

3
Calculer la divergence Kullback-Leibler en pratique?
J'utilise KL Divergence comme mesure de dissimilarité entre 2 P et Q .p.m.f.p.m.f.p.m.f. PPPQQQ =-∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))DKL(P||Q)=∑i=1Nln(PiQi)PiDKL(P||Q)=∑i=1Nln⁡(PiQi)PiD_{KL}(P||Q) = \sum_{i=1}^N \ln \left( \frac{P_i}{Q_i} \right) P_i =−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=-\sum P(X_i)ln\left(Q(X_i)\right) + \sum P(X_i)ln\left(P(X_i)\right) Si alors nous pouvons facilement calculer que P ( X i ) l n ( Q ( X i ) ) = 0 …

4
Comment conserver les variables invariantes dans le temps dans un modèle à effets fixes
J'ai des données sur les employés d'une grande entreprise italienne sur dix ans et j'aimerais voir comment l'écart entre les sexes dans les gains des hommes et des femmes a changé au fil du temps. À cette fin, je gère l'OLS groupé: yit=X′itβ+δmalei+∑t=110γtdt+εityit=Xit′β+δmalei+∑t=110γtdt+εit y_{it} = X'_{it}\beta + \delta {\rm male}_i …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.