Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données



2
Comment trouver la matrice de covariance d'un polygone?
Imaginez que vous ayez un polygone défini par un ensemble de coordonnées et son centre de masse est à . Vous pouvez traiter le polygone comme une distribution uniforme avec une limite polygonale. (x1,y1)...(xn,yn)(x1,y1)...(xn,yn)(x_1,y_1)...(x_n,y_n)(0,0)(0,0)(0,0) Je recherche une méthode qui trouvera la matrice de covariance d'un polygone . Je soupçonne que …

2
Comment tester si
Supposons que j'ai trois groupes indépendants, avec respectivement .μ1, μ2, μ3μ1, μ2, μ3\mu_1,~ \mu_2,~\mu_3 Comment puis-je tester si ou non en utilisant des échantillons de chaque groupe?μ1&lt;μ2&lt;μ3μ1&lt;μ2&lt;μ3\mu_1 < \mu_2 <\mu_3n1, n2, n3n1, n2, n3n_1,~n_2,~n_3 Je souhaite connaître une méthodologie générale, pas un calcul détaillé. Je n'arrivais pas à comprendre comment …

2
Probabilité de
Supposons que et sont des variables aléatoires géométriques indépendantes avec le paramètre . Quelle est la probabilité que ?X1X1X_1X2X2X_2pppX1≥X2X1≥X2X_1 \geq X_2 Je suis confus à propos de cette question car on ne nous dit rien sur et part leur géométrie. Ne serait-ce pas parce que et peuvent être n'importe quoi …

3
Comment réduire les prédicteurs de la bonne façon pour un modèle de régression logistique
J'ai donc lu quelques livres (ou des parties d'entre eux) sur la modélisation (F. Harrell's "Regression Modeling Strategies" entre autres), car ma situation actuelle est que je dois faire un modèle logistique basé sur des données de réponse binaires. J'ai à la fois des données continues, catégoriques et binaires (prédicteurs) …


1
Pourquoi le postérieur bayésien se concentre-t-il autour du minimiseur de divergence KL?
Considérons le bayésien . De manière asymptotique, son maximum se produit à l'estimation MLE , qui maximise simplement la probabilité .θ ∣ Xθ∣X\theta\mid Xθ^θ^\hat \thetaargminθFθ( X)argminθfθ(X)\operatorname{argmin}_\theta\, f_\theta(X) Tous ces concepts - prieurs bayésiens, maximisation de la probabilité - semblent super principes et pas du tout arbitraires. Il n'y a pas …

2
Pourquoi la régression logistique est-elle bien calibrée et comment ruiner sa calibration?
Dans le scikit, apprendre des documents sur l'étalonnage des probabilités, ils comparent la régression logistique avec d'autres méthodes et remarquent que la forêt aléatoire est moins bien étalonnée que la régression logistique. Pourquoi la régression logistique est-elle bien calibrée? Comment pourrait-on ruiner l'étalonnage d'une régression logistique (pas que l'on voudrait …

2
Estimation de l'incertitude dans les problèmes d'inférence à haute dimension sans échantillonnage?
Je travaille sur un problème d'inférence de grande dimension (environ 2000 paramètres de modèle) pour lequel nous sommes capables d'effectuer de manière robuste une estimation MAP en trouvant le maximum global du log-postérieur en utilisant une combinaison d'optimisation basée sur un gradient et un algorithme génétique. J'aimerais beaucoup pouvoir faire …

1
Pourquoi des informations sur les données de validation ont-elles été divulguées si j'évalue les performances du modèle sur les données de validation lors du réglage des hyperparamètres?
Dans le Deep Learning de François Chollet avec Python, il est écrit: Par conséquent, le réglage de la configuration du modèle en fonction de ses performances sur l'ensemble de validation peut rapidement entraîner un surajustement de l'ensemble de validation, même si votre modèle n'est jamais directement formé sur celui-ci. La …


1
Comment les enfants parviennent-ils à rassembler leurs parents dans une projection PCA d'un ensemble de données GWAS?
Prenez 20 points aléatoires dans un espace de 10 000 dimensions avec chaque coordonnée iid de . Répartissez-les en 10 paires («couples») et ajoutez la moyenne de chaque paire («un enfant») à l'ensemble de données. Ensuite, faites PCA sur les 30 points résultants et tracez PC1 vs PC2.N(0,1)N(0,1)\mathcal N(0,1) Une …

4
Optimisation de la descente de gradient
J'essaie de comprendre l'optimisation de la descente de gradient dans les algorithmes ML (machine learning). Je comprends qu'il ya une fonction où le coût l'objectif est de minimiser l'erreur y - y . Dans un scénario où les poids w 1 , w 2 sont optimisés pour donner l'erreur minimale …

1
Vérifier si une pièce est juste
Un ami m'a posé la question suivante. Je n'ai pas pu l'aider mais j'espère que quelqu'un pourra me l'expliquer. Je n'ai pas pu trouver d'exemple similaire. Merci pour toute aide et explication. Q: Les résultats de 100 expériences de lancer de pièces sont enregistrés comme 0 = "Queue" et 1 …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.