Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

3
Différentes façons de produire un intervalle de confiance pour le rapport de cotes à partir de la régression logistique
J'étudie comment construire un intervalle de confiance à 95% pour l'odds ratio à partir des coefficients obtenus dans la régression logistique. Donc, compte tenu du modèle de régression logistique, log(p1−p)=α+βxlog⁡(p1−p)=α+βx \log\left(\frac{p}{1 - p}\right) = \alpha + \beta x \newcommand{\var}{\rm Var} \newcommand{\se}{\rm SE} tels que x=0x=0x = 0 pour le groupe …


5
L'apprentissage automatique est-il un rêve?
En découvrant l'apprentissage automatique, je vois différentes techniques intéressantes telles que: régler automatiquement les algorithmes avec des techniques telles que grid search, obtenir des résultats plus précis grâce à la combinaison de différents algorithmes du même "type", c'est-à-dire boosting, obtenir des résultats plus précis grâce à la combinaison de différents …


2
Justification du conjugué avant?
Outre l'utilisabilité, existe-t-il une justification épistémique (mathématique, philosophique, heuristique, etc.) pour utiliser des antérieurs conjugués? Ou est-ce juste que c'est généralement une approximation suffisamment bonne et rend les choses beaucoup plus faciles?

2
Comment transformer des valeurs négatives en logarithmes?
Je voudrais savoir comment transformer des valeurs négatives en Log(), car j'ai des données hétéroscédastiques. J'ai lu que cela fonctionne avec la formule Log(x+1)mais cela ne fonctionne pas avec ma base de données et je continue à obtenir des NaN en conséquence. Par exemple, je reçois ce message d'avertissement (je …
12 r  logarithm 

1
Pourquoi les gens n'utilisent-ils pas des RBF plus profonds ou des RBF en combinaison avec MLP?
Donc, en regardant les réseaux de neurones à fonction de base radiale, j'ai remarqué que les gens ne recommandent que l'utilisation d'une seule couche cachée, alors qu'avec les réseaux de neurones perceptron multicouches, plus de couches sont considérées comme meilleures. Étant donné que les réseaux RBF peuvent être entraînés avec …


1
Extraction automatique des mots clés: utilisation des similitudes cosinus comme fonctionnalités
J'ai une matrice de termes de document , et maintenant je voudrais extraire des mots-clés pour chaque document avec une méthode d'apprentissage supervisé (SVM, Naive Bayes, ...). Dans ce modèle, j'utilise déjà Tf-idf, Pos tag, ...MMM Mais maintenant, je me pose des questions sur les voisins. J'ai une matrice avec …


1
Comment interpréter la hauteur du tracé de densité
Comment dois-je interpréter la hauteur des tracés de densité: Par exemple, dans le graphique ci-dessus, le pic est d'environ 0,07 à x = 18. Puis-je en déduire qu'environ 7% des valeurs sont d'environ 18? Puis-je être plus précis que ça? Il y a aussi un deuxième pic à x = …

2
Pourquoi le n-gramme est-il utilisé dans l'identification de la langue du texte au lieu des mots?
Dans deux bibliothèques d'identification de langue populaires, Compact Language Detector 2 pour C ++ et détecteur de langue pour java, les deux utilisaient des n-grammes (basés sur des caractères) pour extraire des fonctionnalités de texte. Pourquoi un sac de mots (un seul mot / dictionnaire) n'est-il pas utilisé, et quels …

3
Concernant la convergence des probabilités
Soit une suite de variables aléatoires st en probabilité, où est une constante fixe. J'essaie de montrer ce qui suit: et tous deux en probabilité. Je suis ici pour voir si ma logique était bonne. Voici mon travail{Xn}n≥1{Xn}n≥1\{X_n\}_{n\geq 1}Xn→aXn→aX_n \to aa>0a>0a>0Xn−−−√→a−−√Xn→a\sqrt{X_n} \to \sqrt{a}aXn→1aXn→1\frac{a}{X_n}\to 1 TENTATIVE Pour la première partie, nous …

1
Distribution approximative du produit de N iid normal? Cas particulier μ≈0
Étant donné iid X n ≈ N ( μ X , σ 2 X ) et μ X ≈ 0 , recherchant:N≥ 30N≥30N\geq30Xn≈ N( μX, σ2X)Xn≈N(μX,σX2)X_n\approx\mathcal{N}(\mu_X,\sigma_X^2)μX≈ 0μX≈0\mu_X \approx 0 approximation précise de la distribution sous forme fermée de OuiN= ∏1NXnYN=∏1NXnY_N=\prod\limits_{1}^{N}{X_n} approximation asymptotique ( exponentielle ?) du même produit Il s'agit …

1
Quel est le nom de la méthode d'estimation de la densité où toutes les paires possibles sont utilisées pour créer une distribution de mélange normale?
Je viens de penser à une façon soignée (pas nécessairement bonne) de créer des estimations de densité unidimensionnelles et ma question est: Cette méthode d'estimation de la densité a-t-elle un nom? Sinon, s'agit-il d'un cas particulier d'une autre méthode dans la littérature? Voici la méthode: Nous avons un vecteur que …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.