Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

3
Pourquoi est-il important de faire une distinction entre régression «linéaire» et «non linéaire»?
Quelle est l'importance de la distinction entre modèles linéaires et non linéaires? La question du modèle linéaire non linéaire ou généralisé: comment référez-vous à la régression logistique, Poisson, etc.? et sa réponse a été une clarification extrêmement utile de la linéarité / non-linéarité des modèles linéaires généralisés. Il semble extrêmement …

2
Le théorème de Slutsky est-il toujours valide lorsque deux séquences convergent toutes les deux vers une variable aléatoire non dégénérée?
Je suis confus au sujet de certains détails sur le théorème de Slutsky : Soit , deux séquences d'éléments aléatoires scalaires / vectoriels / matriciels.{Xn}{Xn}\{X_n\}{Yn}{Yn}\{Y_n\} Si converge en distribution vers un élément aléatoire et converge en probabilité vers une constante , alors condition que soit inversible, où dénote la convergence …

1
Distribution de probabilité spéciale
Si p(x)p(x)p(x) est une distribution de probabilité avec des valeurs non nulles sur [0,+∞)[0,+∞)[0,+\infty) , pour quel (s) type (s) de p(x)p(x)p(x) existe-t-il une constante c>0c>0c\gt 0 telle que ∫∞0p(x)logp(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2∫0∞p(x)log⁡p(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2\int_0^{\infty}p(x)\log{\frac{ p(x)}{(1+\epsilon)p({x}(1+\epsilon))}}dx \leq c \epsilon^2pour tout0<ϵ<10<ϵ<10\lt\epsilon\lt 1? L'inégalité ci-dessus est en fait une divergence de Kullback-Leibler entre la distribution p(x)p(x)p(x) et …

1
Valeur attendue de , le coefficient de détermination, sous l'hypothèse nulle
Je suis curieux de la déclaration faite au bas de la première page de ce texte concernant l' ajustementR2adjustedRadjusted2R^2_\mathrm{adjusted} R2adjusted=1−(1−R2)(n−1n−m−1).Radjusted2=1−(1−R2)(n−1n−m−1).R^2_\mathrm{adjusted} =1-(1-R^2)\left({\frac{n-1}{n-m-1}}\right). Le texte dit: La logique de l'ajustement est la suivante: en régression multiple ordinaire, un prédicteur aléatoire explique en moyenne une proportion 1/(n–1)1/(n–1)1/(n – 1) de la variation de …

2
Dérivée d'un processus gaussien
Je crois que la dérivée d'un processus gaussien (GP) est un autre GP, et je voudrais donc savoir s'il existe des équations de forme fermée pour les équations de prédiction de la dérivée d'un GP? En particulier, j'utilise le noyau de covariance exponentielle au carré (également appelé gaussien) et je …

3
Pourquoi le softmax hiérarchique est-il meilleur pour les mots peu fréquents, alors que l'échantillonnage négatif est meilleur pour les mots fréquents?
Je me demande pourquoi le softmax hiérarchique est meilleur pour les mots peu fréquents, alors que l'échantillonnage négatif est meilleur pour les mots fréquents, dans les modèles CBOW et skip-gram de word2vec. J'ai lu la réclamation sur https://code.google.com/p/word2vec/ .

2
Comment choisir la largeur optimale du bac tout en calibrant les modèles de probabilité?
Contexte: Il y a ici d'excellentes questions / réponses sur la façon d'étalonner les modèles qui prédisent les probabilités qu'un résultat se produise. Par exemple Le score de Brier et sa décomposition en résolution, incertitude et fiabilité . Tracés d'étalonnage et régression isotonique . Ces méthodes nécessitent souvent l'utilisation d'une …

1
Coefficients identiques estimés dans le modèle Poisson vs Quasi-Poisson
En modélisant les données du nombre de sinistres dans un environnement d'assurance, j'ai commencé avec Poisson mais j'ai ensuite remarqué une surdispersion. Un Quasi-Poisson modélisait mieux la relation moyenne-variance plus élevée que le Poisson de base, mais j'ai remarqué que les coefficients étaient identiques dans les modèles de Poisson et …

4
Indique qu'un problème est bien adapté à la régression linéaire
J'apprends la régression linéaire en utilisant Introduction à l'analyse de régression linéaire par Montgomery, Peck et Vining . J'aimerais choisir un projet d'analyse de données. J'ai la pensée naïve que la régression linéaire ne convient que lorsque l'on soupçonne qu'il existe des relations fonctionnelles linéaires entre les variables explicatives et …


1
Régression logistique ordinale en Python
Je voudrais exécuter une régression logistique ordinale en Python - pour une variable de réponse à trois niveaux et avec quelques facteurs explicatifs. Le statsmodelspackage prend en charge les modèles logit binaire et logit multinomial (MNLogit), mais pas le logit ordonné. Étant donné que les mathématiques sous-jacentes ne sont pas …

1
Test d'adéquation en régression logistique; quel «ajustement» voulons-nous tester?
Je fais référence à la question et à ses réponses: comment comparer la capacité prédictive (probabilité) des modèles développés à partir de la régression logistique? par @Clark Chong et réponses / commentaires par @Frank Harrell. et à la question Degrés de liberté de dans le test de Hosmer-Lemeshowχ2χ2\chi^2 et les …




En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.