Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
La différence entre avec ou sans modèle d'interception dans la régression logistique
J'aime comprendre la différence entre avec ou sans modèle d'interception dans la régression logistique Y a-t-il une différence entre eux, sauf qu'avec l'interception, les coefficients considèrent le log (odds ratio) par rapport au groupe de référence et sans l'interception, ils considèrent le log (odds)? d'après ce que j'ai vu, les …

3
Régression linéaire Que nous disent la statistique F, R au carré et l'erreur-type résiduelle?
Je suis vraiment confus quant à la différence de sens concernant le contexte de régression linéaire des termes suivants: Statistique F R au carré Erreur standard résiduelle J'ai trouvé cette webstie qui m'a donné un bon aperçu des différents termes impliqués dans la régression linéaire, mais les termes mentionnés ci-dessus …

2
Scikit bonne façon d'étalonner les classificateurs avec CalibratedClassifierCV
Scikit a CalibratedClassifierCV , qui nous permet d'étalonner nos modèles sur une paire X, y particulière. Il indique également clairement quedata for fitting the classifier and for calibrating it must be disjoint. S'ils doivent être disjoints, est-il légitime de former le classificateur avec les éléments suivants? model = CalibratedClassifierCV(my_classifier) model.fit(X_train, …




4
Intervalles de prédiction pour les algorithmes d'apprentissage automatique
Je veux savoir si le processus décrit ci-dessous est valide / acceptable et toute justification disponible. L'idée: les algorithmes d'apprentissage supervisé ne supposent pas de structures / distributions sous-jacentes sur les données. À la fin de la journée, ils produisent des estimations ponctuelles. J'espère quantifier en quelque sorte l'incertitude des …

2
l'opérateur (x) signifie-t-il?
J'ai vu l' opérateur do(x)do(x)do(x) partout dans une revue de littérature que je fais sur la causalité (voir, par exemple, cette entrée wikipedia ). Cependant, je ne trouve pas de définition formelle et générale de cet opérateur. Quelqu'un peut-il me désigner une bonne référence à ce sujet? Je m'intéresse à …



1
Bibliothèques Python de modèle additif généralisé
Je sais que R a des bibliothèques gam et mgcv pour les modèles additifs généralisés. Mais j'ai du mal à trouver leurs homologues dans l'écosystème Python (les modèles de statistiques n'ont qu'un prototype dans le bac à sable). Quelqu'un connaît-il les bibliothèques python existantes? Qui sait que cela pourrait être …
14 gam 


1
GAM vs LOESS vs splines
Contexte : Je veux tracer une ligne dans un nuage de points qui n'apparaît pas paramétrique, donc j'utilise geom_smooth()in ggplotin R. Il retourne automatiquement geom_smooth: method="auto" and size of largest group is >=1000, so using gam with formula: y ~ s(x, bs = "cs"). Use 'method = x' to change …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.