Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Que font les «effets» de la fonction dans R?
Je ne comprends pas l'explication du Rfichier d'aide de pour les effets () : Pour un modèle linéaire ajusté par lmou aov, les effets sont les valeurs de degré de liberté non corrélées obtenues en projetant les données sur les sous-espaces orthogonaux successifs générés par la décomposition QR pendant le …
17 r  regression 

1
Les modèles résiduels autocorrélés restent-ils même dans les modèles avec des structures de corrélation appropriées, et comment sélectionner les meilleurs modèles?
Le contexte Cette question utilise R, mais concerne des problèmes statistiques généraux. J'analyse les effets des facteurs de mortalité (% de mortalité due aux maladies et au parasitisme) sur le taux de croissance de la population de papillons au fil du temps, où les populations de larves ont été échantillonnées …

2
Le codage des variables qualitatives en régression conduit à des «singularités»
J'ai une variable indépendante appelée "qualité"; cette variable a 3 modalités de réponse (mauvaise qualité; qualité moyenne; haute qualité). Je veux introduire cette variable indépendante dans ma régression linéaire multiple. Lorsque j'ai une variable indépendante binaire (variable fictive, je peux coder 0/ 1), il est facile de l'introduire dans un …


1
Questions sur le principe de vraisemblance
J'essaie actuellement de comprendre le principe de vraisemblance et je ne comprends vraiment pas du tout. Donc, j'écrirai toutes mes questions sous forme de liste, même si ce sont des questions assez basiques. Que signifie exactement l'expression «toutes les informations» dans le contexte de ce principe? (comme dans toutes les …

3
Analogie de la corrélation de Pearson pour 3 variables
Je voudrais savoir si une "corrélation" de trois variables est quelque chose, et si quoi, qu'est-ce que ce serait? Coefficient de corrélation du moment du produit de Pearson E{(X−μX)(Y−μY)}Var(X)Var(Y)−−−−−−−−−−−−√E{(X−μX)(Y−μY)}Var(X)Var(Y)\frac{\mathrm{E}\{(X-\mu_X)(Y-\mu_Y)\}}{\sqrt{\mathrm{Var}(X)\mathrm{Var}(Y)}} Maintenant, la question pour 3 variables: Est E{(X−μX)(Y−μY)(Z−μZ)}Var(X)Var(Y)Var(Z)−−−−−−−−−−−−−−−−−−√E{(X−μX)(Y−μY)(Z−μZ)}Var(X)Var(Y)Var(Z)\frac{\mathrm{E}\{(X-\mu_X)(Y-\mu_Y)(Z-\mu_Z)\}} {\sqrt{\mathrm{Var}(X)\mathrm{Var}(Y)\mathrm{Var}(Z)}} n'importe quoi? Dans R, cela semble être quelque chose d'interprétable: > a …

2
Comment ajuster une distribution discrète pour compter des données?
J'ai l'histogramme suivant des données de comptage. Et je voudrais y adapter une distribution discrète. Je ne sais pas comment je dois procéder. Dois-je d'abord superposer une distribution discrète, disons distribution binomiale négative, sur l'histogramme afin d'obtenir les paramètres de la distribution discrète, puis d'exécuter un test de Kolmogorov-Smirnov pour …

2
Comparaison de l'AIC d'un modèle et de sa version transformée en journal
L'essence de ma question est la suivante: Soit Y∈RnY∈RnY \in \mathbb{R}^n une variable aléatoire normale multivariée de moyenne μμ\mu et de matrice de covariance ΣΣ\Sigma . Soit Z:=log(Y)Z:=log⁡(Y)Z := \log(Y) , c'est-à-dire Zi=log(Yi),i∈{1,…,n}Zi=log⁡(Yi),i∈{1,…,n}Z_i = \log(Y_i), i \in \{1,\ldots,n\} . Comment comparer l'AIC d'un ajustement de modèle aux réalisations observées de …

1
Comment comprendre l'effet de RBF SVM
Comment puis-je comprendre ce que fait le noyau RBF dans SVM? Je veux dire que je comprends les maths, mais y a-t-il un moyen d'avoir une idée quand ce noyau sera utile? Les résultats de kNN seraient-ils liés à SVM / RBF puisque le RBF contient des distances vectorielles? Existe-t-il …
17 svm  kernel-trick 


2
Comment calculer la variance de l'estimateur OLS
Je sais que β0^=y¯−β1^x¯β0^=y¯−β1^x¯\hat{\beta_0}=\bar{y}-\hat{\beta_1}\bar{x} et voici jusqu'où je suis arrivé quand j'ai calculé la variance: Var(β0^)=Var(y¯−β1^x¯)=Var((−x¯)β1^+y¯)=Var((−x¯)β1^)+Var(y¯)=(−x¯)2Var(β1^)+0=(x¯)2Var(β1^)+0=σ2(x¯)2∑i=1n(xi−x¯)2Var(β0^)=Var(y¯−β1^x¯)=Var((−x¯)β1^+y¯)=Var((−x¯)β1^)+Var(y¯)=(−x¯)2Var(β1^)+0=(x¯)2Var(β1^)+0=σ2(x¯)2∑i=1n(xi−x¯)2\begin{align*} Var(\hat{\beta_0}) &= Var(\bar{y} - \hat{\beta_1}\bar{x}) \\ &= Var((-\bar{x})\hat{\beta_1}+\bar{y}) \\ &= Var((-\bar{x})\hat{\beta_1})+Var(\bar{y}) \\ &= (-\bar{x})^2 Var(\hat{\beta_1}) + 0 \\ &= (\bar{x})^2 Var(\hat{\beta_1}) + 0 \\ &= \frac{\sigma^2 (\bar{x})^2}{\displaystyle\sum\limits_{i=1}^n (x_i - \bar{x})^2} \end{align*} mais c'est tout …


1
Variance pondérée, une fois de plus
La variance pondérée non biaisée a déjà été abordée ici et ailleurs, mais il semble toujours y avoir une confusion surprenante. Il semble y avoir un consensus sur la formule présentée dans le premier lien ainsi que dans l'article Wikipedia . Cela ressemble également à la formule utilisée par R, …

4
Dans quelles conditions les estimateurs ponctuels bayésiens et fréquentistes coïncident-ils?
Avec un a priori plat, les estimateurs ML (fréquentiste - maximum de vraisemblance) et MAP (bayésien - maximum a posteriori) coïncident. Plus généralement, cependant, je parle d'estimateurs ponctuels dérivés comme optimiseurs d'une fonction de perte. C'est à dire (Bayésien) x (x^(.)=argminE(L(X-x^(y))|y) (Bayésien) x^(.)=argminE(L(X−x^(y))|y) (Bayesian) \hat x(\,. ) = \text{argmin} \; …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.