Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Quelle est la bonne façon de tester les différences significatives entre les coefficients?
J'espère que quelqu'un pourra m'aider à redresser un point de confusion. Disons que je veux tester si 2 ensembles de coefficients de régression sont significativement différents les uns des autres, avec la configuration suivante: yi=α+βxi+ϵiyi=α+βxi+ϵiy_i = \alpha + \beta x_i + \epsilon_i , avec 5 variables indépendantes. 2 groupes, de …


2
Limiter les informations mutuelles en fonction des informations mutuelles ponctuelles
Supposons que j'ai deux ensembles XXX et YYY et une distribution de probabilité conjointe sur ces ensembles p(x,y)p(x,y)p(x,y) . Soit p(x)p(x)p(x) et p(y)p(y)p(y) les distributions marginales sur XXX et YYY respectivement. Les informations mutuelles entre XXX et YYY sont définies comme suit: I(X;Y)=∑x,yp(x,y)⋅log(p(x,y)p(x)p(y))I(X;Y)=∑x,yp(x,y)⋅log⁡(p(x,y)p(x)p(y))I(X; Y) = \sum_{x,y}p(x,y)\cdot\log\left(\frac{p(x,y)}{p(x)p(y)}\right) c'est-à-dire qu'il s'agit de …

4
Calcul de la taille d'échantillon requise, estimation de la précision de la variance?
Contexte J'ai une variable avec une distribution inconnue. J'ai 500 échantillons, mais je voudrais démontrer la précision avec laquelle je peux calculer la variance, par exemple pour affirmer qu'une taille d'échantillon de 500 est suffisante. Je souhaite également connaître la taille minimale de l'échantillon qui serait nécessaire pour estimer la …




4
Si je veux un modèle interprétable, existe-t-il d'autres méthodes que la régression linéaire?
J'ai rencontré des statisticiens qui n'utilisent jamais de modèles autres que la régression linéaire pour la prédiction, car ils croient que les "modèles ML" tels que la forêt aléatoire ou le renforcement du gradient sont difficiles à expliquer ou "non interprétables". Dans une régression linéaire, étant donné que l'ensemble des …


2
Comment effectuer un test post-hoc sur le modèle lmer?
Voici ma trame de données: Group <- c("G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3") Subject <- c("S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15","S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15","S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15") Value <- c(9.832217741,13.62390117,13.19671612,14.68552076,9.26683366,11.67886655,14.65083473,12.20969772,11.58494621,13.58474896,12.49053635,10.28208078,12.21945867,12.58276212,15.42648969,9.466436017,11.46582655,10.78725485,10.66159358,10.86701127,12.97863424,12.85276916,8.672953949,10.44587257,13.62135205,13.64038394,12.45778874,8.655142642,10.65925259,13.18336949,11.96595556,13.5552118,11.8337142,14.01763101,11.37502161,14.14801305,13.21640866,9.141392359,11.65848845,14.20350364,14.1829714,11.26202565,11.98431285,13.77216009,11.57303893) data <- data.frame(Group, Subject, Value) Ensuite, je lance un modèle d'effets mixtes linéaires pour comparer la différence des 3 groupes sur "Valeur", où "Sujet" est le facteur aléatoire: library(lme4) library(lmerTest) model <- lmer (Value~Group + (1|Subject), …
18 r  lme4-nlme  post-hoc 

1
Complexité de calcul k-NN
Quelle est la complexité temporelle de l' algorithme k -NN avec une approche de recherche naïve (pas d'arbre kd ou similaire)? Je suis intéressé par sa complexité temporelle compte tenu également de l'hyperparamètre k . J'ai trouvé des réponses contradictoires: O (nd + kn), où n est la cardinalité de …





En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.