Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai un modèle de régression qui ressemble à ceci:Oui= β0+ β1X1+ β2X2+ β3X3+ β12X1X2+ β13X1X3+ β123X1X2X3Oui=β0+β1X1+β2X2+β3X3+β12X1X2+β13X1X3+β123X1X2X3Y = \beta_0+\beta_1X_1 + \beta_2X_2 + \beta_3X_3 +\beta_{12}X_1X_2+\beta_{13}X_1X_3+\beta_{123}X_1X_2X_3 ... ou en notation R: y ~ x1 + x2 + x3 + x1:x2 + x1:x3 + x1:x2:x3 Supposons que et sont des variables catégorielles et est …
Quelqu'un connaît-il une bonne méthode pour déterminer si le regroupement à l'aide de kmeans est même approprié? Autrement dit, que se passe-t-il si votre échantillon est réellement homogène? Je sais que quelque chose comme un modèle de mélange (via mclust dans R) fournira des statistiques d'ajustement pour le cas de …
Quelqu'un peut-il suggérer comment je peux calculer la fonction de génération de moment du produit intérieur de deux vecteurs aléatoires gaussiens, chacun distribué comme , indépendamment l'un de l'autre? Y a-t-il un résultat standard disponible pour cela? Tout pointeur est très apprécié.N( 0 , σ2)N(0,σ2)\mathcal N(0,\sigma^2)
Quel serait un bon livre pour les statistiques non paramétriques. Pas seulement l'introduction mais le niveau avancé. Je regarde aussi quelque chose que je peux utiliser pour apprendre et non pour référence. En particulier, je recherche un livre qui peut contenir les bases des méthodes non paramétriques, l'inférence non paramétrique, …
Une question récente , une question connexe et une source citée , m'ont récemment fait comprendre que la correction pour les estimations d'échantillon de variance de la population est appelée correction de Bessel . Bessel était mort en 1846 ( citation de wikipedia ) et le test t a été …
Je souhaite lier des enregistrements à travers 2 ensembles de données par prénom, nom et année de naissance. Cela pourrait-il être faisable avec l'algorithme EM, et si oui, comment? Considérez l'exemple suivant dans le 1er exemple: Carl McCarthy, 1967. Je vais rechercher dans tous les enregistrements du 2e jeu de …
Dans le chapitre "Regression to the Mean" de "Thinking, Fast and Slow" de Daniel Kahneman, un exemple est donné et le lecteur est invité à prévoir les ventes des magasins individuels compte tenu des prévisions de ventes globales et des chiffres de ventes de l'année précédente . Par exemple (l'exemple …
J'essayais de créer des données de test pour la régression logistique et j'ai trouvé ce post Comment simuler des données artificielles pour la régression logistique? C'est une bonne réponse mais elle ne crée que des variables continues. Qu'en est-il d'une variable catégorielle x3 à 5 niveaux (ABCDE) associée à y …
Je crée un outil de prévision interactif (en python) pour aider à la prévision qui se fait dans mon organisation. À ce jour, le processus de prévision a été largement conduit par l'homme, les prévisionnistes assimilant les données dans leurs réseaux neuronaux naturels et utilisant leur intuition acquise pour faire …
J'ai une question concernant l'interprétation des moustaches d'un boxplot. J'ai lu ce qui suit: "En haut et en bas du rectangle, les" moustaches "montrent la plage de 1,5 fois la distance entre les quantiles de 0,25 et 0,75", mais je ne comprends pas entièrement ce que l'on entend par "distance" …
À la page 232 de "Un compagnon R pour la régression appliquée" Fox et Weisberg note Seule la famille gaussienne a une variance constante, et dans tous les autres GLM, la variance conditionnelle de y à dépend de μ ( x )XX\bf{x}μ ( x )μ(X)\mu(x) Plus tôt, ils notent que …
Quels sont les meilleurs livres pour étudier i) la variabilité des variables univariées et multivariées (réelles, données de comptage) à travers un domaine spatial. ii) échantillonnage d'une variable univariée ou multivariée en fonction de sa distribution à travers des emplacements spatiaux. (Échantillonnage spatial en bref)
Je veux savoir s'il existe un moyen possible de calculer le coefficient de Jaccard en utilisant la multiplication matricielle. J'ai utilisé ce code jaccard_sim <- function(x) { # initialize similarity matrix m <- matrix(NA, nrow=ncol(x),ncol=ncol(x),dimnames=list(colnames(x),colnames(x))) jaccard <- as.data.frame(m) for(i in 1:ncol(x)) { for(j in i:ncol(x)) { jaccard[i,j]= length(which(x[,i] & x[,j])) …
Je suis un débutant en matière de prise en charge des machines vectorielles. Existe-t-il des directives qui indiquent quel noyau (par exemple linéaire, polynomial) est le mieux adapté à un problème spécifique? Dans mon cas, je dois classer les pages Web selon qu'elles contiennent ou non des informations spécifiques, c'est-à-dire …
Je travaille actuellement avec des chaînes de Markov et j'ai calculé l'estimation du maximum de vraisemblance en utilisant les probabilités de transition suggérées par plusieurs sources (c'est-à-dire le nombre de transitions de a vers b divisé par le nombre de transitions globales de a vers d'autres nœuds). Je veux maintenant …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.