Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Dernièrement, j'ai dû lire plusieurs articles en économie (un domaine que je ne connais pas trop). Une chose que j'ai remarquée est que même lorsque la variable de réponse est binaire, les modèles de régression linéaire ajustés en utilisant OLS sont omniprésents. Ma question est donc: Pourquoi la régression linéaire …
Nous avons affaire à la distribution lognormale dans un cours de finance et mon manuel indique simplement que c'est vrai, ce que je trouve un peu frustrant car mes antécédents en mathématiques ne sont pas très solides mais je veux l'intuition. Quelqu'un peut-il me montrer pourquoi c'est le cas?
Douglas Bates déclare que les modèles suivants sont équivalents «si la matrice de variance-covariance pour les effets aléatoires à valeur vectorielle a une forme spéciale, appelée symétrie composée» ( diapositive 91 dans cette présentation ): m1 <- lmer(y ~ factor + (0 + factor|group), data) m2 <- lmer(y ~ factor …
Je lisais cette question concernant la régression à grande échelle ( lien ) où whuber a souligné un point intéressant comme suit: "Presque tous les tests statistiques que vous exécutez seront si puissants qu'il est presque sûr d'identifier un effet" significatif ". Vous devez vous concentrer beaucoup plus sur l'importance …
Je voulais savoir dans quelle mesure le machine learning doit être optimisé. D'après ce que j'ai entendu, les statistiques sont un sujet mathématique important pour les personnes travaillant avec l'apprentissage automatique. De même, est-il important pour une personne travaillant avec l'apprentissage automatique de se renseigner sur l'optimisation convexe ou non …
Fermé. Cette question est hors sujet . Il n'accepte pas actuellement les réponses. Voulez-vous améliorer cette question? Mettez à jour la question afin qu'elle soit sur le sujet pour la validation croisée. Fermé il y a 2 ans . Cette ligne renvoie les 4 premières lignes de la trame combinedde …
Mon employeur mène actuellement une enquête à l'échelle de l'entreprise sur les attitudes envers le bureau, à savoir Sentiment. Dans le passé, ils ont ouvert l'enquête à tous les domaines de l'entreprise (supposons 10 départements très différents) et à tous les employés en leur sein (supposons 1000 employés au total …
Je me sens vraiment stupide même de poser une question aussi fondamentale, mais voici: Si j'ai une variable aléatoire XXX qui peut prendre des valeurs 000 et , avec et , alors si j'en tire échantillons, j'obtiendrai une distribution binomiale.111P(X=1)=pP(X=1)=pP(X=1) = pP(X=0)=1−pP(X=0)=1−pP(X=0) = 1-pnnn La moyenne de la distribution est …
Je suis tombé sur une preuve pour l'une des propriétés du modèle ARCH qui dit que si E(X2t)<∞E(Xt2)<∞\mathbb{E}(X_t^2) < \infty , alors {Xt}{Xt}\{X_t\} est stationnaire ssi ∑pi=1bi<1∑i=1pbi<1\sum_{i=1}^pb_i < 1 où le modèle ARCH est: Xt=σtϵtXt=σtϵtX_t = \sigma_t\epsilon_t σ2t=b0+b1X2t−1+...bpX2t−pσt2=b0+b1Xt−12+...bpXt−p2\sigma_t^2 = b_0 + b_1X_{t-1}^2 + ... b_pX_{t-p}^2 L'idée principale de la démonstration …
Une norme L1L1L_1 est unique (au moins en partie) car p=1p=1p=1 est à la frontière entre non convexe et convexe. Une norme L1L1L_1 est la norme convexe «la plus clairsemée» (non?). Je comprends que la norme euclidienne a ses racines dans la géométrie et elle a une interprétation claire lorsque …
J'ai des données brutes qui ont environ 20 colonnes (20 fonctionnalités). Dix d'entre elles sont des données continues et 10 d'entre elles sont catégoriques. Certaines des données catégorielles peuvent avoir comme 50 valeurs différentes (États-Unis). Après avoir prétraité les données, les 10 colonnes continues deviennent 10 colonnes préparées et les …
Supposons que nous ayons un problème de classification binaire avec des fonctionnalités principalement catégorielles. Nous utilisons un modèle non linéaire (par exemple XGBoost ou Random Forests) pour l'apprendre. Faut-il encore se préoccuper de la multi-colinéarité? Pourquoi? Si la réponse à ce qui précède est vraie, comment la combattre si l'on …
Comme je suis sûr que tout le monde ici le sait déjà, le PDF de la distribution Beta est donné parX∼B(a,b)X∼B(a,b)X \sim B(a,b) f(x)=1B(a,b)xa−1(1−x)b−1f(x)=1B(a,b)xa−1(1−x)b−1f(x) = \frac{1}{B(a,b)}x^{a-1}(1-x)^{b-1} J'ai cherché partout pour une explication des origines de cette formule, mais je ne la trouve pas. Chaque article que j'ai trouvé sur la …
Je sais qu'en régression linéaire, la variable de réponse doit être continue mais pourquoi en est-il ainsi? Je n'arrive pas à trouver quoi que ce soit en ligne qui explique pourquoi je ne peux pas utiliser de données discrètes pour la variable de réponse.
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.