Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Récemment, j'ai lu un article de Yann Dauphin et al. Identifier et attaquer le problème du point de selle dans l'optimisation non convexe de haute dimension , où ils introduisent un algorithme de descente intéressant appelé Saddle-Free Newton , qui semble être exactement adapté pour l'optimisation du réseau neuronal et …
Dans Mostly Harmless Econometrics: An Empiricist's Companion (Angrist et Pischke, 2009: page 209), je lis ce qui suit: (...) En fait, le 2SLS (par exemple, l'estimateur Wald simple) qui vient d'être identifié est approximativement sans biais . Ceci est difficile à montrer formellement parce que le 2SLS juste identifié n'a …
La régression pas à pas avait été surutilisée dans de nombreux articles biomédicaux dans le passé, mais cela semble s'améliorer avec une meilleure éducation de ses nombreux problèmes. De nombreux critiques plus âgés le demandent cependant. Quelles sont les circonstances dans lesquelles la régression pas à pas a un rôle …
Prémisse: cela peut être une question stupide. Je ne connais que les déclarations sur les propriétés asymptotiques MLE, mais je n'ai jamais étudié les preuves. Si je le faisais, je ne poserais peut-être pas ces questions, ou je réaliserais peut-être que ces questions n'ont pas de sens ... alors s'il …
Je veux calculer l'AICc d'un modèle de régression de crête. Le problème est le nombre de paramètres. Pour la régression linéaire, la plupart des gens suggèrent que le nombre de paramètres est égal au nombre de coefficients estimés plus sigma (la variance de l'erreur). En ce qui concerne la régression …
J'essaie de calculer l'intervalle crédible à 95% de la distribution postérieure suivante. Je n'ai pas pu trouver la fonction dans R pour cela mais l'approche ci-dessous est-elle correcte? x <- seq(0.4,12,0.4) px <- c(0,0, 0, 0, 0, 0, 0.0002, 0.0037, 0.018, 0.06, 0.22 ,0.43, 0.64,0.7579, 0.7870, 0.72, 0.555, 0.37, 0.24, …
Contexte: J'essaie de suivre l'examen de Princeton de l'estimation MLE pour GLM . Je comprends les bases de l' estimation MLE: likelihood, score, observée et attendue Fisher informationet la Fisher scoringtechnique. Et je sais comment justifier une régression linéaire simple avec une estimation MLE . La question: Je ne comprends …
Nous avons deux modèles qui utilisent la même méthode pour calculer la vraisemblance logarithmique et l'AIC pour l'un est inférieur à l'autre. Cependant, celui avec l'AIC inférieur est beaucoup plus difficile à interpréter. Nous avons du mal à décider si cela vaut la peine d'introduire la difficulté et nous avons …
Les fonctions CDF empiriques sont généralement estimées par une fonction de pas. Y a-t-il une raison pour laquelle cela se fait de cette manière et non en utilisant une interpolation linéaire? La fonction pas a-t-elle des propriétés théoriques intéressantes qui nous font la préférer? Voici un exemple des deux: ecdf2 …
J'ai ajusté le modèle à l'aide caret, mais j'ai ensuite réexécuté le modèle à l'aide du gbmpackage. Je crois comprendre que le caretpackage utilise gbmet que la sortie doit être la même. Cependant, un simple test rapide utilisant data(iris)montre une différence dans le modèle d'environ 5% en utilisant RMSE et …
Je suis plutôt nouveau dans le domaine des processus gaussiens et comment ils sont appliqués dans l'apprentissage automatique. Je continue de lire et d'entendre que les fonctions de covariance sont l'attraction principale de ces méthodes. Quelqu'un pourrait-il donc expliquer de manière intuitive ce qui se passe dans ces fonctions de …
PRÉFACE: Je ne me soucie pas des avantages d'utiliser ou non un seuil, ni de la façon de choisir un seuil. Ma question est purement mathématique et due à la curiosité. La régression logistique modélise la probabilité conditionnelle postérieure de la classe A par rapport à la classe B et …
Soit un échantillon aléatoire de la distribution uniforme sur , où a <b . Soit Y_1 et Y_n les statistiques de commande les plus grandes et les plus petites. Montrer que la statistique (Y_1, Y_n) est une statistique suffisante complétée conjointement pour le paramètre \ theta = (a, b) . …
Considérons le modèle de régression linéaire y=Xβ+uy=Xβ+u\mathbf{y}=\mathbf{X\beta}+\mathbf{u} , u∼N(0,σ2I)u∼N(0,σ2I)\mathbf{u}\sim N(\mathbf{0},\sigma^2\mathbf{I}) , E(u∣X)=0E(u∣X)=0E(\mathbf{u}\mid\mathbf{X})=\mathbf{0} . Soit vs .H 1 : σ 2 0 ≠ σ 2H0:σ20=σ2H0:σ02=σ2H_0: \sigma_0^2=\sigma^2H1:σ20≠σ2H1:σ02≠σ2H_1: \sigma_0^2\neq\sigma^2 On peut en déduire que , où . Et est la notation typique de la matrice de l'annihilateur, , où est la variable dépendante …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.