Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Le théorème d'approximation universelle est un résultat assez célèbre pour les réseaux de neurones, déclarant essentiellement que sous certaines hypothèses, une fonction peut être uniformément approximée par un réseau de neurones avec n'importe quelle précision. Y a-t-il un résultat analogue qui s'applique aux réseaux de neurones convolutifs?
Le but de l'article était d'optimiser certains paramètres en maximisant la log-vraisemblance régularisée. Ensuite, ils calculent des dérivées partielles. Et puis les auteurs mentionnent qu'ils optimisent l'équation en utilisant L-BFGS, une procédure standard de Newton pour optimiser les fonctions lisses de nombreuses variables (pas plus de détails). Comment ça marche …
J'essaie d'obtenir une compréhension intuitive et de ressentir la différence et la différence pratique entre le terme cohérent et asymptotiquement impartial. Je connais leurs définitions mathématiques / statistiques, mais je cherche quelque chose d'intuitif. Pour moi, en regardant leurs définitions individuelles, ils semblent presque être la même chose. Je réalise …
Typiquement, lorsque l'on prend des moyennes d'échantillons aléatoires d'une distribution (avec une taille d'échantillon supérieure à 30), on obtient une distribution normale centrée autour de la valeur moyenne. Cependant, j'ai entendu dire que la distribution de Cauchy n'a pas de valeur moyenne. Quelle distribution obtient-on alors en obtenant des moyennes …
Je viens de lancer un GLM binomial négatif et voici la sortie: Call: glm.nb(formula = small ~ method + site + depth, data = size.dat, init.theta = 1.080668549, link = log) Deviance Residuals: Min 1Q Median 3Q Max -2.2452 -0.9973 -0.3028 0.3864 1.8727 Coefficients: Estimate Std. Error z value Pr(>|z|) …
Dans l'exemple suivant > m = matrix(c(3, 6, 5, 6), nrow=2) > m [,1] [,2] [1,] 3 5 [2,] 6 6 > (OR = (3/6)/(5/6)) #1 [1] 0.6 > fisher.test(m) #2 Fisher's Exact Test for Count Data data: m p-value = 0.6699 alternative hypothesis: true odds ratio is not equal …
Comment former le modèle LSTM sur plusieurs données de séries chronologiques? Cas d'utilisation: J'ai des ventes hebdomadaires de 20 000 agents depuis 5 ans. Besoin de prévoir les ventes hebdomadaires à venir pour chaque agent. Dois-je suivre une technique de traitement par lots - prendre un agent à la fois, …
Je suis confus avec la définition du modèle non paramétrique après avoir lu ce lien Modèles paramétriques vs modèles non paramétriques et répondre aux commentaires de ma autre question . À l'origine, je pensais que "paramétrique vs non paramétrique" signifie si nous avons des hypothèses de distribution sur le modèle …
Collectionner nnn métriques sur kkk objets Supposons que je collectionne nnn métriques sur kkkobjets. Je cherche des moyens valables de comparer leskkkobjets afin qu'ils puissent être "classés". Je pense que cela peut être un terrain très fréquenté (statistiques sportives comme le total des quarts, etc.) mais je ne connais pas …
Étant donné un ensemble de données avec des résultats binaires y∈{0,1}ny∈{0,1}ny\in\{0,1\}^n et une matrice prédictive X∈Rn×pX∈Rn×pX\in\mathbb{R}^{n\times p} , le modèle de régression logistique standard estime les coefficients βMLEβMLE\beta_{MLE} qui maximisent la vraisemblance binomiale. Lorsque XXX est de rang complet βMLEβMLE\beta_{MLE} est unique; lorsque la séparation parfaite n'est pas présente, elle …
Dans Kahneman et Deaton (2010) , les auteurs écrivent ce qui suit:††^\dagger Cette régression explique 37% de la variance, avec une erreur quadratique moyenne (RMSE) de 0,67852. Pour éliminer les valeurs aberrantes et les rapports de revenus peu plausibles, nous avons supprimé les observations dans lesquelles la valeur absolue de …
Il existe évidemment de nombreuses manières d'abuser des méthodes statistiques. Connaissez-vous des exemples de mauvaises pratiques statistiques qui ont été publiés pour la première fois comme des conseils explicites (par exemple, "vous devriez utiliser cette méthode pour ..."), dans des revues universitaires réputées qui ont ensuite été citées à plusieurs …
Est-il valable d'utiliser la longueur moyenne ( ) et le poids moyen ( )) d'une population donnée pour calculer l'indice de masse corporelle moyen ( ) pour cette population?hhhwwwBMI=wh2BMI=wh2BMI = \frac{w}{h^2}
Habituellement, dans la régression logistique, nous ajustons un modèle et obtenons des prédictions sur l'ensemble d'entraînement. Nous validons ensuite ces prévisions d'entraînement (quelque chose comme ici ) et décidons de la valeur seuil optimale en fonction de quelque chose comme la courbe ROC. Pourquoi ne pas intégrer la validation croisée …
Les classes prédites à partir de la régression logistique (binaire) sont déterminées en utilisant un seuil sur les probabilités d'appartenance aux classes générées par le modèle. Si je comprends bien, généralement 0,5 est utilisé par défaut. Mais la variation du seuil changera les classifications prévues. Est-ce à dire que le …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.