Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai une grande matrice (650K lignes * 62 colonnes) de données binaires (0-1 entrées uniquement). La matrice est généralement clairsemée: environ 8% est remplie. Je voudrais le regrouper en 5 groupes - disons nommés de 1 à 5. J'ai essayé le regroupement hiérarchique et il n'a pas pu gérer la …
Je n'arrive pas à trouver une méthode générale pour dériver des erreurs standard n'importe où. J'ai regardé sur Google, ce site Web et même dans des manuels, mais tout ce que je peux trouver, c'est la formule des erreurs standard pour la moyenne, la variance, la proportion, le rapport de …
Ayant rencontré cette discussion, je soulève la question des conventions relatives aux intervalles de confiance rétrospectifs. Selon cet article, la couverture nominale CI rétrotransformée pour la moyenne d'une variable aléatoire log-normale est: UCL(X)=exp(Y+var(Y)2+zvar(Y)n+var(Y)22(n−1)−−−−−−−−−−−−√) UCL(X)=exp(Y+var(Y)2+zvar(Y)n+var(Y)22(n−1))\ UCL(X)= \exp\left(Y+\frac{\text{var}(Y)}{2}+z\sqrt{\frac{\text{var}(Y)}{n}+\frac{\text{var}(Y)^2}{2(n-1)}}\right) LCL(X)=exp(Y+var(Y)2−zvar(Y)n+var(Y)22(n−1)−−−−−−−−−−−−√) LCL(X)=exp(Y+var(Y)2−zvar(Y)n+var(Y)22(n−1))\ LCL(X)= \exp\left(Y+\frac{\text{var}(Y)}{2}-z\sqrt{\frac{\text{var}(Y)}{n}+\frac{\text{var}(Y)^2}{2(n-1)}}\right) / et non le naïf /exp((Y)+zvar(Y)−−−−−−√)exp((Y)+zvar(Y))\exp((Y)+z\sqrt{\text{var}(Y)}) Maintenant, quels sont ces …
Quelles sont les estimations des paramètres de formule pour le skew-normal? Si vous le pouvez, la dérivation via MLE ou Mom serait également très bien. Merci Modifier . J'ai un ensemble de données pour lesquelles je peux voir visuellement par des tracés est légèrement biaisé vers la gauche. Je veux …
Avertissement: si vous trouvez que cette question est trop similaire à une autre, je suis heureux qu'elle soit fusionnée. Cependant, je n'ai pas trouvé de réponse satisfaisante ailleurs (et je n'ai pas encore la "réputation" de commenter ou de voter), donc j'ai pensé qu'il serait préférable de poser moi-même une …
Si j'ai un modèle de régression: où et ,Oui= Xβ+ εY=Xβ+ε Y = X\beta + \varepsilon V [ε]=Iré∈ Rn × nV[ε]=Id∈Rn×n\mathbb{V}[\varepsilon] = Id \in \mathcal{R} ^{n \times n}E [ε]=(0,…,0)E[ε]=(0,…,0)\mathbb{E}[\varepsilon]=(0, \ldots , 0) quand utiliser , l'estimateur des moindres carrés ordinaire de , serait-il un mauvais choix pour un estimateur?βOLSβOLS\beta_{\text{OLS}}ββ\beta J'essaie …
SurveyMonkey comporte des étapes et un graphique pour vous permettre de déterminer la taille de l'échantillon dont vous avez besoin pour une marge d'erreur ou un intervalle de confiance donné, en fonction de la taille de votre population. Taille de l'échantillon SurveyMonkey Ce tableau ignore-t-il simplement le fait que vous …
J'ai exécuté PCA sur 17 variables quantitatives afin d'obtenir un plus petit ensemble de variables, c'est-à-dire les principaux composants, à utiliser dans l'apprentissage automatique supervisé pour classer les instances en deux classes. Après PCA, PC1 représente 31% de la variance des données, PC2 17%, PC3 10%, PC4 8%, PC5 7% …
J'essaie de comprendre comment reproduire en Python certains travaux que j'ai faits en SAS. En utilisant cet ensemble de données , où la multicollinéarité est un problème, je voudrais effectuer une analyse des composants principaux en Python. J'ai regardé scikit-learn et les modèles de statistiques, mais je ne sais pas …
Je ne suis pas un écologiste communautaire, mais ces jours-ci, je travaille sur des données écologiques communautaires. Ce que je ne pouvais pas comprendre, à part les mathématiques de ces distances, ce sont les critères pour chaque distance à utiliser et dans quelles situations elle peut être appliquée. Par exemple, …
Je veux attribuer des poids différents aux variables dans mon analyse de cluster, mais mon programme (Stata) ne semble pas avoir d'option pour cela, donc je dois le faire manuellement. Imaginez 4 variables A, B, C, D. Les poids de ces variables devraient être w(A)=50% w(B)=25% w(C)=10% w(D)=15% Je me …
J'aimerais vérifier Rsi mes données correspondent aux distributions log-normales ou Pareto. Comment pourrais-je faire ça? Peut ks.test- être pourrais - je m'aider à le faire, mais comment puis-je obtenir les paramètres et pour la distribution de Pareto pour mes données?αα\alphakkk
Je travaille actuellement sur un logiciel de reconnaissance faciale qui utilise des réseaux de neurones à convolution pour reconnaître les visages. Sur la base de mes lectures, je me suis rendu compte qu'un réseau de neurones convolutionnels a partagé des poids, afin de gagner du temps pendant l'entraînement. Mais comment …
Dans cet article: Variables cachées: quelques exemples Brian L. Joiner The American Statistician Vol. 35, n ° 4, nov., 1981 227-233 Brian Joiner affirme que "la randomisation n'est pas une panacée". Ceci est contraire aux déclarations courantes telles que celle ci-dessous: Une expérience bien conçue comprend des caractéristiques de conception …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.