Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je travaille sur un projet qui comprend 14 variables et 345 000 observations pour les données sur le logement (des choses comme l'année de construction, la superficie, le prix vendu, le comté de résidence, etc.). Je cherche à trouver de bonnes techniques graphiques et des bibliothèques R qui contiennent de …
Un collègue (non statisticien) a rencontré des méta-analyses dans des articles qu'il passe en revue pour des revues médicales et cherche un bon traitement d'introduction pour pouvoir s'instruire. Des recommandations? Favoris? Des livres, des monographies, des articles d'enquête non techniques seraient tous bien. (Oui, il connaît l'entrée de Wikipedia et …
Bien que j'ai été formé comme ingénieur, je trouve que je m'intéresse de plus en plus à l'exploration de données. En ce moment, j'essaie d'enquêter davantage sur le terrain. En particulier, je voudrais comprendre les différentes catégories d'outils logiciels qui existent et quels outils sont remarquables dans chaque catégorie et …
Que pensez-vous de l'application de techniques d'apprentissage automatique, comme les forêts aléatoires ou la régression pénalisée (avec pénalité L1 ou L2, ou une combinaison de celles-ci) dans de petits échantillons d'études cliniques lorsque l'objectif est d'isoler des prédicteurs intéressants dans un contexte de classification? Ce n'est pas une question sur …
En tant qu'ingénieur logiciel, je m'intéresse à des sujets tels que les algorithmes statistiques, l'exploration de données, l'apprentissage automatique, les réseaux bayésiens, les algorithmes de classification, les réseaux de neurones, les chaînes de Markov, les méthodes de Monte Carlo et la génération de nombres aléatoires. Personnellement, je n'ai pas eu …
Je suis pris par l'idée du rétrécissement de James-Stein (c'est-à-dire qu'une fonction non linéaire d'une observation unique d'un vecteur de normales éventuellement indépendantes peut être un meilleur estimateur des moyennes des variables aléatoires, où «mieux» est mesuré par erreur quadratique ). Cependant, je ne l'ai jamais vu dans le travail …
L'Australie organise actuellement des élections et il est compréhensible que les médias rapportent quotidiennement les nouveaux résultats des sondages politiques. Dans un pays de 22 millions d'habitants, quel pourcentage de la population devrait être échantillonné pour obtenir un résultat statistiquement valide? Est-il possible que l'utilisation d'un échantillon trop grand puisse …
Fermé . Cette question est basée sur l'opinion . Il n'accepte pas actuellement les réponses. Voulez-vous améliorer cette question? Mettez à jour la question afin d'y répondre avec des faits et des citations en modifiant ce message . Fermé il y a 3 ans . Règles: un classificateur par réponse …
Le changement d'étiquette (c.-à-d. Que la distribution postérieure est invariante à la commutation des étiquettes des composants) est un problème problématique lors de l'utilisation de MCMC pour estimer les modèles de mélange. Existe-t-il une méthodologie standard (comme largement acceptée) pour traiter le problème? S'il n'y a pas d'approche standard, quels …
Dans mon domaine de recherche, une façon populaire d'afficher des données consiste à utiliser une combinaison d'un graphique à barres avec des "poignées". Par exemple, Les "guidons" alternent entre les erreurs types et les écarts types selon l'auteur. En règle générale, les tailles d'échantillon pour chaque "barre" sont assez petites …
Il y a quelque temps, un utilisateur de la liste de diffusion R-help a posé des questions sur la validité de l'utilisation des scores PCA dans une régression. L'utilisateur essaie d'utiliser des scores PC pour expliquer les variations sur un autre PC (voir la discussion complète ici ). La réponse …
Si je comprends bien, les écoles britanniques enseignent que l'écart-type se trouve en utilisant: alors que les écoles américaines enseignent: (au niveau de base de toute façon). Cela a causé un certain nombre de problèmes à mes étudiants dans le passé, car ils ont cherché sur Internet, mais ils ont …
Je pense que j'ai déjà compris la définition mathématique d'un estimateur cohérent. Corrige moi si je me trompe: WnWnW_n est un estimateur cohérent pour siθθ\theta∀ϵ>0∀ϵ>0\forall \epsilon>0 limn→∞P(|Wn−θ|>ϵ)=0,∀θ∈Θlimn→∞P(|Wn−θ|>ϵ)=0,∀θ∈Θ\lim_{n\to\infty} P(|W_n - \theta|> \epsilon) = 0, \quad \forall\theta \in \Theta Où, ΘΘ\Theta est l'espace paramétrique. Mais je veux comprendre la nécessité pour un …
Ma question est très simple: pourquoi nous choisissons la distribution normale comme terme d'erreur dans l'hypothèse d'une régression linéaire? Pourquoi nous n'en choisissons pas d'autres comme l'uniforme, le t ou quoi?
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.