Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Y aura-t-il jamais un Tribble malheureux à Oz?
Voici un problème amusant apporté par un étudiant. Bien qu'il ait été formulé à l'origine en termes de balles annihilantes mutuellement tirées à intervalles réguliers par un pistolet, j'ai pensé que vous pourriez profiter d'une présentation plus paisible. Dans le monde plat infini d'Oz, la route de la brique jaune …

4
détecter le nombre de pics dans l'enregistrement audio
J'essaie de comprendre comment détecter le nombre de syllabes dans un corpus d'enregistrements audio. Je pense qu'un bon proxy pourrait être des pics dans le fichier wave. Voici ce que j'ai essayé avec un fichier de moi parlant en anglais (mon cas d'utilisation réel est en kiswahili). La transcription de …


1
Comment gérer la surdispersion dans la régression de Poisson: quasi-vraisemblance, GLM binomial négatif ou effet aléatoire au niveau du sujet?
J'ai rencontré trois propositions pour traiter la surdispersion dans une variable de réponse de Poisson et un modèle de départ à effets fixes: Utilisez un quasi modèle; Utiliser un GLM binomial négatif; Utilisez un modèle mixte avec un effet aléatoire au niveau du sujet. Mais lequel choisir réellement et pourquoi? …




2
Quand la régression logistique est-elle appropriée?
J'apprends actuellement moi-même comment faire la classification, et plus précisément, j'examine trois méthodes: les machines à vecteurs de support, les réseaux de neurones et la régression logistique. Ce que j'essaie de comprendre, c'est pourquoi la régression logistique fonctionnerait mieux que les deux autres. D'après ma compréhension de la régression logistique, …

1
Quelle est la façon la plus appropriée de transformer des proportions lorsqu'elles sont une variable indépendante?
Je pensais avoir compris ce problème, mais maintenant je ne suis pas aussi sûr et je voudrais vérifier avec les autres avant de continuer. J'ai deux variables, Xet Y. Yest un rapport, et il n'est pas limité par 0 et 1 et est généralement distribué normalement. Xest une proportion, délimitée …


2
Attente du maximum de variables iid Gumbel
Je continue à lire dans des revues économiques sur un résultat particulier utilisé dans des modèles d'utilité aléatoires. Une version du résultat est: si Gumbel ( , alors:ϵi∼iid,ϵi∼iid,\epsilon_i \sim_{iid}, μ,1),∀iμ,1),∀i\mu, 1), \forall i E[maxi(δi+ϵi)]=μ+γ+ln(∑iexp{δi}),E[maxi(δi+ϵi)]=μ+γ+ln⁡(∑iexp⁡{δi}),E[\max_i(\delta_i + \epsilon_i)] = \mu + \gamma + \ln\left(\sum_i \exp\left\{\delta_i \right\} \right), où γ≈0.52277γ≈0.52277\gamma \approx 0.52277 est …

2
Différentes définitions AIC
À partir de Wikipedia, il existe une définition du critère d'information d'Akaike (AIC) comme , où est le nombre de paramètres et est la log-vraisemblance du modèle.k log LAIC=2k−2logLAIC=2k−2log⁡L AIC = 2k -2 \log L kkklogLlog⁡L\log L Cependant, notre économétrie note dans une université bien respectée que . Ici est …

2
Somme des notes attribuées aux notes factorielles estimées?
Je serais intéressé de recevoir des suggestions sur le moment d'utiliser les « scores factoriels » par rapport à la somme des scores lors de la construction des échelles. C'est-à-dire des méthodes «raffinées» plutôt que «non raffinées» de notation d'un facteur. D'après DiStefano et al. (2009; pdf ), italiques ajoutés: …

2
Matrice de covariance mal conditionnée dans la régression GP pour l'optimisation bayésienne
Contexte et problème J'utilise des processus gaussiens (GP) pour la régression et l'optimisation bayésienne subséquente (BO). Pour la régression, j'utilise le paquet gpml pour MATLAB avec plusieurs modifications personnalisées, mais le problème est général. C'est un fait bien connu que lorsque deux entrées d'apprentissage sont trop proches dans l'espace d'entrée, …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.