Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'étudie la distribution t de Student et j'ai commencé à me demander comment dériverait la fonction de densité des distributions t (de wikipedia, http://en.wikipedia.org/wiki/Student%27s_t-distribution ): F( t ) = Γ ( v + 12)v π--√Γ ( v2)( 1 + t2v)- v + 12f(t)=Γ(v+12)vπΓ(v2)(1+t2v)−v+12f(t) = \frac{\Gamma(\frac{v+1}{2})}{\sqrt{v\pi}\:\Gamma(\frac{v}{2})}\left(1+\frac{t^2}{v} \right)^{-\frac{v+1}{2}} où est le degré …
J'ai un ensemble de données qui représente 1000 documents et tous les mots qui y apparaissent. Les lignes représentent donc les documents et les colonnes les mots. Ainsi, par exemple, la valeur dans la cellule représente la fois où le mot apparaît dans le document . Maintenant, je dois trouver …
Je suis préoccupé par le problème que j'aimerais amorcer la valeur de p pour une estimation de partir de données multipliées imputées (MI), mais qu'il n'est pas clair pour moi comment combiner les valeurs de p entre les ensembles d'IM.θθ\theta Pour les ensembles de données MI, l'approche standard pour arriver …
Je suis doctorant en psychologie expérimentale et je m'efforce d'améliorer mes compétences et mes connaissances sur la façon d'analyser mes données. Jusqu'à ma 5e année en psychologie, je pensais que les modèles de régression (par exemple, ANOVA) supposaient les choses suivantes: normalité des données homogénéité de la variance des données, …
Quelqu'un peut-il suggérer où obtenir les résultats des 10 000 lancers de pièces (c'est-à-dire les 10 000 têtes et queues) exécutés par John Kerrich pendant la Seconde Guerre mondiale?
Existe-t-il une différence explicite entre les prévisions dans l'échantillon et les prévisions pseudo-hors échantillon . Les deux sont conçus dans le contexte de l'évaluation et de la comparaison des modèles de prévision.
J'ai du mal à trouver un moyen de calculer la valeur de p pour la zone sous une caractéristique d'opérateur de récepteur (ROC). J'ai une variable continue et un résultat de test de diagnostic. Je veux voir si AUROC est statistiquement significatif. J'ai trouvé de nombreux packages traitant des courbes …
Je collecte chaque jour de très grands échantillons (> 1 000 000) de données catégoriques et je souhaite que les données soient "significativement" différentes d'un jour à l'autre pour détecter les erreurs de collecte de données. Je pensais que l'utilisation d'un test de bon ajustement (en particulier, un test G) …
Je suis perplexe devant la déclaration suivante: "Afin d'augmenter l'écart-type d'un ensemble de nombres, vous devez ajouter une valeur qui est plus d'un écart-type de la moyenne" Quelle est la preuve de cela? Je sais bien sûr comment nous définissons l'écart type, mais cette partie me semble d'une certaine manière …
Je teste les capteurs de position du papillon (TPS) que mon entreprise vend et j'imprime le tracé de la réponse en tension à la rotation de l'arbre du papillon. Un TPS est un capteur rotatif avec une plage d' 90 ° et la sortie est comme un potentiomètre avec une …
Lors de l'utilisation de splines cubiques naturelles (c'est-à-dire restreintes), les fonctions de base créées sont hautement colinéaires et, lorsqu'elles sont utilisées dans une régression, semblent produire des statistiques VIF (facteur d'inflation de variance) très élevées, signalant la multicolinéarité. Lorsque l'on considère le cas d'un modèle à des fins de prédiction, …
J'ai corrélé les données et j'utilise un modèle à effets mixtes de régression logistique pour estimer l'effet au niveau individuel (conditionnel) pour un prédicteur d'intérêt. Je sais que pour les modèles marginaux standard, l'inférence sur les paramètres du modèle à l'aide du test de Wald est cohérente pour le rapport …
Si nous avons une longue série temporelle à haute résolution, avec beaucoup de bruit, il est souvent judicieux d'agréger les données à une résolution inférieure (par exemple, des valeurs quotidiennes à mensuelles) pour mieux comprendre ce qui se passe, en supprimant efficacement le bruit. J'ai vu au moins un article …
Soit le risque bayésien d'un estimateur par rapport à un antérieur , soit le jeu de tous les a priori sur l'espace des paramètres , et soit le jeu de toutes les règles de décision (éventuellement randomisées).r(π,δ)r(π,δ)r(\pi, \delta)δδ\deltaππ\piΠΠ\PiΘΘ\ThetaΔΔ\Delta L'interprétation statistique de l'inégalité minimax de John von Neumann indique que supπ∈Πinfδ∈Δr(π,δ)≤infδ∈Δsupπ∈Πr(π,δ),supπ∈Πinfδ∈Δr(π,δ)≤infδ∈Δsupπ∈Πr(π,δ), …
Plus précisément, pourquoi les tests du rapport de vraisemblance ont-ils une asymptotique si les modèles sont imbriqués, mais ce n'est plus le cas pour les modèles non imbriqués? Je comprends que cela découle du théorème de Wilks, mais malheureusement, je ne comprends pas sa preuve .χ2χ2\chi^2
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.