Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Modifier l'analyse des points à l'aide de R nls ()
J'essaye d'implémenter une analyse de "point de changement", ou une régression polyphasée en utilisant nls()dans R. Voici quelques fausses données que j'ai faites . La formule que je veux utiliser pour ajuster les données est la suivante: y= β0+ β1x + β2max ( 0 , x - δ)y=β0+β1X+β2max(0,X-δ)y = \beta_0 …


2
Pourquoi le supremum du pont brownien a-t-il la distribution de Kolmogorov – Smirnov?
La distribution de Kolmogorov – Smirnov est connue d'après le test de Kolmogorov – Smirnov . Mais c'est aussi la distribution du supremum du pont brownien. Comme c'est loin d'être évident (pour moi), je voudrais vous demander une explication intuitive de cette coïncidence. Les références sont également les bienvenues.

3
Détection robuste des valeurs aberrantes dans les séries financières
Je suis à la recherche de techniques robustes pour supprimer les valeurs aberrantes et les erreurs (quelle qu'en soit la cause) des données de séries chronologiques financières (c.-à-d. Tickdata). Les données financières chronologiques tick-by-tick sont très compliquées. Il contient d'énormes intervalles (temporels) lorsque l'échange est fermé et fait d'énormes sauts …


4
Pourquoi P (A, B | C) / P (B | C) = P (A | B, C)?
Je comprends P(A∩B)/P(B)=P(A|B)P(A∩B)/P(B)=P(A|B)P(A\cap B)/P(B) = P(A|B) . Le conditionnel est l'intersection de A et B divisée par toute l'aire de B. Mais pourquoi P(A∩B|C) / P( B | C) = P( A | B ∩ C)P(UNE∩B|C)/P(B|C)=P(UNE|B∩C)P(A\cap B|C)/P(B|C) = P(A|B \cap C) ? Pouvez-vous donner une certaine intuition? Cela ne devrait-il …

2
La forêt aléatoire a-t-elle besoin de variables d'entrée pour être mise à l'échelle ou centrée?
Mes variables d'entrée ont des dimensions différentes. Certaines variables sont décimales tandis que d'autres sont des centaines. Est-il essentiel de centrer (soustraire la moyenne) ou de mettre à l'échelle (diviser par l'écart-type) ces variables d'entrée afin de rendre les données sans dimension lors de l'utilisation d'une forêt aléatoire?





2
Interprétation de l'intervalle de confiance
Remarque: excuses à l'avance s'il s'agit d'un doublon, je n'ai pas trouvé de q similaire dans ma recherche Disons que nous avons un vrai paramètre p. Un intervalle de confiance C (X) est un RV qui contient p, disons 95% du temps. Supposons maintenant que nous observons X et calculons …

2
Quelle notation et pourquoi:
S'agit-il simplement de conventions stylistiques (qu'elles soient en italique ou non), ou y a-t-il des différences substantielles dans la signification de ces notations? Y a-t-il d'autres notations signifiant " la probabilité de " qui devraient être prises en compte dans cette question?

3
Quand peut-on parler de colinéarité
Dans les modèles linéaires, nous devons vérifier s'il existe une relation entre les variables explicatives. S'ils sont trop corrélés, il y a colinéarité (c'est-à-dire que les variables s'expliquent en partie). Je regarde actuellement la corrélation par paire entre chacune des variables explicatives. Question 1: Qu'est - ce qui qualifie trop …

3
Pourquoi faut-il utiliser REML (au lieu de ML) pour choisir parmi les modèles var-covar imbriqués?
Diverses descriptions sur la sélection des modèles sur les effets aléatoires des modèles mixtes linéaires indiquent l'utilisation de REML. Je connais la différence entre REML et ML à un certain niveau, mais je ne comprends pas pourquoi REML devrait être utilisé parce que ML est biaisé. Par exemple, est-ce mal …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.