Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Variable aléatoire uniforme discrète (?) Prenant toutes les valeurs rationnelles dans un intervalle fermé
Je viens d'avoir une crise de panique (intellectuelle). Une variable aléatoire continue qui suit un uniforme dans un intervalle fermé U(a,b)U(a,b)U(a,b) : un concept statistique familier. Un RV uniforme continu ayant un support sur les réels étendus (à moitié ou entiers): pas un RV proprement dit, mais un concept bayésien …


1
MLE du paramètre de localisation dans une distribution de Cauchy
Après centrage, les deux mesures x et −x peuvent être supposées être des observations indépendantes d'une distribution de Cauchy avec fonction de densité de probabilité: f(x:θ)=f(x:θ)=f(x :\theta) = 1π(1+(x−θ)2)1π(1+(x−θ)2)1\over\pi (1+(x-\theta)^2) ,−∞&lt;x&lt;∞,−∞&lt;x&lt;∞, -∞ < x < ∞ Montrer que si le MLE de θ est 0, mais si x 2 &gt; …

1
Pourquoi utiliser le bootstrap paramétrique?
J'essaie actuellement de comprendre certaines choses concernant le bootstrap paramétrique. La plupart des choses sont probablement insignifiantes, mais je pense toujours avoir raté quelque chose. Supposons que je souhaite obtenir des intervalles de confiance pour les données à l'aide d'une procédure d'amorçage paramétrique. J'ai donc cet échantillon et je suppose …

2
utiliser les informations du voisin pour imputer des données ou trouver des données hors-ligne (dans R)
J'ai un ensemble de données avec l'hypothèse que les voisins les plus proches sont les meilleurs prédicteurs. Juste un exemple parfait de gradient bidirectionnel visualisé- Supposons que nous ayons un cas où peu de valeurs manquent, nous pouvons facilement prédire en fonction des voisins et de la tendance. Matrice de …

2
Existe-t-il une version de test d'équivalence simple du test de Kolmogorov – Smirnov?
Deux tests unilatéraux d'équivalence (TOST) ont-ils été élaborés pour le test de Kolmogorov-Smirnov afin de tester l'hypothèse nulle négativiste selon laquelle deux distributions diffèrent d'au moins un certain niveau spécifié par les chercheurs? Si ce n'est pas TOST, alors une autre forme de test d'équivalence? Nick Stauner souligne judicieusement que …

3
Quels critères doivent être remplis pour conclure qu'un «effet plafond» se produit?
Selon l' Encyclopédie SAGE des méthodes de recherche en sciences sociales … [un] effet de plafond se produit lorsqu'une mesure possède une limite supérieure distincte pour les réponses potentielles et qu'une forte concentration de participants obtient un score égal ou proche de cette limite. L'atténuation de l'échelle est un problème …

2
Causalité en microéconométrie versus causalité de Granger en économétrie temporelle
Je comprends la causalité telle qu'utilisée en microéconomie (en particulier IV ou conception de discontinuité de régression) et aussi la causalité de Granger telle qu'utilisée en économétrie de séries chronologiques. Comment est-ce que je lie l'un avec l'autre? Par exemple, j'ai vu les deux approches utilisées pour les données de …

1
Comment interpréter les chargements PCA?
En lisant sur PCA, je suis tombé sur l'explication suivante: Supposons que nous ayons un ensemble de données où chaque point de données représente les scores d'un seul élève à un test de mathématiques, un test de physique, un test de compréhension en lecture et un test de vocabulaire. Nous …
13 pca 

3
Forêt aléatoire sur des données structurées à plusieurs niveaux / hiérarchiques
Je suis assez nouveau dans l'apprentissage automatique, les techniques CART et autres, et j'espère que ma naïveté n'est pas trop évidente. Comment Random Forest gère-t-il les structures de données multi-niveaux / hiérarchiques (par exemple lorsque l'interaction entre niveaux est intéressante)? C'est-à-dire, des ensembles de données avec des unités d'analyse à …

3
Écart type de plusieurs mesures avec incertitudes
J'ai deux 2 heures de données GPS avec un taux d'échantillonnage de 1 Hz (7200 mesures). Les données sont données sous la forme (X,Xσ,Y,Yσ,Z,Zσ)(X,Xσ,Y,Yσ,Z,Zσ)(X, X_\sigma, Y, Y_\sigma, Z, Z_\sigma) , où NσNσN_\sigma est l'incertitude de mesure. Lorsque je prends la moyenne de toutes les mesures (par exemple, la valeur Z …

1
État de l'art en matière de déduplication
Quelles sont les méthodes de pointe en matière de déduplication des enregistrements? La déduplication est aussi parfois appelée: couplage d'enregistrements, résolution d'entité, résolution d'identité, fusion / purge. Je connais par exemple CBLOCK [1]. J'apprécierais que les réponses incluent également des références aux logiciels existants mettant en œuvre les méthodes. Je …

4
Pourquoi toutes les distributions connues sont-elles unimodales?
Je ne connais aucune distribution multimodale. Pourquoi toutes les distributions connues sont-elles unimodales? Y a-t-il une distribution "célèbre" qui a plus d'un mode? Bien sûr, les mélanges de distributions sont souvent multimodaux, mais j'aimerais savoir s'il existe des distributions "non-mélange" qui ont plus d'un mode.


1
Comment mettre à l'échelle de nouvelles observations pour faire des prédictions lorsque le modèle a été équipé de données à l'échelle?
Je comprends le concept de mise à l'échelle de la matrice de données à utiliser dans un modèle de régression linéaire. Par exemple, dans R, vous pouvez utiliser: scaled.data &lt;- scale(data, scale=TRUE) Ma seule question est, pour les nouvelles observations pour lesquelles je veux prédire les valeurs de sortie, comment …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.