Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
L'information mutuelle comme probabilité
Pourrait l'information mutuelle sur l'entropie conjointe: 0≤I(X,Y)H(X,Y)≤10≤I(X,Y)H(X,Y)≤1 0 \leq \frac{I(X,Y)}{H(X,Y)} \leq 1 être défini comme: "La probabilité de transmettre une information de X à Y"? Je suis désolé d'être si naïf, mais je n'ai jamais étudié la théorie de l'information, et j'essaie juste de comprendre certains concepts de cela.



1
Poids aléatoire de la forêt et de la classe
Question en une phrase: quelqu'un sait-il comment déterminer les bons poids de classe pour une forêt aléatoire? Explication: je joue avec des jeux de données déséquilibrés. Je veux utiliser le Rpackage randomForestpour former un modèle sur un ensemble de données très asymétrique avec seulement de petits exemples positifs et de …
11 r  random-forest 


1
Pourquoi Netflix passerait-il de son système de notation à cinq étoiles à un système de j'aime / n'aime pas?
Netflix avait l'habitude de baser ses suggestions sur les évaluations soumises par un utilisateur d'autres films / émissions. Ce système de notation avait cinq étoiles. Désormais, Netflix permet aux utilisateurs d'aimer / détester (pouce levé / pouce baissé) les films / émissions. Ils affirment qu'il est plus facile d'évaluer les …


2
Dois-je signaler des résultats non significatifs?
J'ai exécuté un test de Kruskal Wallis, et pour certaines des questions, la valeur p n'est pas significative. Dois-je le signaler de la même manière que s'il était significatif, en indiquant le df, la statistique de test et la valeur de p? Donc, ce serait quelque chose comme ça, un …

1
Comment interpréter les résultats lorsque la crête et le lasso fonctionnent bien séparément mais produisent des coefficients différents
J'utilise un modèle de régression avec Lasso et Ridge (pour prédire une variable de résultat discrète allant de 0 à 5). Avant d'exécuter le modèle, j'utilise la SelectKBestméthode de scikit-learnpour réduire l'ensemble de fonctionnalités de 250 à 25 . Sans sélection initiale des caractéristiques, Lasso et Ridge cèdent tous deux …

2
Lire des parcelles en boîte et moustaches: est-il possible de glaner des différences significatives entre les groupes?
Supposons que nous examinions ce complot en boîte et moustaches: Entre jeudi et vendredi, je pense que la plupart conviendraient qu'il semble y avoir une différence significative dans le temps passé à dormir. Est-ce une conjecture statistiquement valable, cependant? Pouvons-nous discerner des différences significatives du fait qu'aucune des fourchettes du …



1
Limites de généralisation sur SVM
Je m'intéresse aux résultats théoriques pour la capacité de généralisation des machines à vecteurs de support, par exemple les limites sur la probabilité d'erreur de classification et sur la dimension Vapnik-Chervonenkis (VC) de ces machines. Cependant, en lisant la littérature, j'ai eu l'impression que certains résultats récurrents similaires ont tendance …

2
Apprentissage supervisé avec des données incertaines?
Existe-t-il une méthodologie existante pour appliquer un modèle d'apprentissage supervisé à un ensemble de données incertain? Par exemple, supposons que nous ayons un ensemble de données avec les classes A et B: +----------+----------+-------+-----------+ | FeatureA | FeatureB | Label | Certainty | +----------+----------+-------+-----------+ | 2 | 3 | A | …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.