Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


3
Quels devraient être les paramètres optimaux pour le classificateur Random Forest?
Actuellement j'utilise RF toolbox sur MATLAB pour un problème de classification binaire Ensemble de données: 50000 échantillons et plus de 250 fonctionnalités Alors, quel devrait être le nombre d'arbres et la fonction sélectionnée au hasard sur chaque division pour faire pousser les arbres? tout autre paramètre peut-il affecter considérablement les …






5
Pourquoi avons-nous besoin d'hypothèses alternatives?
Lorsque nous faisons des tests, nous nous retrouvons avec deux résultats. 1) Nous rejetons l'hypothèse nulle 2) Nous ne rejetons pas l'hypothèse nulle. Nous ne parlons pas d'accepter des hypothèses alternatives. Si nous ne parlons pas d'accepter une hypothèse alternative, pourquoi devons-nous avoir une hypothèse alternative? Voici la mise à …

3
Pourquoi les réseaux de neurones ont-ils besoin d'une sélection / ingénierie de fonctionnalités?
Particulièrement dans le contexte des compétitions kaggle, j'ai remarqué que la performance du modèle est une question de sélection / ingénierie de fonctionnalités. Bien que je puisse pleinement comprendre pourquoi c'est le cas dans le cas des algorithmes ML plus conventionnels / old-school, je ne vois pas pourquoi ce serait …

2
Pourquoi utiliser le lien logit en régression bêta?
Récemment, je me suis intéressé à l'implémentation d'un modèle de régression bêta, pour un résultat proportionnel. Notez que ce résultat ne rentrerait pas dans un contexte binomial, car il n'y a pas de concept significatif de «succès» discret dans ce contexte. En fait, le résultat est en fait une proportion …

3
Comment la sélection des fonctionnalités et l'optimisation des hyperparamètres doivent-elles être ordonnées dans le pipeline d'apprentissage automatique?
Mon objectif est de classer les signaux des capteurs. Le concept de ma solution jusqu'à présent est le suivant: i) fonctionnalités d'ingénierie à partir d'un signal brut ii) sélection des fonctionnalités pertinentes avec ReliefF et une approche de clustering iii) application de NN, Random Forest et SVM Cependant, je suis …





En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.