Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'entraîne un modèle de classification avec Random Forest pour faire la distinction entre 6 catégories. Mes données transactionnelles ont environ 60k + observations et 35 variables. Voici un exemple de son apparence approximative. _________________________________________________ |user_id|acquisition_date|x_var_1|x_var_2| y_vay | |-------|----------------|-------|-------|--------| |111 | 2013-04-01 | 12 | US | group1 | |222 | …
J'ai un échantillon de 100 points qui sont continus et unidimensionnels. J'ai estimé sa densité non paramétrique en utilisant les méthodes du noyau. Comment puis-je tirer des échantillons aléatoires de cette distribution estimée?
Je passe en revue un article d'un journal universitaire par les pairs et les auteurs ont écrit ce qui suit pour justifier le fait de ne pas rapporter de statistiques inférentielles (j'ai identifié la nature des deux groupes): Au total, 25 des personnes interrogées 2349 (1,1%) ont rapporté X . …
J'essaie de comprendre le résultat que je vois dans mon graphique ci-dessous. Habituellement, j'ai tendance à utiliser Excel et à obtenir une ligne de régression linéaire, mais dans le cas ci-dessous, j'utilise R et j'obtiens une régression polynomiale avec la commande: ggplot(visual1, aes(ISSUE_DATE,COUNTED)) + geom_point() + geom_smooth() Donc, mes questions …
Les forêts aléatoires fonctionnent en créant un ensemble d'arbres de décision où chaque arbre est créé en utilisant un échantillon bootstrap des données de formation d'origine (échantillon à la fois de variables d'entrée et d'observations). Un processus similaire peut-il être appliqué pour la régression linéaire? Créer k modèles de régression …
Je souhaite développer un modèle de prédiction (Cox PH) pour la mortalité toutes causes confondues dans un ensemble de données de participants dont (presque) tous sont décédés à la fin du suivi (par exemple 1 an). Au lieu de prédire le risque absolu de mourir à un certain moment, je …
Aujourd'hui, on m'a demandé si une valeur de p de 0,05 (exactement) est considérée comme significative (étant donné alpha = 5%) ou non. Je ne connaissais pas la réponse et Google a donné les deux réponses: (a) le résultat est significatif si p est inférieur à 5% et (b) si …
Je voudrais estimer la corrélation entre: Une variable ordinale: les sujets sont invités à évaluer leur préférence pour 6 types de fruits sur une échelle de 1 à 5 (allant de très dégoûtant à très savoureux). En moyenne, les sujets n'utilisent que 3 points de l'échelle. Une variable continue: les …
Version courte: je recherche un package R capable de construire des arbres de décision alors que chaque feuille de l'arbre de décision est un modèle de régression linéaire complet. AFAIK, la bibliothèque rpartcrée des arbres de décision où la variable dépendante est constante dans chaque feuille. Y a-t-il une autre …
On m'a donné des données à analyser pour une étude examinant les effets d'un traitement sur les niveaux de fer à quatre moments différents (avant le traitement, le jour de fin du traitement, 4 semaines après le traitement et 2 à 4 mois après le traitement). Il n'y a pas …
Il semble assez courant de décrire les valeurs alpha de Cronbach comme suit: α ≥ 0,9 Excellent 0,7 ≤ α <0,9 Bon 0,6 ≤ α <0,7 Acceptable 0,5 ≤ α <0,6 Médiocre α <0,5 Inacceptable D'où viennent ces valeurs? Je ne trouve pas un article de recherche original les décrivant. …
Les données que nous voulons utiliser comme variable dépendante ressemblent à ceci (ce sont des données de comptage). Nous craignons qu'étant donné sa composante cyclique et sa structure tendancielle, la régression se révèle en quelque sorte biaisée. Nous utiliserons une régression binomiale négative au cas où cela aiderait. Les données …
Selon Wikipedia, la distribution de probabilité bêta a deux paramètres de forme: et β .αα\alphaββ\beta Lorsque j'appelle scipy.stats.beta.fit(x)en Python, où se xtrouve un groupe de nombres dans la plage , 4 valeurs sont renvoyées. Cela me semble étrange.[ 0 , 1 ][0,1][0,1] Après avoir recherché sur Google, j'ai trouvé que …
Je sais que k-means est généralement optimisé à l'aide de la maximisation des attentes . Cependant, nous pourrions optimiser sa fonction de perte de la même manière que nous optimisons les autres! J'ai trouvé des articles qui utilisent réellement la descente de gradient stochastique pour les moyennes k à grande …
Dans un article, j'ai trouvé la formule de l'écart-type d'une taille d'échantillon NNN σ=R¯¯¯¯2.534σ=R¯2.534\sigma=\frac{\overline{R}}{2.534} où est la plage moyenne de sous-échantillons (taille ) de l'échantillon principal. Comment le nombre est-il calculé? C'est le bon numéro? 62,534R¯¯¯¯R¯\overline{R}6662.5342.5342.534
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.