Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je venais juste de me voir confier un projet d'analyse des sentiments pour certaines collections de documents. Par Google, beaucoup de recherches liées au sentiment ont surgi. Mes questions sont: Quelles sont les principales méthodes / algorithmes pour l'analyse des sentiments dans le domaine de l'apprentissage automatique et de l'analyse …
J'ai des problèmes pour utiliser les fonctions cor()et cor.test(). J'ai juste deux matrices (seulement des valeurs numériques, et le même nombre de lignes et de colonnes) et je veux avoir le numéro de corrélation et la valeur p correspondante. Lorsque j'utilise, cor(matrix1, matrix2)j'obtiens les coefficients de corrélation pour toutes les …
En supposant un "caractère aléatoire complet" et une chaîne de 20 caractères, chaque caractère pouvant être l'un des 62 caractères possibles: Quel est le nombre total de combinaisons possibles? (Deviner 20 à la puissance de 62.) De plus, si de nouvelles chaînes sont sélectionnées au hasard les unes après les …
J'ai une grande enquête dans laquelle on a demandé aux élèves, entre autres, le niveau de scolarité de leur mère. Certains l'ont sauté et certains ont répondu à tort. Je le sais, car un sous-échantillon de la mère des répondants initiaux a ensuite été interrogé et a posé la même …
Selon l' analyse de régression par exemple , le résidu est la différence entre la réponse et la valeur prédite, puis il est dit que chaque résidu a une variance différente, nous devons donc considérer des résidus normalisés. Mais la variance concerne un groupe de valeurs, comment une seule valeur …
J'ai plusieurs résultats de test de délai de réponse du serveur. Selon notre analyse théorique, la distribution de retard (la fonction de distribution de probabilité du retard de réponse) devrait avoir un comportement de queue lourde. Mais comment pourrais-je prouver que le résultat du test suit la distribution à queue …
Certaines méthodes statistiques - je ne me souviens pas s'il s'agit de l'analyse en composantes principales ou quelque chose du genre - sont parfois appelées "analyse des données françaises". C'est quoi exactement ? Et certaines personnes disent que ce nom est ironique, est-ce vrai, et pourquoi?
J'utilise 2 types de régression logistique - l'un est le type simple, pour la classification binaire, et l'autre est la régression logistique ordinale. Pour calculer la précision de la première, j'ai utilisé la validation croisée, où j'ai calculé l'AUC pour chaque pli et ensuite calculé l'ASC moyenne. Comment puis-je le …
Comment la valeur attendue d'une variable aléatoire continue est-elle liée à sa moyenne arithmétique, sa médiane, etc. dans une distribution non normale (par exemple, skew-normal)? Je suis intéressé par toutes les distributions communes / intéressantes (par exemple, les distributions log-normales, simples bi / multimodales, tout ce qui est bizarre et …
J'utilise le package kernlab dans R pour construire un SVM pour classer certaines données. Le SVM fonctionne bien en ce qu'il fournit des `` prédictions '' d'une précision décente, mais ma liste de variables d'entrée est plus longue que je ne le souhaiterais et je ne suis pas sûr de …
En utilisant R, j'ai ajusté un modèle linéaire pour une variable de réponse unique à partir d'un mélange de prédicteurs continus et discrets. C'est uber-basique, mais j'ai du mal à comprendre comment fonctionne un coefficient pour un facteur discret. Concept: De toute évidence, le coefficient de la variable continue «x» …
Existe-t-il des algorithmes standard (par opposition aux programmes) pour effectuer une régression linéaire hiérarchique? Est-ce que les gens ne font généralement que du MCMC ou existe-t-il des algorithmes plus spécialisés, peut-être partiellement fermés?
Quelle est la différence entre la corrélation croisée et l'information mutuelle. Quels types de problèmes peuvent être résolus en utilisant ces mesures et quand est-il approprié de les utiliser les uns par rapport aux autres. Merci pour les commentaires. Pour clarifier, la question est suscitée par un intérêt pour l'analyse …
Disons que vous disposez de données de survie comme celle-ci: obs <- data.frame( time = c(floor(runif(100) * 30), floor((runif(100)^2) * 30)), status = c(rbinom(100, 1, 0.2), rbinom(100, 1, 0.7)), group = gl(2,100) ) Pour effectuer un test de classement de journal standard, on peut utiliser survdiff(Surv(time, status) ~ group, data …
Disons que j'ai un tas de lignes pour un problème de classification: X1,...XN,YX1,...XN,YX_1, ... X_N, Y Où sont les entités / prédicteurs et est la classe à laquelle la combinaison d' entités de la ligne appartient.X1,...,XNX1,...,XNX_1, ..., X_NYYY De nombreuses combinaisons de fonctionnalités et leurs classes sont répétées dans l'ensemble …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.