Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Supposons que l'on nous donne un ensemble de données de la forme et . On nous donne la tâche de prédire sur la base des valeurs de . Nous estimons deux régressions où: ( y , x 1 , x 2 , ⋯ , x n - 1 ) y …
Disons que j'ai un simple problème d'apprentissage automatique comme une classification. Avec quelques références en vision ou en reconnaissance audio, moi, en tant qu'humain, je suis un très bon classificateur. J'ai donc une intuition sur la qualité d'un classificateur. Mais avec beaucoup de données, un point est que je ne …
Je travaille actuellement sur une série de modèles de séries chronologiques de Poisson essayant d'estimer l'effet d'un changement dans la façon dont les chiffres ont été obtenus (passage d'un test de diagnostic à un autre) tout en contrôlant d'autres tendances au fil du temps (par exemple, une augmentation générale de …
J'ai un ensemble de données assez compliqué à analyser, et je ne peux pas trouver une bonne solution pour cela. Voici la chose: 1. les données brutes sont essentiellement des enregistrements de chants d'insectes. Chaque chanson est composée de plusieurs rafales et chaque rafale est constituée de sous-unités. Tous les …
J'ai ajusté certaines données de séries chronologiques à l'aide d'un modèle additif général de Poisson à l'aide de SAS PROC GAM. De manière générale, j'ai vu sa procédure de validation croisée généralisée intégrée générer au moins un «point de départ» décent pour ma spline unique, qui est une fonction non …
J'utilise le Root Mean Squared Error(RMSE) pour mesurer la précision des valeurs prédites à l'aide d'un modèle. Je comprends que la valeur retournée utilise les unités de mes mesures (plutôt qu'un pourcentage). Cependant, je voudrais citer mes valeurs en pourcentage. L'approche que j'ai adoptée consiste à normaliser la RMSEvaleur moyenne …
Je lis A. Agresti (2007), An Introduction to Categorical Data Analysis , 2nd. édition, et je ne sais pas si je comprends bien ce paragraphe (p.106, 4.2.1) (bien que cela devrait être facile): Dans le tableau 3.1 sur le ronflement et les maladies cardiaques du chapitre précédent, 254 sujets ont …
Le modèle Bradley – Terry – Luce (BTL) indique que , où est la probabilité que l'objet soit jugé "meilleur", plus lourd, etc., que l'objet , et et sont des paramètres.pj i= l o gje t- 1( δj- δje)pjje=logjet-1(δj-δje)p_{ji} = logit^{-1}(\delta_j - \delta_i)pje jpjejp_{ij}jjjjejeiδjeδje\delta_iδjδj\delta_j Cela semble être un candidat pour …
@whuber a montré comment simuler des résultats multivariés ( , y 2 ety1y1y_1y2y2y_2 ) pour un point dans le temps.y3y3y_3 Comme nous le savons, les données longitudinales se produisent souvent dans les études médicales. Ma question est de savoir comment simuler des résultats multivariés de mesures répétées dans R? Par …
J'ai calculé un modèle de régression linéaire simple à partir de mes mesures expérimentales afin de faire des prédictions. J'ai lu que vous ne devriez pas calculer les prévisions pour les points qui s'écartent trop des données disponibles. Cependant, je n'ai trouvé aucune indication pour m'aider à savoir jusqu'où je …
Mes données sont une série chronologique de la population occupée, L, et la période de temps, l'année. n.auto=auto.arima(log(L),xreg=year) summary(n.auto) Series: log(L) ARIMA(2,0,2) with non-zero mean Coefficients: ar1 ar2 ma1 ma2 intercept year 1.9122 -0.9567 -0.3082 0.0254 -3.5904 0.0074 s.e. NaN NaN NaN NaN 1.6058 0.0008 sigma^2 estimated as 1.503e-06: log …
Je sais que c'est probablement une question fondamentale ... Mais je ne semble pas trouver la réponse. Je monte un GLM avec une famille Poisson, puis j'ai essayé de jeter un coup d'œil aux prédictions, mais le décalage semble être pris en considération: model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003), offset=(log(population)), data=data, subset=28:36, family=poisson()) predict (model_glm, …
J'ai besoin d'un package qui peut me donner l'équation d'un modèle SVM linéaire. Actuellement, j'utilise e1071 comme ceci: library(e1071) m = svm(data, labels, type='C', kernel='linear', cost=cost, probability=FALSE, scale=scale) w = t(m$coefs) %*% data[m$index,] #Weight vector b = -model$rho #Offset Cependant, je ne sais pas comment e1071::svm()sélectionne les classes positives et …
Je ne suis pas un expert en statistiques, mais je suppose qu'il y a un désaccord quant à savoir si une interprétation "fréquentiste" ou "bayésienne" de la probabilité est la "bonne". D'après Wagenmakers et. al p. 183: Considérons une distribution uniforme de moyenne et de largeur . Tirez au hasard …
J'ai un problème de classification (de classe ), avec de l'ordre de 100 prédicteurs à valeur réelle, dont l'un semble avoir beaucoup plus de pouvoir explicatif que les autres. Je voudrais approfondir les effets des autres variables. Cependant, les techniques standard d'apprentissage automatique (forêts aléatoires, SVM, etc.) semblent être submergées …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.