Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Prévision de séries chronologiques horaires avec périodicité quotidienne, hebdomadaire et annuelle
Édition majeure: Je voudrais dire un grand merci à Dave et Nick jusqu'à présent pour leurs réponses. La bonne nouvelle est que j'ai réussi à faire fonctionner la boucle (principe emprunté à la publication du professeur Hydnman sur la prévision par lots). Pour consolider les requêtes en attente: a) Comment …


1
tests vs tests?
J'essaie de comprendre exactement quelle est la différence entre les tests et les tests .ztttzzz Pour autant que je sache, pour les deux classes de tests, on utilise la même statistique de test, quelque chose de la forme b^−Cseˆ(b^)b^−Cse^(b^)\frac{\hat{b} - C}{\widehat{\operatorname{se}}(\hat{b})} où est un exemple de statistique, est une constante …




1
Quelle est la différence entre les statistiques / méthodes sans distribution et les statistiques non paramétriques?
De Wikipédia La première signification du terme non paramétrique couvre les techniques qui ne reposent pas sur des données appartenant à une distribution particulière. Il s'agit notamment: les méthodes sans distribution, qui ne reposent pas sur des hypothèses selon lesquelles les données sont tirées d'une distribution de probabilité donnée. En …


1
ajustement d'une fonction exponentielle en utilisant les moindres carrés vs le modèle linéaire généralisé vs les moindres carrés non linéaires
J'ai un ensemble de données qui représente la décroissance exponentielle. Je voudrais adapter une fonction exponentielle à ces données. J'ai essayé de transformer la variable de réponse en journal puis d'utiliser les moindres carrés pour ajuster une ligne; utiliser un modèle linéaire généralisé avec une fonction de liaison logarithmique et …

2
Interprétation du résultat du clustering k-means dans R
J'utilisais l' kmeansinstruction de R pour effectuer l'algorithme k-means sur l'ensemble de données iris d'Anderson. J'ai une question sur certains paramètres que j'ai obtenus. Les résultats sont: Cluster means: Sepal.Length Sepal.Width Petal.Length Petal.Width 1 5.006000 3.428000 1.462000 0.246000 Dans ce cas, que signifie "Cluster"? Est-ce la moyenne des distances de …

2
Comment combiner les résultats de la régression logistique et de la forêt aléatoire?
Je suis nouveau dans l'apprentissage automatique. J'ai appliqué une régression logistique et une forêt aléatoire sur un même ensemble de données. J'obtiens donc une importance variable (coefficient absolu pour la régression logistique et importance variable pour la forêt aléatoire). Je pense à combiner les deux pour obtenir une importance variable …

2
Comparaison de deux modèles de régression linéaire
Je voudrais comparer deux modèles de régression linéaire qui représentent les taux de dégradation d'un ARNm dans le temps dans deux conditions différentes. Les données de chaque modèle ont été collectées indépendamment. Voici l'ensemble de données. Journal de temps (heures) (traitement A) journal (traitement B) 0 2,02 1,97 0 2,04 …

1
Kernelized k le plus proche voisin
Je suis nouveau dans les noyaux et j'ai rencontré un problème en essayant de noyauer kNN. Préliminaires J'utilise un noyau polynomiale: K(x,y)=(1+⟨x,y⟩)dK(x,y)=(1+⟨x,y⟩)dK(\mathbf{x},\mathbf{y}) = (1 + \langle \mathbf{x},\mathbf{y} \rangle)^d Votre kNN euclidien typique utilise la métrique de distance suivante: d(x,y)=||x−y||d(x,y)=||x−y||d(\mathbf{x}, \mathbf{y}) = \vert\vert \mathbf{x} - \mathbf{y} \vert\vert Soit mapper x dans …

2
Les solutions PCA sont-elles uniques?
Lorsque j'exécute PCA sur un certain ensemble de données, la solution qui m'est donnée est-elle unique? C'est-à-dire que j'obtiens un ensemble de coordonnées 2d, basé sur des distances entre points. Est-il possible de trouver au moins une autre disposition des points qui répondrait à ces contraintes? Si la réponse est …
12 pca 

1
Prédire le logit ordonné dans R
J'essaie de faire une régression logit ordonnée. J'exécute le modèle comme ça (juste un petit modèle stupide qui estime le nombre d'entreprises sur un marché à partir des mesures du revenu et de la population). Ma question concerne les prédictions. nfirm.opr<-polr(y~pop0+inc0, Hess = TRUE) pr_out<-predict(nfirm.opr) Lorsque je lance Predict (que …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.