Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Quelle est la plage typique de valeurs possibles pour le paramètre de rétrécissement dans la régression pénalisée?
En régression lasso ou crête, il faut spécifier un paramètre de rétrécissement, souvent appelé par ou α . Cette valeur est souvent choisie par validation croisée en vérifiant un tas de valeurs différentes sur les données d'entraînement et en voyant celle qui donne le meilleur, par exemple R 2 sur …

2
Estimer les coefficients ARMA par inspection ACF et PACF
Comment estimez-vous le modèle de prévision approprié pour une série chronologique par inspection visuelle des parcelles ACF et PACF? Lequel (c.-à-d. ACF ou PACF) informe l'AR ou le MA (ou les deux)? Quelle partie des graphiques vous indique la partie saisonnière et non saisonnière d'un ARIMA saisonnier? Considérez les fonctions …

1
La vraisemblance logarithmique dans GLM a-t-elle garanti la convergence vers les maxima mondiaux?
Mes questions sont: Les modèles linéaires généralisés (GLM) convergent-ils vers un maximum global? Si oui, pourquoi? De plus, quelles contraintes y a-t-il sur la fonction de liaison pour assurer la convexité? Ma compréhension des GLM est qu'ils maximisent une fonction de vraisemblance hautement non linéaire. Ainsi, j'imagine qu'il existe plusieurs …

2
Quelles sont les exigences de stationnarité de l'utilisation de la régression avec des erreurs ARIMA pour l'inférence?
Quelles sont les exigences de stationnarité de l'utilisation de la régression avec des erreurs ARIMA (régression dynamique) pour l'inférence? Plus précisément, j'ai une variable de résultat continue non stationnaire , une variable prédictive continue non stationnaire et une série de traitement de variable fictive . Je voudrais savoir si le …



2
Comment choisir le bon algorithme d'optimisation?
J'ai besoin de trouver le minimum d'une fonction. En lisant les documents sur http://docs.scipy.org/doc/scipy/reference/optimize.html je vois qu'il existe plusieurs algorithmes qui font la même chose, c'est-à-dire trouver le minimum. Comment savoir lequel choisir? une partie de l'algorithme répertorié Minimisez une fonction en utilisant l'algorithme du simplex de descente. Réduisez une …

3
L'ajout de variables dans une régression multivariable modifie-t-il les coefficients des variables existantes?
Disons que j'ai une régression multivariable (plusieurs variables indépendantes) qui se compose de 3 variables. Chacune de ces variables a un coefficient donné. Si je décide d'introduire une 4ème variable et de relancer la régression, les coefficients des 3 variables d'origine vont-ils changer? Plus largement: dans une régression multivariable (plusieurs …

5
Comment la distribution d'échantillonnage des moyennes de l'échantillon se rapproche-t-elle de la moyenne de la population?
J'essaie d'apprendre les statistiques parce que je trouve que c'est tellement répandu que cela m'interdit d'apprendre certaines choses si je ne les comprends pas correctement. J'ai du mal à comprendre cette notion de distribution d'échantillonnage des moyennes d'échantillonnage. Je ne comprends pas comment certains livres et sites l'ont expliqué. Je …

3
Utilisation du package de prévisions R avec des valeurs manquantes et / ou des séries chronologiques irrégulières
Je suis impressionné par le forecastpackage R , ainsi que par exemple le zoopackage pour les séries temporelles irrégulières et l'interpolation des valeurs manquantes. Mon application est dans le domaine des prévisions de trafic du centre d'appels, donc les données le week-end sont (presque) toujours manquantes, ce qui peut être …

2
PCA et validation croisée en k dans le package caret en R
Je viens de revoir une conférence du cours Machine Learning sur Coursera. Dans la section où le professeur discute de l'ACP pour le prétraitement des données dans les applications d'apprentissage supervisé, il dit que l'ACP ne devrait être effectuée que sur les données de formation, puis la cartographie est utilisée …

2
Quand quelqu'un dit que la déviance résiduelle / df devrait ~ 1 pour un modèle de Poisson, quelle est approximative approximative?
J'ai souvent vu les conseils pour vérifier si un ajustement du modèle de Poisson est trop dispersé, ce qui implique de diviser la déviance résiduelle par les degrés de liberté. Le rapport résultant doit être "environ 1". La question est de savoir de quelle plage parlons-nous pour "approximative" - ​​quel …

3
Quel test de Dickey-Fuller pour une série chronologique modélisée avec une interception / dérive et une tendance linéaire?
Version courte: J'ai une série chronologique de données climatiques que je teste pour la stationnarité. Sur la base de recherches antérieures, je m'attends à ce que le modèle sous-jacent (ou «générateur», pour ainsi dire) les données aient un terme d'interception et une tendance temporelle linéaire positive. Pour tester la stationnarité …

5
Quel est l'impact de l'augmentation des données de formation sur la précision globale du système?
Quelqu'un peut-il résumer pour moi avec des exemples possibles, dans quelles situations l'augmentation des données de formation améliore le système global? Quand détectons-nous que l'ajout de données d'entraînement pourrait éventuellement sur-ajuster les données et ne pas donner de bonnes précisions sur les données de test? Il s'agit d'une question très …

2
Test d'échantillonnage IID
Comment testeriez-vous ou vérifiez-vous que l'échantillonnage est IID (indépendant et identique)? Notez que je ne veux pas dire gaussien et identique, juste IID. Et l'idée qui me vient à l'esprit est de diviser à plusieurs reprises l'échantillon en deux sous-échantillons de taille égale, d'effectuer le test de Kolmogorov-Smirnov et de …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.