Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je sais que cela a probablement été discuté ailleurs, mais je n'ai pas pu trouver de réponse explicite. J'essaie d'utiliser la formule pour calculer hors échantillon d'un modèle de régression linéaire, où est la somme des carrés des résidus et est la somme totale des carrés. Pour l'ensemble de formation, …
Disons que j'ai une architecture de modèle d'apprentissage en profondeur, ainsi qu'une taille de mini-lot choisie. Comment puis-je dériver de ces exigences de mémoire attendues pour la formation de ce modèle? Par exemple, considérons un modèle (non récurrent) avec une entrée de dimension 1000, 4 couches cachées entièrement connectées de …
D'accord - mon message d'origine n'a pas réussi à obtenir une réponse; alors, permettez-moi de poser la question différemment. Je commencerai par expliquer ma compréhension de l'estimation d'un point de vue théorique de la décision. Je n'ai aucune formation formelle et cela ne m'étonnerait pas si ma pensée était défectueuse …
Je souhaite tester certaines de mes idées qui me semblent meilleures que tout ce que j'ai vu. Je peux me tromper mais je voudrais tester mes idées et vaincre mes doutes par des observations plus certaines. Ce que j'ai pensé faire, c'est ce qui suit: Définissez analytiquement un ensemble de …
Quand nous pouvons différencier la fonction de coût et trouver des paramètres en résolvant des équations obtenues par différenciation partielle par rapport à chaque paramètre et savoir où la fonction de coût est minimale. Je pense aussi qu'il est possible de trouver plusieurs endroits où les dérivées sont nulles, ainsi …
Actuellement, je travaille sur un projet de prévision d'une série chronologique (données mensuelles). J'utilise R pour faire les prévisions. J'ai 1 variable dépendante (y) et 3 variables indépendantes (x1, x2, x3). La variable y a 73 observations, tout comme les 3 autres variables (alos 73). De janvier 2009 à janvier …
Fondamentalement, je veux convertir les mesures de similitude en poids qui sont utilisés comme prédicteurs. Les similitudes seront sur [0,1], et je limiterai les poids à également sur [0,1]. J'aimerais une fonction paramétrique qui effectue cette cartographie que j'optimiserai probablement en utilisant la descente de gradient. Les exigences sont que …
Dans plusieurs compétitions de kaggle, la notation était basée sur la "perte de log". Cela concerne l'erreur de classification. Voici une réponse technique mais je recherche une réponse intuitive. J'ai vraiment aimé les réponses à cette question sur la distance de Mahalanobis, mais PCA n'est pas logloss. Je peux utiliser …
Les «résidus étudiés» et les «résidus standardisés» sont-ils les mêmes dans les modèles de régression? J'ai construit un modèle de régression linéaire dans R et je voulais tracer le graphique des valeurs ajustées v / s des résidus Studentized, mais je n'ai pas trouvé de moyen automatisé de le faire …
Comment effectuer une régression de crête non négative? Le lasso non négatif est disponible en scikit-learn, mais pour la crête, je ne peux pas imposer la non-négativité des bêtas, et en effet, j'obtiens des coefficients négatifs. Est-ce que quelqu'un sait pourquoi c'est comme ça? De plus, puis-je implémenter ridge en …
Situation: Deux oiseaux (mâle et femelle) protègent leurs œufs dans leur nid contre un intrus. Chaque oiseau peut utiliser une attaque ou une menace pour se protéger et être présent ou absent. Un schéma émerge des données selon lesquelles le comportement peut être complémentaire - les attaques masculines tandis que …
Je comprends que nous pouvons utiliser la régularisation dans un problème de régression des moindres carrés comme w∗=argminw[(y−Xw)T(y−Xw)+λ∥w∥2]w∗=argminw[(y−Xw)T(y−Xw)+λ‖w‖2]\boldsymbol{w}^* = \operatorname*{argmin}_w \left[ (\mathbf y-\mathbf{Xw})^T(\boldsymbol{y}-\mathbf{Xw}) + \lambda\|\boldsymbol{w}\|^2 \right] et que ce problème a une solution de forme fermée comme: w^=(XTX+λI)−1XTy.w^=(XTX+λI)−1XTy.\hat{\boldsymbol{w}} = (\boldsymbol{X}^T\boldsymbol{X}+\lambda\boldsymbol{I})^{-1}\boldsymbol{X}^T\boldsymbol{y}. Nous voyons que dans la 2e équation, la régularisation consiste …
L'algorithme SVM est assez ancien - il a été développé dans les années 1960, mais était extrêmement populaire dans les années 1990 et 2000. C'est une partie classique (et assez belle) des cours d'apprentissage automatique. Aujourd'hui, il semble que dans le traitement des médias (images, son, etc.) les réseaux de …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.