Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je lis un manuel Gaussian Process for Machine Learning de CE Rasmussen et CKI Williams et j'ai du mal à comprendre ce que signifie la distribution sur les fonctions . Dans le manuel, un exemple est donné, qu'il faut imaginer une fonction comme un vecteur très long (en fait, il …
Au fur et à mesure que nous explorons la littérature sur les réseaux de neurones , nous arrivons à identifier d'autres méthodes avec des topologies neuromorphiques (architectures de type "réseau de neurones"). Et je ne parle pas du théorème de l'approximation universelle . Des exemples sont donnés ci-dessous. Ensuite, cela …
En régression linéaire, nous faisons les hypothèses suivantes La moyenne de la réponse, , à chaque ensemble de valeurs des prédicteurs, , est une fonction linéaire des prédicteurs.E(Yi)E(Yi)E(Y_i)(x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) Les erreurs, εiεiε_i , sont indépendantes. Les erreurs, εiεiε_i , à chaque ensemble de valeurs des prédicteurs, (x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) , sont …
J'ai lu les livres les plus populaires en apprentissage statistique 1- Les éléments de l'apprentissage statistique. 2- Une introduction à l'apprentissage statistique . Les deux mentionnent que la régression de crête a deux formules qui sont équivalentes. Existe-t-il une preuve mathématique compréhensible de ce résultat? Je suis également passé par …
Cette question fait référence à l'article de Galit Shmueli "Expliquer ou prédire" . Plus précisément, dans la section 1.5, «Expliquer et prédire sont différents», le professeur Shmueli écrit: Dans la modélisation explicative, l'accent est mis sur la minimisation du biais pour obtenir la représentation la plus précise de la théorie …
Je n'ai pas trouvé de réponse satisfaisante à cela de Google . Bien sûr, si les données dont je dispose sont de l'ordre de millions, l'apprentissage en profondeur est la solution. Et j'ai lu que lorsque je n'ai pas de données volumineuses, il est peut-être préférable d'utiliser d'autres méthodes d'apprentissage …
Question: Quelles sont les principales différences et similitudes entre l'utilisation des erreurs types de Newey-West (1987) et de Hansen-Hodrick (1980)? Dans quelles situations faut-il privilégier l’un d’eux? Remarques: Je sais comment fonctionne chacune de ces procédures d'ajustement; cependant, je n'ai pas encore trouvé de document qui les comparerait, en ligne …
J'essaie d'apprendre à utiliser les réseaux de neurones. Je lisais ce tutoriel . Après avoir ajusté un réseau neuronal sur une série chronologique en utilisant la valeur en pour prédire la valeur en t + 1, l'auteur obtient le graphique suivant, où la ligne bleue est la série chronologique, le …
Dans mon projet, je souhaite créer un modèle de régression logistique pour prédire la classification binaire (1 ou 0). J'ai 15 variables, dont 2 sont catégoriques, tandis que les autres sont un mélange de variables continues et discrètes. Afin d'adapter un modèle de régression logistique, il m'a été conseillé de …
Des questions Cela dépend-il si l'arbre est peu profond ou profond? Ou peut-on dire cela indépendamment de la profondeur / des niveaux de l'arbre? Pourquoi le biais est-il faible et la variance élevée? Veuillez expliquer intuitivement et mathématiquement
Lors de l'exécution d'une ANOVA, on nous dit que certaines hypothèses du test doivent être présentes pour qu'il soit applicable aux données. Je n'ai jamais compris la raison pour laquelle les hypothèses suivantes étaient nécessaires au fonctionnement du test: La variance de votre variable dépendante (résidus) doit être égale dans …
Je pensais que le concept d'ensemble typique était assez intuitif: une séquence de longueur nnn appartiendrait à l'ensemble typique si la probabilité de sortie de la séquence était élevée. Donc, toute séquence qui serait probable serait dans . (J'évite la définition formelle liée à l'entropie parce que j'essaie de la …
La valeur attendue d'une distribution f(x)f(x)f(x) est la moyenne, c'est-à-dire la valeur moyenne pondérée E[x]=∫+∞−∞xf(x)dxE[x]=∫−∞+∞xf(x)dxE[x]=\int_{-\infty}^{+\infty} x \, \, f(x) dx La valeur la plus probable est le mode, c'est-à-dire la valeur la plus probable. Cependant, nous attendons-nous à voir nombreuses fois? Citant d' ici :E[x]E[x]E[x] Si les résultats ne sont …
À quel moment commençons-nous à classer les réseaux de neurones multicouches en tant que réseaux de neurones profonds ou à le dire autrement «Quel est le nombre minimum de couches dans un réseau neuronal profond?
En régression linéaire (perte au carré), en utilisant la matrice, nous avons une notation très concise pour l'objectif minimize ∥Ax−b∥2minimize ‖Ax−b‖2\text{minimize}~~ \|Ax-b\|^2 Où AAA est la matrice de données, xxx est les coefficients et bbb est la réponse. Existe-t-il une notation matricielle similaire pour l'objectif de régression logistique? Toutes les …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.