Questions marquées «neural-networks»

Les réseaux de neurones artificiels (RNA) sont une large classe de modèles de calcul librement basés sur des réseaux de neurones biologiques. Ils englobent les NN à action directe (y compris les NN "profonds"), les NN convolutifs, les NN récurrents, etc.

1
Comment gérer la modification de la longueur du vecteur d'entrée avec les réseaux de neurones
Je veux former un réseau neuronal avec une séquence de caractères comme vecteur d'entrée. Les exemples d'apprentissage ont une longueur différente et pour cette raison, je ne sais pas comment les représenter. Disons que j'ai deux exemples de séquences, voici des noms: john doe maurice delanoe Le premier exemple est …

1
Surajustement du réseau neuronal
J'ai appris qu'un sur-ajustement peut être détecté en traçant l'erreur d'apprentissage et l'erreur de test en fonction des époques. Comme dans: J'ai lu ce blog où ils disent que le réseau neuronal, net5 est trop adapté et ils fournissent ce chiffre: Ce qui est étrange pour moi, car l'erreur de …

2
Divergence contrastée persistante pour les RBM
Lorsque nous utilisons l'algorithme d'apprentissage de CD persistant pour les machines Bolzmann restreintes, nous commençons notre chaîne d'échantillonnage Gibbs dans la première itération à un point de données, mais contrairement au CD normal, dans les itérations suivantes, nous ne recommençons pas sur notre chaîne. Au lieu de cela, nous commençons …



1
Définition de la fonction softmax
Cette question fait suite à stats.stackexchange.com/q/233658 Le modèle de régression logistique pour les classes {0, 1} est P(y=1|x)=exp(wTx)1+exp(wTx)P(y=0|x)=11+exp(wTx)P(y=1|x)=exp⁡(wTx)1+exp⁡(wTx)P(y=0|x)=11+exp⁡(wTx) \mathbb{P} (y = 1 \;|\; x) = \frac{\exp(w^T x)}{1 + \exp(w^T x)} \\ \mathbb{P} (y = 0 \;|\; x) = \frac{1}{1 + \exp(w^T x)} Clairement, ces probabilités sont à 1. En définissant …


3
Le théorème d'approximation universel pour les réseaux de neurones vaut-il pour une fonction d'activation?
Le théorème d'approximation universel pour les réseaux de neurones s'applique-t-il à une fonction d'activation (sigmoïde, ReLU, Softmax, etc ...) ou est-il limité aux fonctions sigmoïdes? Mise à jour: Comme le souligne shimao dans les commentaires, cela ne vaut absolument pour aucune fonction. Alors, pour quelle classe de fonctions d'activation tient-il?



1
Pourquoi sqrt (6) est-il utilisé pour calculer epsilon pour l'initialisation aléatoire des réseaux de neurones?
Dans la semaine 5 notes de cours pour Coursera machine de classe d' apprentissage Andrew Ng , la formule suivante est donnée pour le calcul de la valeur de utilisé pour initialiser avec des valeurs aléatoires:ϵϵ\epsilonΘΘ\Theta Dans l' exercice , des précisions sont apportées: Une stratégie efficace pour choisir ϵinitϵinit\epsilon_{init} …




2
Existe-t-il des moyens de gérer le gradient de fuite pour les non-linéarités saturantes qui n'impliquent pas la normalisation par lots ou les unités ReLu?
Je voulais former un réseau avec des non-linéarités qui souffrent de la disparition (ou du problème de gradient explosif mais principalement de la disparition). Je sais que la méthode standard (actuelle) consiste à utiliser la normalisation par lots 1 [BN] 1 ou simplement à abandonner la non-linéarité et à utiliser …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.