Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Dans de nombreuses applications de traitement du langage naturel telles que la correction d'orthographe, la traduction automatique et la reconnaissance vocale, nous utilisons des modèles de langage. Les modèles de langage sont généralement créés en comptant la fréquence à laquelle les séquences de mots (n-grammes) se produisent dans un grand …
Comment dois-je interpréter le terme d'interaction suivant de 2 prédicteurs continus dans la sortie d'un modèle de risques proportionnels de Cox? Le rapport de risque pour l'interaction de X et Y est> 1, ce qui signifie que son log (le coefficient d'origine) est 0-1 (~ 0,16). Les éléments individuels ont …
J'ai le problème suivant: Étant donné les entrées ( vecteur dimensionnel) des scalaires, les entiers ordonnés et les entiers non ordonnés (c.-à-d. Les étiquettes) et une ou plusieurs sorties , je voudrais estimer:Xxxnnnyyy Quelles entrées expliquent le mieux les sorties. Dans quelle mesure les variations d'une entrée impliquent des variations …
Existe-t-il un moyen d'utiliser la régression logistique pour classer les données multi-étiquetées? Par multi-étiqueté, je veux dire des données qui peuvent appartenir à plusieurs catégories simultanément. Je voudrais utiliser cette approche pour classer certaines données biologiques.
Je suis récemment entré dans le domaine de l'apprentissage automatique et un projet sur lequel je travaille m'oblige à regrouper les utilisateurs en fonction de l'ordre dans lequel ils ont visité les pages Web sur un site Web. J'ai des données sous forme de: ['user_id', 1, 2, 4, 6, 3, …
J'essaie d'adapter une distribution gamma inverse à trois paramètres à mes données en R ou en Python. Je voudrais le faire en utilisant l'estimation du maximum de vraisemblance (MLE). Le pdf du gamma inverse à trois paramètres est donné par: Où Γ est la fonction gamma, ρ est la forme, …
Après avoir recueilli des données, nous calculons le score de toute échelle de Likert (sommative) (précédemment identifiée comme facteur dans l'analyse factorielle) en additionnant les scores de chaque élément (et peut-être en divisant la somme par le nombre d'éléments pour obtenir le score moyen). Dans ce calcul, nous supposons que …
Je veux créer une prévision météo en utilisant les réseaux de neurones. Tous les exemples que j'ai vus n'utilisaient que des valeurs [-1,1] en entrée. Est-il également possible d'utiliser des valeurs plus grandes (comme la pression de l'air, le degré calcius des deux derniers jours, ...) comme entrées et d'obtenir …
Quelqu'un peut-il suggérer une bonne référence de révision (PDF en ligne nécessairement gratuit) pour rafraîchir les statistiques au niveau collégial? Je regarde quelque chose qui couvre généralement un premier cours de statistiques couvrant idéalement: Bases absolues (moyenne, variance, etc.) Grands échantillons Test de confiance Test d'hypothèse (normal, t, chi, F) …
Je sais ce qu'est un champ gaussien. Cependant, je ne sais pas trop ce que l'on entend par stationnaire. J'ai vu cette chose stationnaire à beaucoup d'endroits comme les processus autorégressifs stationnaires, etc., mais je ne sais pas vraiment ce que l'on entend par stationnaire.
J'ai supposé (c'est-à-dire je pense qu'on m'a enseigné, il y a plus longtemps que je ne me souviens) que les analyses de régression supposent qu'un échantillon est homogène. Si ce n'est pas le cas, la chose appropriée à faire est soit d'ajouter des variables fictives pour coder les différents groupes …
J'ai réalisé une expérience pour étudier la réponse d'une levure (qui contient 5000 gènes) au stress provoqué par un choc thermique. J'ai une liste de 48 gènes qui sont surexprimés à 37ºC et une autre liste de 145 gènes qui sont surexprimés à 42ºC. Il y a 38 gènes qui …
J'utilise ARMA sur un ensemble de données avec des échantillons manquants. Comment les traiter? Souhaitez-vous suggérer de faire une interpolation linéaire / non linéaire ou simplement de les garder à l'écart et de considérer deux échantillons avec des données manquantes entre les deux comme échantillons consécutifs?
J'ai obtenu les données, tracé la distribution des données et utilisé la fonction qqnorm, mais il semble que ne suit pas une distribution normale, alors quelle distribution dois-je utiliser pour décrire les données? Fonction de distribution cumulative empirique
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.