Machine learning types and training · Types d'apprentissage automatique et entraînement
| English | Français |
|---|---|
| machine learning/məˈʃiːn ˈlɜːnɪŋ/ | apprentissage automatique |
| backpropagation/ˌbækprəpəˈɡeɪʃn/ | rétropropagation |
| supervised learning/ˈsuːpəvaɪzd ˈlɜːnɪŋ/ | apprentissage supervisé |
| classification/ˌklæsɪfɪˈkeɪʃn/ | classification |
| unsupervised learning/ʌnˈsuːpəvaɪzd ˈlɜːnɪŋ/ | apprentissage non supervisé |
| clusters/ˈklʌstəz/ | clusters |
| reinforcement learning/ˌriːɪnˈfɔːsmənt ˈlɜːnɪŋ/ | apprentissage par renforcement |
| agent/ˈeɪdʒənt/ | agent |
| reward/rɪˈwɔːd/ | récompense |
| policy/ˈpɒlɪsi/ | politique |
| gradient descent/ˈɡreɪdɪənt dɪˈsent/ | descente de gradient |
| loss function/lɒs ˈfʌŋkʃn/ | fonction de perte |
| epoch/ˈiːpɒk/ | époque |
The program that taught itself an opening no human had played
- AlphaGo Zero was given the rules of Go and nothing else. No human games, no opening book, no advice. It played against itself, starting from random moves.
- In three days it surpassed the version that had beaten the world champion. Along the way it rediscovered centuries of human opening theory, and then discarded parts of it as inferior.
- It learned from a single number after each game: won or lost. That is a completely different kind of learning from being shown a million labelled photographs.
- This lesson is the three paradigms of machine learning, what data each needs, and how a network's weights are actually changed by backpropagation 反向传播.
Le programme qui s'est enseigné lui-même une ouverture que personne n'avait jouée
- AlphaGo Zero a reçu les règles du Go et rien d'autre. Aucun jeu humain, aucun livre d'ouvertures, aucun conseil. Il a joué contre lui-même, en commençant par des coups aléatoires.
- En trois jours, il a surpassé la version qui avait battu le champion du monde. Au passage, il a redécouvert des siècles de théorie des ouvertures humaines, puis éliminé certaines parties qu'il jugeait inférieures.
- Il a appris à partir d'un seul nombre après chaque partie : gagné ou perdu. C'est un type d'apprentissage totalement différent de celui qui consiste à montrer un million de photographies étiquetées.
- Cette leçon aborde les trois paradigmes du machine learning, les données dont chacun a besoin, et comment les poids d'un réseau changent réellement grâce à la backpropagation 反向传播.
Supervised learning
- Supervised learning 监督学习 trains on data that carries labels: photographs tagged "cat" or "dog", emails marked spam or not, houses with their sale prices.
- The model learns the mapping from input to label, and is then given inputs it has never seen and asked to produce the label.
- It splits into classification 分类, where the output is a category, and regression, where the output is a number.
- Its cost is the labels: someone must produce them, which for a million images is a great deal of human work.
Labelled examples in, a model out, then unlabelled inputs
Apprentissage supervisé
- Supervised learning 监督学习 s'entraîne sur des données portant des étiquettes : photographies tagguées « chat » ou « chien », e-mails marqués spam ou non, maisons avec leurs prix de vente.
- Le modèle apprend la correspondance de l'entrée vers l'étiquette, puis on lui donne des entrées qu'il n'a jamais vues et on lui demande de produire l'étiquette.
- Il se divise en classification 分类, où la sortie est une catégorie, et régression, où la sortie est un nombre.
- Son coût est les étiquettes : quelqu'un doit les produire, ce qui pour un million d'images représente énormément de travail humain.

Exemples étiquetés en entrée, modèle en sortie, puis entrées non étiquetées
Supervised learning uses: · L'apprentissage supervisé utilise :
Supervised learning trains on labelled examples (e.g. images tagged cat/dog). · L'apprentissage supervisé s'entraîne sur des exemples étiquetés (p. ex. images taguées chat/chien).
Unsupervised learning
- Unsupervised learning 无监督学习 is given data with no labels and asked to find structure in it.
- The commonest use is clustering: grouping into clusters 聚类 of similar items, such as customers who buy similar things, without anyone deciding in advance what the groups should be.
- That is its strength and its weakness: it can discover a grouping nobody suspected, and it cannot tell you what the grouping means.
Apprentissage non supervisé
- Unsupervised learning 无监督学习 reçoit des données sans étiquettes et est invité à en trouver la structure.
- L'utilisation la plus courante est le clustering : regrouper en clusters 聚类 d'articles similaires, comme des clients achetant des choses semblables, sans que personne ne décide à l'avance quelles doivent être les groupes.
- C'est sa force et sa faiblesse : il peut découvrir un groupement inattendu, mais il ne peut pas vous dire ce que ce groupement signifie.
Unsupervised learning is used to: · L'apprentissage non supervisé est utilisé pour :
With no labels, unsupervised learning discovers patterns/clusters in the data. · Sans étiquettes, l'apprentissage non supervisé découvre des motifs/clusters dans les données.
Reinforcement learning
- Reinforcement learning 强化学习 has an agent 智能体 acting in an environment. Each action changes the state and returns a reward 奖励, which may be zero for a long time.
- The agent learns a policy 策略, a strategy for choosing actions, that maximises its total reward over time. It learns by trial and error, with no labelled examples at all.
- It suits problems that are a sequence of decisions where the right move is only revealed by the eventual outcome: games, robot control, self-driving cars. That is exactly the AlphaGo Zero case.
Apprentissage par renforcement
- Reinforcement learning 强化 learning a un agent 智能体 agissant dans un environnement. Chaque action change l'état et retourne une récompense 奖励, qui peut rester nulle longtemps.
- L'agent apprend une politique 策略, une stratégie pour choisir des actions, qui maximise sa récompense totale sur le temps. Il apprend par essais et erreurs, sans aucun exemple étiqueté.
- Il convient aux problèmes qui sont une série de décisions où le bon coup n'est révélé que par le résultat final : jeux, contrôle robotique, voitures autonomes. C'est exactement le cas d'AlphaGo Zero.
In reinforcement learning, the agent learns by: · En apprentissage par renforcement, l'agent apprend en :
The agent tries actions, receives rewards, and learns a policy that maximises long-term reward. · L'agent essaie des actions, reçoit des récompenses, et apprend une politique qui maximise la récompense à long terme.
In reinforcement learning the agent learns a ____ that maximises its total reward over time. · En apprentissage par renforcement, l'agent apprend une ____ qui maximise sa récompense totale au fil du temps.
It learns by trial and error from rewards, with no labelled examples at all, which is why it suits sequences of decisions. · Il apprend par essais-erreurs à partir de récompenses, sans aucun exemple étiqueté, ce qui le rend adapté aux séquences de décisions.
Worked example: choose the paradigm
- Ten thousand medical scans, each labelled by a doctor as showing a tumour or not, are used to train a system to flag new scans. Supervised: the data has labels and the task is to learn input to label, specifically a classification.
- A shop wants to know whether its customers fall into natural groups, without deciding the groups in advance. Unsupervised: no labels exist, and the task is to find structure, specifically clustering.
- A robot arm must learn to place components, judged only by whether each attempt succeeded. Reinforcement: an agent, a sequence of actions, and a reward rather than a label.
- Name the paradigm, then justify from the data: labelled, unlabelled, or a reward signal.
Exemple résolu : choisir le paradigme
- Dix mille scans médicaux, chacun étiqueté par un médecin comme montrant une tumeur ou non, sont utilisés pour entraîner un système à signaler de nouveaux scans. Supervisé : les données ont des étiquettes et la tâche est d'apprendre l'entrée vers l'étiquette, spécifiquement une classification.
- Une boutique souhaite savoir si ses clients forment des groupes naturels, sans définir les groupes à l'avance. Non supervisé : aucune étiquette n'existe, et la tâche consiste à trouver une structure, spécifiquement le regroupement.
- Un bras robotique doit apprendre à placer des composants, jugé uniquement par la réussite de chaque tentative. Apprentissage par renforcement : un agent, une séquence d'actions et une récompense plutôt qu'une étiquette.
- Nommez le paradigme, puis justifiez à partir des données : étiquetées, non étiquetées ou un signal de récompense.
AI learning type lab · Laboratoire de type d'apprentissage IA
Classify AI examples by the type of learning or concern involved. · Classez les exemples d'IA selon le type d'apprentissage ou la préoccupation impliquée.
Match each ML paradigm to its data. · Associez chaque paradigme d'apprentissage automatique à ses données.
Supervised = labels; unsupervised = no labels; reinforcement = reward feedback. · Supervisé = étiquettes ; non supervisé = pas d'étiquettes ; par renforcement = feedback par récompense.
Match each situation to the machine-learning paradigm it needs. · Associez chaque situation au paradigme d'apprentissage automatique qu'elle nécessite.
Labels, no labels, or a reward. The data decides the paradigm, not the difficulty of the task. · Étiquettes, pas d'étiquettes, ou une récompense. Ce sont les données qui déterminent le paradigme, pas la difficulté de la tâche.
Training by backpropagation
- Training means adjusting the weights so the network's outputs match the targets. The method is backpropagation with gradient descent 梯度下降.
- Forward pass: feed an input through the network and get its output. Compute the error using a loss function 损失函数, which measures how far the output is from the target.
- Backward pass: propagate that error backwards through the layers to find each weight's gradient, that is, how much that weight contributed to the error.
- Update: change each weight by a small step against its gradient. The step size is the learning rate.
Downhill, one small step at a time
Entraînement par rétropropagation
- L'entraînement signifie ajuster les poids pour que les sorties du réseau correspondent aux cibles. La méthode est la rétropropagation avec la descente de gradient 梯度下降.
- Passe avant : faire passer une entrée dans le réseau et obtenir sa sortie. Calculer l'erreur en utilisant une fonction de perte 损失函数, qui mesure l'écart entre la sortie et la cible.
- Passe arrière : propager cette erreur vers l'arrière à travers les couches pour trouver le gradient de chaque poids, c'est-à-dire dans quelle mesure ce poids a contribué à l'erreur.
- Mise à jour : modifier chaque poids d'un petit pas dans la direction opposée à son gradient. L'amplitude du pas est le taux d'apprentissage.

En descente, un petit pas à la fois
Backpropagation trains a network by: · La rétropropagation entraîner un réseau en :
The error flows from the output back through the network (chain rule) so every weight's gradient is found, then weights step downhill. · L'erreur circule de la sortie vers l'arrière à travers le réseau (règle de la chaîne) afin que le gradient de chaque poids soit trouvé, puis les poids descendent en pente douce.
Put one round of backpropagation training in order. · Mettez en ordre un cycle d'entraînement par rétropropagation.
Forward, error, backward, update, repeated over many epochs until the error stops falling. · Avant, erreur, arrière, mise à jour, répété sur de nombreux époques jusqu'à ce que l'erreur cesse de diminuer.
Epochs, and why the learning rate matters
- One pass through the whole training set is an epoch 训练轮次. Training repeats for many epochs until the error stops falling.
- Too large a learning rate overshoots the minimum and the error jumps about; too small and training takes far longer than it needs to.
- After training, using the model is only a forward pass, which is why a trained network answers instantly even though training took days.
Époques, et pourquoi le taux d'apprentissage est important
- Une passe complète sur tout l'ensemble d'entraînement est une époque 训练轮次. L'entraînement se répète pendant de nombreuses époques jusqu'à ce que l'erreur cesse de diminuer.
- Un taux d'apprentissage trop grand dépasse le minimum et l'erreur fluctue ; trop petit, l'entraînement prend beaucoup plus de temps qu'il ne devrait.
- Après l'entraînement, utiliser le modèle ne nécessite qu'une passe avant, c'est pourquoi un réseau entraîné répond instantanément bien que l'entraînement ait pris des jours.
In gradient descent the learning rate sets how big a step each weight update takes — too large overshoots the minimum, too small makes training slow. · En descente de gradient, le taux d'apprentissage définit l'amplitude de chaque mise à jour de poids — trop grand, cela dépasse le minimum ; trop petit, cela ralentit l'entraînement.
Backpropagation finds each weight's gradient; the learning rate scales how far down that gradient the weight moves. · La rétropropagation trouve le gradient de chaque poids ; le taux d'apprentissage met à l'échelle la distance parcourue le long de ce gradient par le poids.
Which statements about training are correct? Select all · tout that apply. · Quelles affirmations concernant l'entraînement sont correctes ? Sélectionnez toutes celles qui s'appliquent.
The learning rate is the size of each weight update. That is why training can take days while a prediction takes milliseconds. · Le taux d'apprentissage est l'amplitude de chaque mise à jour de poids. C'est pourquoi l'entraînement peut prendre des jours tandis qu'une prédiction ne prend que des millisecondes.
Marks that slip away
- Justify a paradigm from the data: labelled means supervised, unlabelled means unsupervised, a reward signal means reinforcement.
- Reinforcement learning has no labels. Calling its reward a label is the classic confusion.
- Backpropagation is forward, error, backward, update, repeated. Naming only "it adjusts the weights" is half an answer.
- The learning rate is the size of each step, not the speed of training or the number of epochs.
Pièges qui font perdre des points
- Justifiez un paradigme à partir des données : étiqueté signifie supervisé, non étiqueté signifie non supervisé, un signal de récompense signifie apprentissage par renforcement.
- L'apprentissage par renforcement n'a pas d'étiquettes. Appeler sa récompense une étiquette est la confusion classique.
- La rétropropagation est passe avant, erreur, passe arrière, mise à jour, répétée. Nommmer seulement "il ajuste les poids" est une réponse incomplète.
- Le taux d'apprentissage est l'amplitude de chaque pas, pas la vitesse de l'entraînement ni le nombre d'époques.
You've got it
- supervised learns input to label from labelled data, for classification or regression · unsupervised finds structure such as clusters in unlabelled data · reinforcement has an agent learning a policy from rewards by trial and error
- choose the paradigm from what the data provides, not from the task's difficulty
- backpropagation: a forward pass, an error from the loss function, a backward pass giving each weight's gradient, then an update of size set by the learning rate
- training repeats for many epochs; using the trained model is one forward pass
Vous avez compris
- supervisé apprend l'entrée vers l'étiquette à partir de données étiquetées, pour la classification ou la régression · non supervisé trouve une structure comme des groupes dans des données non étiquetées · par renforcement a un agent apprenant une politique à partir de récompenses par essai-erreur
- choisissez le paradigme selon ce que les données fournissent, pas selon la difficulté de la tâche
- rétropropagation : une passe avant, une erreur de la fonction de perte, une passe arrière donnant le gradient de chaque poids, puis une mise à jour dont l'amplitude est définie par le taux d'apprentissage
- l'entraînement se répète pendant de nombreuses époques ; utiliser le modèle entraîné est une seule passe avant