Découpage en jetons (le modèle ne voit jamais des mots, mais des morceaux) :
Les mots suivants les plus probables, d'après les textes appris :
Texte généré (chaque mot est tiré au sort selon ces probabilités) :
Ce modèle a appris sur 60 phrases. Un grand modèle de langage fait exactement la même opération, avec des milliers de milliards de mots et une mémoire du contexte beaucoup plus longue. Le texte généré est fluide. Il n'est pas vrai : rien dans la mécanique ne vérifie quoi que ce soit. Température basse : le mot le plus probable, toujours ; haute : plus de variété, plus d'absurdités.