Un modèle de langage produit du texte en estimant, mot après mot, ce qui vient probablement ensuite. Il n’ouvre aucune base de connaissances, ne vérifie rien et ne sait pas ce qu’il ignore. Presque tous les comportements qui surprennent les utilisateurs découlent de cette architecture, y compris les plus gênants.
Ce thème ouvre le capot dans l’ordre : comment la prédiction fonctionne, ce que coûtent les trois étapes d’entraînement et ce que chacune apporte, pourquoi le découpage en tokens pénalise le français par rapport à l’anglais, ce que la fenêtre de contexte permet et interdit, et ce que les assistants conservent réellement d’une conversation à l’autre.